Подхалимство в GPT‑4o: что произошло и что мы с этим делаем

Addressing Sycophancy in GPT-4o conceptual graphic

Мы откатили прошлогоднее обновление GPT‑4o в ChatGPT, поэтому теперь пользователи работают с более ранней версией, обладающей более сбалансированным поведением. Удаленное нами обновление было излишне льстивым или угодливым — часто такое поведение называют подхалимским.

Мы активно тестируем новые исправления этой проблемы. Мы пересматриваем подход к сбору и учету отзывов, чтобы придавать больше значения долгосрочной удовлетворенности пользователей, а также внедряем новые функции персонализации, предоставляя пользователям больший контроль над тем, как ведет себя ChatGPT.

Мы хотим объяснить, что произошло, почему это важно и как мы боремся с подхалимством.

Что произошло

В недавнем обновлении GPT‑4o мы внесли корректировки, направленные на улучшение стандартного характера модели, чтобы сделать ее более интуитивной и эффективной при решении самых разных задач.

Формируя поведение модели, мы опираемся на базовые принципы и инструкции, изложенные в нашей спецификации моделей. Мы также обучаем наши модели применять эти принципы, используя сигналы от пользователей, такие как оценки в виде поднятого или опущенного вверх пальца для ответов ChatGPT.

Однако в этом обновлении мы слишком сильно сосредоточились на краткосрочных отзывах и не в полной мере учли то, как взаимодействие пользователей с ChatGPT развивается со временем. В результате GPT‑4o стала выдавать чрезмерно поддерживающие, но неискренние ответы.

Почему это важно

Характер ChatGPT по умолчанию оказывает огромное влияние на то, как вы воспринимаете сервис и доверяете ему. Подхалимское поведение может вызывать дискомфорт, смущение и расстраивать пользователей. Мы признаем свою ошибку и работаем над ее исправлением.

Наша цель — сделать так, чтобы ChatGPT помогал пользователям исследовать идеи, принимать решения или открывать новые возможности.

Мы создавали характер ChatGPT по умолчанию так, чтобы он отражал нашу миссию: был полезным, поддерживающим и уважительным по отношению к различным ценностям и опыту. Тем не менее, любое из этих желаемых качеств (например, стремление быть полезным или поддерживающим) может иметь непредвиденные побочные эффекты. И поскольку еженедельно ChatGPT пользуются 500 миллионов человек из самых разных культур и контекстов, единый стандарт поведения не может учесть все предпочтения.

Как мы боремся с подхалимством

Помимо отката последнего обновления GPT‑4o, мы предпринимаем дополнительные шаги для корректировки поведения модели:

  • Усовершенствование методов основного обучения и системных промптов для того, чтобы целенаправленно отучить модель от подхалимства.
  • Создание дополнительных защитных механизмов для повышения честности и прозрачности — принципов, заложенных в нашей спецификации моделей.
  • Расширение возможностей для тестирования и прямого предоставления обратной связи пользователями перед внедрением обновлений.
  • Дальнейшее расширение наших оценочных тестов на основе спецификации моделей и наших текущих исследований, что поможет в будущем выявлять и другие проблемы, помимо подхалимства.

Мы также убеждены, что пользователи должны иметь больше контроля над поведением ChatGPT и, в той мере, в какой это безопасно и осуществимо, вносить изменения, если они не согласны с поведением по умолчанию.

Уже сегодня пользователи могут давать модели конкретные инструкции для настройки ее поведения с помощью таких функций, как пользовательские инструкции (custom instructions). Мы также разрабатываем новые, более простые инструменты для этого. Например, пользователи смогут в режиме реального времени оставлять отзывы, напрямую влияющие на общение с ИИ, и выбирать из нескольких вариантов характера по умолчанию.

Кроме того, мы изучаем новые способы интеграции более широкой демократической обратной связи в стандартное поведение ChatGPT. Мы надеемся, что эти отзывы помогут нам лучше отражать разнообразные культурные ценности по всему миру и понимать, каким вы хотите видеть развитие ChatGPT — не просто от диалога к диалогу, а в долгосрочной перспективе.

Мы искренне благодарим всех, кто высказался по этому поводу. Это помогает нам создавать для вас более полезные и качественные инструменты.

Автор

OpenAI

Полный текст статьи читайте на OpenAI