Подхалимство в GPT‑4o: что произошло и что мы с этим делаем

Мы откатили прошлогоднее обновление GPT‑4o в ChatGPT, поэтому теперь пользователи работают с более ранней версией, обладающей более сбалансированным поведением. Удаленное нами обновление было излишне льстивым или угодливым — часто такое поведение называют подхалимским.
Мы активно тестируем новые исправления этой проблемы. Мы пересматриваем подход к сбору и учету отзывов, чтобы придавать больше значения долгосрочной удовлетворенности пользователей, а также внедряем новые функции персонализации, предоставляя пользователям больший контроль над тем, как ведет себя ChatGPT.
Мы хотим объяснить, что произошло, почему это важно и как мы боремся с подхалимством.
Что произошло
В недавнем обновлении GPT‑4o мы внесли корректировки, направленные на улучшение стандартного характера модели, чтобы сделать ее более интуитивной и эффективной при решении самых разных задач.
Формируя поведение модели, мы опираемся на базовые принципы и инструкции, изложенные в нашей спецификации моделей. Мы также обучаем наши модели применять эти принципы, используя сигналы от пользователей, такие как оценки в виде поднятого или опущенного вверх пальца для ответов ChatGPT.
Однако в этом обновлении мы слишком сильно сосредоточились на краткосрочных отзывах и не в полной мере учли то, как взаимодействие пользователей с ChatGPT развивается со временем. В результате GPT‑4o стала выдавать чрезмерно поддерживающие, но неискренние ответы.
Почему это важно
Характер ChatGPT по умолчанию оказывает огромное влияние на то, как вы воспринимаете сервис и доверяете ему. Подхалимское поведение может вызывать дискомфорт, смущение и расстраивать пользователей. Мы признаем свою ошибку и работаем над ее исправлением.
Наша цель — сделать так, чтобы ChatGPT помогал пользователям исследовать идеи, принимать решения или открывать новые возможности.
Мы создавали характер ChatGPT по умолчанию так, чтобы он отражал нашу миссию: был полезным, поддерживающим и уважительным по отношению к различным ценностям и опыту. Тем не менее, любое из этих желаемых качеств (например, стремление быть полезным или поддерживающим) может иметь непредвиденные побочные эффекты. И поскольку еженедельно ChatGPT пользуются 500 миллионов человек из самых разных культур и контекстов, единый стандарт поведения не может учесть все предпочтения.
Как мы боремся с подхалимством
Помимо отката последнего обновления GPT‑4o, мы предпринимаем дополнительные шаги для корректировки поведения модели:
- Усовершенствование методов основного обучения и системных промптов для того, чтобы целенаправленно отучить модель от подхалимства.
- Создание дополнительных защитных механизмов для повышения честности и прозрачности — принципов, заложенных в нашей спецификации моделей.
- Расширение возможностей для тестирования и прямого предоставления обратной связи пользователями перед внедрением обновлений.
- Дальнейшее расширение наших оценочных тестов на основе спецификации моделей и наших текущих исследований, что поможет в будущем выявлять и другие проблемы, помимо подхалимства.
Мы также убеждены, что пользователи должны иметь больше контроля над поведением ChatGPT и, в той мере, в какой это безопасно и осуществимо, вносить изменения, если они не согласны с поведением по умолчанию.
Уже сегодня пользователи могут давать модели конкретные инструкции для настройки ее поведения с помощью таких функций, как пользовательские инструкции (custom instructions). Мы также разрабатываем новые, более простые инструменты для этого. Например, пользователи смогут в режиме реального времени оставлять отзывы, напрямую влияющие на общение с ИИ, и выбирать из нескольких вариантов характера по умолчанию.
Кроме того, мы изучаем новые способы интеграции более широкой демократической обратной связи в стандартное поведение ChatGPT. Мы надеемся, что эти отзывы помогут нам лучше отражать разнообразные культурные ценности по всему миру и понимать, каким вы хотите видеть развитие ChatGPT — не просто от диалога к диалогу, а в долгосрочной перспективе.
Мы искренне благодарим всех, кто высказался по этому поводу. Это помогает нам создавать для вас более полезные и качественные инструменты.
Автор
Полный текст статьи читайте на OpenAI
