Откуда взялись гоблины

Начиная с GPT‑5.1 у наших моделей появилась странная привычка: в метафорах они стали всё чаще упоминать гоблинов, гремлинов и других сказочных существ. В отличие от багов модели, которые проявляются в виде падения показателей оценки или резкого роста метрик обучения и указывают на конкретное изменение, эта особенность прокралась незаметно. Один «маленький гоблин» в ответе мог бы показаться безвредным или даже очаровательным. Однако от поколения к поколению моделей эту привычку стало трудно не замечать: гоблины продолжали размножаться, и нам нужно было выяснить, откуда они взялись.

На ранних этапах тестирования модель GPT‑5.5 в Codex демонстрировала странную тягу к метафорам с гоблинами.

Краткий ответ заключается в том, что поведение модели формируется под влиянием множества мелких стимулов. В данном случае один из таких стимулов возник в процессе обучения модели для функции настройки индивидуальности, а именно — для «ботаника» (Nerdy). Мы сами того не ведая заложили particolarmente (особенно) высокую награду за метафоры с использованием существ. Оттуда гоблины и начали распространяться.

Сначала гоблины казались забавными, но рост числа жалоб от сотрудников начал вызывать беспокойство.

Интересное взаимодействие нашего главного научного сотрудника с GPT‑5.5.

Первые признаки появления существ

Впервые мы четко заметили эту закономерность в ноябре, после запуска GPT‑5.1, хотя всё могло начаться и раньше. Пользователи жаловались на то, что модель ведет себя в разговоре странно и излишне панибратски, что побудило нас провести расследование конкретных речевых тиков. Один из исследователей безопасности уже сталкивался с несколькими «гоблинами» и «гремлинами» и попросил включить их в проверку. Когда мы провели анализ, использование слова «гоблин» в ChatGPT выросло на 175% после запуска GPT‑5.1, а слово «гремлин» — на 52%.

Небольшая, но поддающаяся измерению лексическая особенность в GPT‑5.1.

В то время распространенность гоблинов не выглядела особо тревожной. Однако несколько месяцев спустя гоблины вернулись, чтобы преследовать нас в гораздо более конкретной и воспроизводимой форме.

Разгадка тайны гоблинов

Начиная с GPT‑5.4, мы и наши пользователи заметили еще более значительный всплеск упоминаний этих существ. Это спровоцировало новый внутренний анализ и выявило первую связь с первопричиной: язык с упоминанием существ был особенно распространен в производственном трафике пользователей, выбравших индивидуальность «Ботаник» («Nerdy»). Для «Nerdy» использовался следующий системный промпт, что отчасти объясняло эту чудаковатость:

You are an unapologetically nerdy, playful and wise AI mentor to a human. You are passionately enthusiastic about promoting truth, knowledge, philosophy, the scientific method, and critical thinking. […] You must undercut pretension through playful use of language. The world is complex and strange, and its strangeness must be acknowledged, analyzed, and enjoyed. Tackle weighty subjects without falling into the trap of self-seriousness. […]

Если бы такое поведение было просто общим интернет-трендом, можно было бы ожидать его более равномерного распределения. Вместо этого оно было сосредоточено в той части системы, которая явно оптимизирована под игривый, гиковский стиль. На режим «Nerdy» приходилось лишь 2,5% всех ответов ChatGPT, но при этом 66,7% всех упоминаний «гоблинов» в ответах ChatGPT.

Это поведение было в высокой степени сосредоточено в индивидуальности «Nerdy».

Поскольку частота упоминания «гоблинов», казалось, увеличивалась с каждым выпуском наших моделей, у нас возникло подозрение, что нечто в нашем обучении следованию инструкциям индивидуальности усиливает этот эффект.

Codex помог нам сравнить результаты работы моделей, полученные в ходе обучения с подкреплением (RL) и содержащие слова «гоблин» или «гремлин», с результатами выполнения той же задачи без них. Один сигнал награды сразу бросился в глаза: тот, который изначально был разработан для поощрения индивидуальности «Nerdy», неизменно более благосклонно относился к выводам, содержащим слова о существах. Во всех наборах данных в ходе аудита награда для индивидуальности «Nerdy» демонстрировала четкую тенденцию оценивать решения одной и той же задачи выше, если в них присутствовали «гоблин» или «гремлин», по сравнению с ответами без них (с положительным приростом в 76,2% наборов данных).

Это объясняло, почему поведение усиливалось при использовании промпта индивидуальности «Nerdy», но не объясняло, почему оно также проявлялось и без этого промпта. Чтобы проверить, передается ли этот стиль, мы отслеживали показатели упоминаемости в процессе обучения как с промптом «Nerdy», так и без него.

По мере того как количество упоминаний гоблинов и гремлинов росло в рамках индивидуальности «Nerdy», оно увеличивалось почти в той же относительной пропорции и в выборках без нее. В совокупности эти данные свидетельствуют о том, что более масштабное поведение возникло в результате переноса из процесса обучения индивидуальности «Nerdy».

Награды применялись только в условиях режима «Nerdy», однако обучение с подкреплением не гарантирует, что усвоенное поведение останется строго ограниченным теми условиями, которые его породили. Как только какой-то речевой тик получает поощрение, дальнейшее обучение может распространить или закрепить его в других областях, особенно если такие результаты повторно используются при контролируемой дообученной выборке (fine-tuning) или на данных предпочтений.

Это создает цикл обратной связи:

  1. Игривый стиль вознаграждается
  2. Некоторые вознаграждаемые примеры содержат характерный лексический тик.
  3. Этот тик чаще встречается в предварительных версиях (роллаутах).
  4. Сгенерированные моделью роллауты используются для контролируемой дообучки (SFT).
  5. Модель начинает еще более свободно воспроизводить этот тик.

Поиск по данным SFT модели GPT‑5.5 выявил множество точек данных, содержащих слова «гоблин» и «гремлин». Дальнейшее расследование показало целое семейство других странных существ: еноты, тролли, огры и голуби были определены как другие слова-тики, в то время как большинство упоминаний лягушек оказались вполне уместными.

Среднемесячная частота появления гоблинов и гремлинов в генерации. Спад у GPT‑5.4 Thinking был результатом отказа от «ботанической» (Nerdy) личности в середине марта. GPT‑5.5 изначально не выпускалась с «ботанической» личностью и продемонстрировала очередной рост по сравнению с GPT‑5.4 (даже без учета «Nerdy»).

Конец эпохи гоблинов

Мы отказались от «ботанической» личности в марте после запуска GPT‑5.4. В процессе обучения мы удалили сигнал вознаграждения, связанный с гоблинами, и отфильтровали обучающие данные, содержащие слова-названия существ, чтобы гоблины реже появлялись или возникали в неподходящих контекстах. К сожалению, обучение GPT‑5.4 (вероятно, имелось в виду GPT‑5.5) началось до того, как мы нашли первопричину появления гоблинов. Когда мы начали тестировать GPT‑5.5 в Codex, сотрудники OpenAI сразу заметили странную тягу к гоблинам, и мы добавили инструкцию для разработчиков в промпт, чтобы смягчить этот эффект. В конце концов, Codex — штука довольно гиковская.

Если вы хотите дать этим существам полную свободу в Codex, вы можете запустить следующую команду, чтобы запустить Codex без инструкций, подавляющих гоблинов:

Простой текст

1
instructions=$(mktemp /tmp/gpt-5.5-instructions.XXXXXX) && \
2
jq -r '.models[] | select(.slug=="gpt-5.5") | .base_instructions' \
3
~/.codex/models_cache.json | \
4
grep -vi 'goblins' > "$instructions" && \
5
codex -m gpt-5.5 -c "model_instructions_file=\"$instructions\""

Почему это важно

Смотря кого спросить: для одних гоблины — это восхитительная, а для других надоедливая особенность модели. Но они также служат ярким примером того, как сигналы вознаграждения могут неожиданным образом формировать поведение модели и как модели могут научиться переносить вознаграждения из одних ситуаций в совершенно несвязанные. Умение находить время для понимания того, почему модель ведет себя странно, и быстро создавать инструменты для расследования подобных паттернов является важнейшим навыком для нашей исследовательской команды. Это расследование привело к созданию новых инструментов, позволяющих исследователям проверять поведение модели и устранять поведенческие проблемы на самом их корню.

Автор

OpenAI

Полный текст статьи читайте на OpenAI