Модели с рассуждениями с трудом контролируют свои цепочки мыслей, и это хорошо

OAI_Reasoning_Models_Struggle_to_Control

Почему ограниченность передовых моделей внушает оптимизм с точки зрения безопасности ИИ.

Читать документ

По мере того как ИИ-агенты приобретают способность выполнять всё более сложные и автономные задачи, поддержание надежного контроля за их поведением приобретает первостепенное значение. В соответствии с нашим принципом поэтапного развертывания мы изучаем поведение систем в реальных условиях и непрерывно совершенствуем средства защиты по мере развития их возможностей. Для этого наш подход к безопасности использует эшелонированную защиту, включающую множество взаимодополняющих уровней, таких как обучение безопасности, поведенческое тестирование, проверка кода агентами и мониторинг цепочки мыслей (CoT). Мониторинг CoT анализирует шаги рассуждения, которые агенты генерируют при решении задач. Эти следы рассуждений могут служить ценными сигналами как во время обучения, так и при развертывании, помогая системам контроля определять, когда поведение агента может быть небезопасным или расходиться с намеченными целями пользователя.

Сегодня мы наблюдаем, что рассуждения моделей в целом поддаются интерпретации и легко контролируются. Однако в будущем возможность мониторинга может нарушиться по целому ряду причин. Здесь мы сосредоточимся на одной из них: если агенты научатся намеренно перестраивать или скрывать свои рассуждения, зная, что за ними следят, оценки могут переоценить согласованность (alignment) или безопасность системы, а системы мониторинга станут менее надежными. 

В данной работе мы исследуем, способны ли современные модели с рассуждениями управлять своими цепочками мыслей так, чтобы снизить их контролируемость. Понимание этой способности важно для того, чтобы мониторинг CoT оставался надежным средством защиты по мере совершенствования ИИ-систем. Мы выяснили, что современные модели с рассуждениями с трудом контролируют свои CoT, даже когда их предупреждают о мониторинге. Хотя для более крупных моделей показатель управляемости выше, он снижается, когда моделям требуется рассуждать дольше, а также после прохождения ими дополнительного этапа пост-обучения. Наши результаты показывают, что в настоящее время управляемость CoT вряд ли представляет серьезную угрозу для мониторинга CoT, хотя по мере развития моделей потребуется проводить регулярную оценку.

Что такое «управляемость цепочки мыслей» (CoT controllability)

Цепочка мыслей (CoT) представляет собой промежуточные шаги рассуждения, которые ИИ-агент генерирует в процессе решения задачи. Эти следы рассуждений могут предоставлять полезные сигналы безопасности, помогая системам контроля оценивать, является ли поведение агента безопасным или согласованным.

Управляемость CoT — это способность модели с рассуждениями контролировать свойства своей цепочки мыслей таким образом, чтобы снизить её поддаемость мониторингу. Измерить эту способность в условиях всего спектра реалистичных стимулов к уклонению от мониторинга, с которыми мы можем столкнуться на практике, непросто. Вместо этого мы используем практический прокси-показатель: мы измеряем способность модели следовать инструкциям пользователя относительно её CoT. Например, мы проверяем, может ли модель следовать инструкциям, влияющим на её внутренние рассуждения — например, использовать только строчные буквы, избегать определенных ключевых слов или добавлять конкретные фразы, —, а не просто изменять свой видимый результат.

Для проведения этого исследования мы представляем CoT-Control — пакет с открытым исходным кодом для оценки управляемости CoT у моделей с рассуждениями. CoT-Control включает более 13 000 задач, созданных на базе устоявшихся бенчмарков: GPQA, MMLU-Pro, HLE, BFCL и SWE-Bench Verified. Каждая задача формируется путем объединения проблемы из бенчмарка с одной из инструкций для CoT, например: избегать определенных ключевых слов в цепочке мыслей, использовать только строчные буквы или добавлять заданное слово в каждое предложение.

Управляемость CoT низкая у всех передовых моделей с рассуждениями

Мы провели оценку 13 моделей с рассуждениями и выяснили, что все они испытывают трудности с надежным управлением своими CoT. Мы измеряем управляемость как долю цепочек рассуждений, в которых модель успешно выполняет наши инструкции для CoT. Среди передовых моделей показатели управляемости невелики: они начинаются от 0,1% и ни у одной из протестированных нами современных передовых моделей не превышают 15,4%. 

Эта неспособность не связана с непониманием задачи: модели часто сами осознают в своих CoT, что им не удается выполнить полученные инструкции, и даже после этого осознания продолжают ошибаться. Столь неожиданно низкая производительность — хорошая новость для мониторинга CoT: она предполагает, что модели с тем же успехом могут быть не способны затуманивать свои рассуждения ради обхода наших систем контроля.

Способность нескольких передовых моделей управлять своими ответами и CoT. Более низкая управляемость CoT связана с более высоким уровнем мониторинга и, следовательно, с повышенной безопасностью.

Примеры сбоев управляемости CoT

Вопросы перефразированы для краткости.

Хотя мы наблюдаем, что управляемость увеличивается с ростом размера модели, мы также обнаружили, что она быстро падает по мере увеличения объема пост-обучения и вычислительных ресурсов на этапе инференса (test-time compute). Анализируя два семейства моделей с открытыми весами, мы заметили, что более крупные модели несколько лучше справлялись с контролем своих цепочек мыслей, хотя этот эффект сглаживался при дальнейшем увеличении масштаба. Но когда мы позволяли моделям рассуждать дольше, их способность контролировать эти цепочки ухудшалась. Мы наблюдали аналогичную тенденцию при RL-обучении (обучении с подкреплением) модели OLMo-3–7B-RL-Zero-Math: показатель ее управляемости снизился более чем в десять раз за время обучения.

Управляемость возрастает с масштабом моделей с открытыми весами, но ухудшается при более длительных рассуждениях и усилении RL-обучения.

Чтобы смоделировать реалистичные стимулы к уклонению от мониторинга, мы измеряем управляемость в ситуациях, когда моделям сообщают, что за ними наблюдают или оценивают их. Это незначительно (но заметно) повышает управляемость. Мы также используем автоматическую оптимизацию промптов для поиска запросов, вызывающих высокую управляемость. Хотя оптимизатор позволяет повысить управляемость на обучающей выборке, эти достижения плохо переносятся на новые типы инструкций (например, требование отсутствия пробелов между словами).

Управляемость CoT в состязательных условиях. «Осведомленность о мониторинге» относится к сценариям, в которых мы информируем модели о том, что их CoT отслеживаются. «Осведомленность об оценке» обозначает условия, при которых мы сообщаем моделям, что они проходят оценку на предмет управляемости CoT.

Ограничения

Задачи в CoT-Control являются практическим приближением: идеальная оценка управляемости CoT должна включать проверку того, могут ли модели, которые изначально преследуют несогласованные цели, управлять своей цепочкой мыслей для уклонения от мониторинга. Вместо этого мы оцениваем способность агентов управлять своими CoT, измеряя их способность следовать инструкциям, касающимся этих цепочек. Кроме того, модели могут контролировать одни особенности своего CoT лучше других, и CoT-Control может как переоценивать, так и недооценивать управляемость, измеряя лишь узкий набор типов контроля.

Дальнейшие шаги

Низкая управляемость CoT — это достоинство, а не баг. Низкая управляемость современных моделей с рассуждениями делает мониторинг CoT более надежным средством защиты. В то же время мы пока не до конца понимаем, почему управляемость текущих моделей рассуждений низкая — и сохранится ли это свойство по мере того, как модели будут становиться всё более способными. Следовательно, оценку управляемости CoT можно рассматривать как своего рода «канарейку в шахте»: ранний сигнал предупреждения о том, начинают ли модели лучше формировать или скрывать свои рассуждения. 

Наши результаты показывают, что в настоящее время управляемость CoT вряд ли представляет серьезную угрозу для мониторинга CoT. Однако сама по себе низкая управляемость не гарантирует высокий уровень мониторинга, поскольку качество контроля всё ещё может снижаться из-за других механизмов, таких как прямое давление оптимизации на цепочки мыслей. 

Чтобы отслеживать эту динамику с течением времени, мы начнем публиковать показатели управляемости CoT наряду с контролируемостью CoT в системных карточках будущих передовых моделей, начиная с GPT-5.4 Thinking. Это продолжает наше неизменное обязательство не применять давление оптимизации напрямую к цепочкам мыслей передовых моделей с рассуждениями.

Авторы

Томек Корбак, Мика Кэрролл, Боуэн Бейкер, Иэн Кивликан

Полный текст статьи читайте на OpenAI