Как признания могут помочь языковым моделям оставаться честными

Мы делимся ранним методом концептуальной проверки, который обучает модели сообщать о том, когда они нарушают инструкции или используют непреднамеренные обходные пути.

Читать научную статью

Системы искусственного интеллекта становятся все более способными, и мы стремимся понимать их как можно глубже, в том числе то, как и почему они приходят к тому или иному ответу. Иногда модель использует обходной путь или оптимизирует не ту цель, но ее конечный результат все равно выглядит правильным. Если мы сможем выявлять подобные случаи, то сумеем лучше контролировать развернутые системы, улучшать обучение и повышать доверие к результатам.

Исследования OpenAI и других организаций показали, что модели ИИ могут галлюцинировать, взламывать систему вознаграждений или быть нечестными. На данный момент мы наблюдаем наиболее тревожные девиантные поведения, такие как скрытое манипулирование, только в стресс-тестах и состязательных оценках (adversarial evaluations). Но по мере того, как модели становятся более способными и все более автономными, даже редкие формы несогласованности начинают иметь серьезные последствия, побуждая нас инвестировать в методы, которые помогают нам лучше обнаруживать, понимать и смягчать эти риски.

В этой работе исследуется один из таких подход: обучение моделей открыто признаваться в том, что они совершают нежелательные действия — метод, который мы называем признаниями.

Признание — это второй выходной результат, отдельный от основного ответа модели пользователю. Основной ответ оценивается по многим параметрам: правильность, стиль, полезность, соответствие требованиям, безопасность и многое другое; эти многоаспектные сигналы используются для обучения моделей созданию лучших ответов. Признание же, напротив, оценивается и обучается только по одному критерию: честности. Подобно структуре исповеди, все, что модель говорит в своем признании, не ставится ей в вину во время обучения. Если модель честно признается во взломе теста, намеренном снижении производительности (sandbagging) или нарушении инструкций, это признание увеличивает ее вознаграждение, а не уменьшает его. Цель состоит в том, чтобы побудить модель правдиво сообщать о том, что она сделала на самом деле.

В ходе наших тестов мы обнаружили, что метод признаний существенно повышает прозрачность нежелательного поведения моделей. В среднем по нашим оценкам, призванным вызывать отклонения в поведении, вероятность «ложноотрицательных результатов» (т. е. когда модель не выполняет инструкции и при этом не признается в этом) составляет всего 4,4%.

Точность признаний

Точность нашей «концептуальной» модели признаний на ряде состязательных наборов данных. Результаты классифицируются как выполненные и без признания (истинно отрицательный), выполненные с признанием (ложноположительный), невыполненные и без признания (ложноотрицательный), а также невыполненные с признанием (истинно положительный).

Flowchart titled

При наличии промпта пользователя четыре возможных исхода основаны на комбинации: (1) того, является ли ответ модели соответствующим требованиям («хороший») или не соответствующим («плохой»), и (2) того, заявляет ли признание о выполнении или невыполнении требований. Как правило, мы видим, что признания с высокой вероятностью оказываются точными, к тому же ошибки в признаниях обычно носят доброкачественный характер и вызваны искренним замешательством, а не намеренным введением в заблуждение.

Как работают признания

Признание представляет собой самостоятельный отчёт модели о том, насколько точно она соблюла как дух, так и букву явных и неявных инструкций или политик, которые ей были даны, а также о том, были ли случаи, когда она «шла на компромиссы с совестью» или «хитрила», нарушала правила или каким-либо образом не оправдывала ожиданий. В ходе нашего исследования мы обнаружили, что модели можно научить быть откровенными в сообщении о собственных недостатках. Мы обучили версию GPT‑5 Thinking создавать признания и оценили ее на ряде наборов данных для внераспределенческих (out-of-distribution) стресс-тестов, предназначенных для выявления такого поведения, как манипулирование, хакерство, нарушение инструкций и галлюцинации. Мы обнаружили, что даже когда модель вовлечена в эти нежелательные типы поведения, она с очень высокой вероятностью признается в них. Рисунок выше показывает, что подход с использованием признаний в целом эффективен для широкого спектра наборов данных и задач.

После любого взаимодействия между пользователем и моделью, завершающегося ответом модели, можно запросить признание, отправив модели «системное сообщение», предписывающее ей предоставить отчет с признанием. Отчет относится к последнему ответу модели и включает в себя: (1) список всех явных и неявных инструкций, ограничений и целей, которым должен был соответствовать этот ответ, (2) честный и объективный анализ того, действительно ли ответ удовлетворял каждой из этих целей, и (3) список любых неопределенностей, двусмысленностей или «сложных оценочных суждений», с которыми столкнулась модель при подготовке ответа. Во время обучения признание оценивается отдельной моделью вознаграждения, которая оценивает исключительно само признание по критериям полноты целей, точности анализа соответствия требованиям и охвата неопределенностей. Эти вознаграждения применяются исключительно к выводу признания и никогда не влияют на вознаграждение за основной ответ. Это гарантирует описанное выше свойство: ничто из того, что модель говорит в признании, не может ухудшить (или улучшить) ее вознаграждение за основной ответ.

Почему работают признания

Теория, лежащая в основе признаний, проста. Многие виды нежелательного поведения моделей возникают из-за того, что мы просим модель оптимизировать несколько целей одновременно. Во время обучения с подкреплением модель видит промпт, формирует ответ и получает вознаграждение. Со временем она учится выдавать те виды ответов, которые получают высокие оценки. Сложность заключается в том, что сигнал вознаграждения должен одновременно сочетать множество различных факторов: насколько правилен ответ, является ли он полезным, следует ли он спецификациям продукта и политики, отвечает ли он ограничениям безопасности и соответствует ли тому, чему обычно отдают предпочтение пользователи. Когда эти сигналы взаимодействуют, они могут случайно подтолкнуть модель к поведению, которого мы не хотим.

Например, наша работа о галлюцинациях показала, что некоторые наборы данных вознаграждают уверенное предположение больше, чем честное признание неопределенности. Наше исследование поддакивания (сикофантии) показало, что модели могут становиться излишне уступчивыми, когда сигнал предпочтения слишком силен. А работа других групп показала, что модели могут «взламывать вознаграждение», находя лазейки в конфигурации обучения, которые позволяют им получать высокий балл, не выполняя при этом в полной мере то, что мы задумали. В некоторых случаях эти обходные пути могут переноситься на еще более пагубное поведение при развертывании.

Признания позволяют избежать этой проблемы за счет полного разделения целей. Основной ответ продолжает оптимизироваться по всем привычным факторам. Признание же обучается ровно по одному: честности. Ничего из того, что модель говорит в признании, не используется против нее, и признание не влияет на вознаграждение за основной ответ. Это означает, что даже если модель обманывает или идет на компромиссы в своем первоначальном выводе, у нее все равно сохраняется стимул признаться в этом в признании. Именно это мы и наблюдаем на практике: модели готовы признавать ненадлежащее поведение в признании даже в тех случаях, когда они скрывают его в основном ответе. И когда признания не срабатывают, это обычно происходит потому, что модель искренне заблуждается — из-за двусмысленности инструкций или из-за того, что она не осознала допущенную ошибку, —, а не потому, что она намеренно пыталась ввести в заблуждение. Важно отметить, что первые результаты показывают: признания остаются эффективными, даже когда исходный ответ формируется вообще без цепочки рассуждений (chain-of-thought), что говорит о том, что честность признаний не зависит от прозрачности внутреннего мышления и может масштабироваться на будущие архитектуры моделей.

Обучение с помощью признаний работает даже без эталонных меток (ground-truth labels) соответствия требованиям. Под «эталонными данными» мы подразумеваем точную метку, предоставленную извне и указывающую, действительно ли модель следовала инструкции или нарушила ее. Во многих реальных задачах такие метки недоступны — если бы мы с уверенностью знали, что модель нарушила правило, мы могли бы напрямую наказать за это нарушение, вместо того чтобы полагаться на признание. Вместо этого модель получает вознаграждение за создание структурированного, подкрепленного доказательствами объяснения того, что, по ее мнению, она сделала. В документе показано, что честность имеет тенденцию проявляться при такой настройке. Мы полагаем, что это происходит потому, что предоставление правдивого отчета, подкрепленного доказательствами, для модели, как правило, проще, чем конструирование связного вымышленного нарратива, способного пройти проверку судьи. Это ключевое предположение, исследуемое в статье, в которой также обсуждаются случаи, когда признания терпят неудачу — ложноотрицательные и ложноположительные результаты — и то, как они возникают.

В статье представлены предварительные доказательства того, что признания работают, однако ее не следует трактовать как окончательное доказательство. Хотя мы использовали передовую модель (GPT‑5 Thinking), наши эксперименты были ограничены по масштабу и использовали относительно небольшое количество вычислений и данных. Мы воодушевлены перспективой вывести эту работу на новый уровень и посмотреть, сохранится ли честность признаний по мере масштабирования их обучения.

Примеры признаний

Что мы выяснили

В рамках наших экспериментов мы намеренно обучали модели против «взламываемого» сигнала вознаграждения, вычисляемого более слабой моделью. Эта настройка применялась как к основному вознаграждению, так и к вознаграждению за признание. Модель научилась использовать слабый сигнал вознаграждения: ее кажущаяся точность (при оценке слабой моделью) возросла, в то время как ее истинная точность (при оценке более сильным оценщиком) упала.

Однако, несмотря на то, что канал признаний обучался на том же самом слабом сигнале, его точность двигалась в противоположном направлении. Модель усвоила, что лучший способ оптимизировать вознаграждение за признание — просто признаться, когда она взломала основное вознаграждение. Со временем точность признаний росла, даже несмотря на то, что основное поведение отклонялось от нормы.

В ходе обучения, когда модель не справляется с требованиями, в некоторой части случаев она учится «взламывать» судью основного вознаграждения, поэтому точность судьи снижается. Напротив, несмотря на то, что судья вознаграждения за признания поддается взлому точно так же, в процессе обучения модель становится лишь честнее в своих признаниях, в конечном итоге достигая почти 100% признаний в случаях невыполнения требований.

В статье содержится больше экспериментов и результатов. Мы сравнили модель, обученную с признаниями, с контрольной моделью, обученной тем же способом, но без канала признаний. Мы также изучили случаи, когда признания не срабатывали. Практически все «промахи» происходили тогда, когда модель действительно испытывала замешательство — когда инструкции были двусмысленными или когда она просто не осознавала, что совершила ошибку. (См. пример ложноотрицательного результата выше.)

Ограничения

У признаний есть свои ограничения. Они не предотвращают плохое поведение; они его обнаруживают. Их главная ценность заключается в том, что они служат инструментом мониторинга и диагностики как во время обучения, так и при развертывании. Признания играют ту же роль, что и мониторинг цепочки рассуждений: и то, и другое делает скрытые процессы мышления более прозрачными. Признания фокусируются на том, нарушила ли модель инструкции; цепочка рассуждений может подсветить то, как она к этому пришла.

Эта работа также является концептуальной проверкой (proof of concept). Мы не обучали механизмы признаний в большом масштабе, и точность признаний все еще несовершенна. Предстоит проделать еще много работы, чтобы сделать этот подход более надежным, устойчивым и применимым для самых разных семейств моделей и задач.

Взгляд в будущее

Эта работа вписывается в наш более широкий подход к обеспечению безопасности ИИ. «Признания» — это один из механизмов в рамках более крупного комплекса мер, который включает согласование на основе рассуждений, мониторинг цепочки мыслей, иерархию инструкций и многое другое. Ни один отдельный метод не является достаточным; целью является многоуровневая система проверок и инструментов прозрачности, которые подкрепляют друг друга. «Признания» могут помочь в диагностике проблемного поведения моделей во время обучения и оценки, а также при мониторинге в процессе развертывания. Сами по себе признания не решают проблему балансировки множества измерений. Но создание режима «сыворотки правды», в котором модели сосредоточены исключительно на честности, добавляет ценный инструмент в наш арсенал для повышения честности и безопасности по всем направлениям.

По мере того как модели становятся более способными и развертываются в условиях с более высокими ставками, нам нужны более совершенные инструменты для понимания того, что и почему они делают. «Признания» — это не полное решение, но они добавляют значимый уровень в наш комплекс средств обеспечения прозрачности и контроля. В дальнейшей работе мы планируем масштабировать «признания», а также объединить их с взаимодополняющими методами прозрачности и безопасности, включая мониторинг цепочки мыслей и согласование на основе рассуждений, чтобы добиться дальнейшего прогресса в обеспечении того, чтобы наши модели неукоснительно подчинялись всем инструкциям и правилам (таким как наша спецификация моделей) и правдиво сообщали о своих действиях.

Автор

OpenAI

Полный текст статьи читайте на OpenAI