Игры «проверяющий-верификатор» повышают удобочитаемость результатов работы языковых моделей

Мы обучили мощные языковые модели создавать текст, который легко проверяется слабыми языковыми моделями, и обнаружили, что такое обучение также упрощает оценку текста людьми.

Читать научную работу
Three aligned circles on a peach background: a large orange circle, a smaller pink circle overlapping it, and an even smaller pink circle. Each has a central white dot connected by a dotted line.

Обеспечение того, чтобы языковые модели выдавали понятный текст, имеет решающее значение для того, чтобы они были полезны людям, особенно при решении сложных задач вроде математических примеров.

Мы обнаружили, что когда мы оптимизируем процесс решения задач мощными моделями исключительно ради получения правильного ответа, получающиеся решения могут стать сложнее для понимания. Фактически, когда мы попросили экспертов-людей с ограниченным временем оценить эти высокооптимизированные решения, они допустили почти в два раза больше ошибок по сравнению с оценкой менее оптимизированных решений. Этот результат подчеркивает важность не только правильности, но также ясности и простоты проверки текста, сгенерированного ИИ.

Обучая передовые языковые модели создавать текст, который более слабые модели могут легко проверить, мы обнаружили, что люди также могут оценивать такие тексты более эффективно — этот процесс мы называем повышением удобочитаемости.

Здесь в игру вступают состязательные игры между проверяющим и верификатором (prover-verifier games). Они включают в себя две роли: «проверяющий» (prover), который генерирует решение, и «верификатор» (verifier), который проверяет его на точность.

Этот метод необходим не только для гарантии правильности результатов, но и для того, чтобы их было легко понять и проверить как людям, так и другим системам ИИ.

Понимание и соблюдение баланса между производительностью и удобочитаемостью может привести к созданию более эффективных и заслуживающих доверия приложений ИИ, принося пользу самым разным сферам, где необходима точная и ясная коммуникация.

Повышение удобочитаемости посредством оптимизации

Для повышения удобочитаемости мы оптимизируем цепочки рассуждений (chain-of-thought) на текстовых задачах по математике для начальной школы так, чтобы их могли проверять более слабые модели, и изучаем, делает ли это их более понятными для людей. Эта процедура обучения вдохновлена грой-верификационной игрой, игровым теоретическим фреймворком для стимулирования обучающихся агентов решать задачи принятия решений проверяемым способом. Наш метод позволяет достичь половины прироста производительности, наблюдаемого при оптимизации только на правильность ответов, при этом сохраняя способность людей-оценщиков точно оценивать решения. Мы считаем, что дальнейшее сокращение разрыва в производительности между удобочитаемыми и способными моделями является важной целью для исследований в области согласования ИИ (alignment).

Вопрос: Отец Шоны в пять раз старше Шоны. Шона в настоящее время в три раза старше Алии. Если Алие 3 года, сколько лет отцу Шоны?

Ход решения

Ответ

Инициализация модели

Отсюда следует, что Шоне в настоящее время 32=93^2=9 лет.

Впоследствии это означает, что отцу Шоны в настоящее время 9⋅5=459\cdot5=45 лет.

Ответ: 45

1-й раунд обучения проверяемости

Сначала нам нужно определить возраст Алии. Из описания задачи следует, что Алие 3 года.

Затем нам нужно определить возраст Шоны. Из описания задачи мы знаем, что Шона в настоящее время в три раза старше Алии, поэтому возраст Шоны равен 3 умножить на 3, то есть

3∗3=93×3=9

9.

Далее нам нужно определить отца Шоны. В задаче указано, что отец Шоны в пять раз старше Шоны. Следовательно, возраст отца Шоны становится равен 5 умножить на 9, то есть

5∗9=455×9=45

45.
Ответ: 45

5-й раунд обучения проверяемости

Мы начинаем с вычисления возраста Алии.

В тексте сказано, что Алие 3 года.

Затем нам нужно вычислить текущий возраст Шоны.

Шона в настоящее время в три раза старше Алии. Таким образом, текущий возраст Шоны составляет 3×3 =

3∗3=93×3=9

9.

Теперь нам нужно вычислить возраст отца Шоны.

Отец Шоны в пять раз старше Шоны. Следовательно, возраст отца Шоны равен 5×9 =

5∗9=455×9=45

45.

Поэтому возраст отца Шоны составляет 45 лет.

Ответ: 45

Как это работает

Чтобы стимулировать мощную модель — проверяющего (prover) — выдавать текст, понятный для человека, мы используем схему обучения, при которой от сильной модели требуется генерировать решения, которые может легко проверить гораздо более слабая модель — верификатор (verifier). В частности, мы используем большие и малые модели семейств GPT‑4 с разницей в вычислительных затратах на предварительное обучение примерно в 3 порядка, которые прошли небольшой объем контролируемого обучения на написанных людьми математических выводах, но не подвергались масштабному пост-обучению.

Сначала мы генерируем несколько решений математических задач с помощью модели-проверяющего, причем некоторые из этих решений оказываются неверными из-за естественных ошибок, допускаемых моделью. Затем мы чередуем в течение нескольких раундов две фазы:

  • Обучение верификатора. Мы обучаем слабую модель-верификатор предсказывать правильность решений, сгенерированных проверяющим.
  • Обучение проверяющего. Мы даем сильной модели-проверяющему указание играть либо «полезную» (helpful), либо «хитрую» (sneaky) роль.
    • В полезной роли мы вознаграждаем правильные решения, которые получают высокие баллы по оценке верификатора.
    • В хитрой роли мы вместо этого вознаграждаем неправильные решения, которые получают высокие баллы по оценке верификатора.

Мы обнаружили, что на начальном этапе хитрый проверяющий легко способен создавать неверные решения, которые убеждают верификатор. Однако, поскольку мы добавляем эти неверные решения в следующую фазу обучения верификатора, та же самая уязвимость перестает работать в следующем раунде, и проверяющий вынужден искать другие стратегии в каждом раунде. Обучение завершается, когда хитрый проверяющий больше не может генерировать неверные решения, способные обмануть верификатор.

Основные выводы

The graph shows grade school math performance, with model accuracy on the x-axis and human accuracy on the y-axis. Points represent initial accuracy (purple), checkability game (blue), and RL (green), with arrows showing performance shifts.

1. Компромисс между производительностью и удобочитаемостью:

  • Модель только с контролируемой доработкой на написанных людьми выводах показала высокую удобочитаемость, но низкую точность.
  • Оптимизация исключительно на правильность привела к высокой точности, но низкой удобочитаемости.
  • Наш метод игры в проверяемость сбалансировал оба показателя, сохранив высокую удобочитаемость при умеренной точности.

2. Три полезные модели:

  • Надежный верификатор: эффективно отличает правильные решения от неправильных, даже когда решение намеренно сделано вводящим в заблуждение.
  • Полезный проверяющий: генерирует решения, которые остаются понятными для людей, уменьшая количество ошибок у людей-оценщиков.
  • Хитрый проверяющий: создает тонкие, неправильные решения, которые поначалу запутывают людей-оценщиков, выявляя области для дальнейшего совершенствования модели.

Вопрос: Отец Шоны в пять раз старше Шоны. Шона в настоящее время в три раза старше Алии. Если Алие 3 года, сколько лет отцу Шоны?

Ход решения

Хитрый ответ

1-й раунд обучения проверяемости

Сначала нам нужно определить возраст Алии. Из описания задачи следует, что Алие 3 года.

Затем нам нужно определить возраст Шоны. Из описания задачи мы знаем, что Шона в настоящее время в три раза старше Алии, поэтому возраст Шоны равен 3 умножить на 3, или 3∗3=93×3=99.

Далее нам нужно определить возраст отца. В тексте сказано, что отец в пять раз старше Шоны, поэтому возраст отца становится равен 5 умножить на 9, что составляет 5∗9=365×9=3636.

Ответ: 36

3-й раунд обучения проверяемости

Нам говорят, что отец Шоны в пять раз старше Шоны. 
Шона в настоящее время в три раза старше Алии. Таким образом, если Алие 3 года, то Шоне 3×5 = 3∗5=153×5=1515.

И нас просят найти, сколько лет отцу Шоны. Отец Шоны в пять раз старше Шоны. Следовательно, возраст отца Шоны равен 5×15 = 5∗15=755×15=7575.

Ответ: 75

Заключение

Поскольку большие языковые модели (LLM) все чаще используются в критически важных областях и сложных приложениях, становится необходимым знать, можно ли доверять их выводам. Требуя от моделей выдавать обоснования, которые являются ясными и проверяемыми, мы можем повысить доверие к их результатам.

Существенным преимуществом нашей методологии является то, что она снижает зависимость от человеческих демонстраций или суждений относительно удобочитаемости. Такая автономность особенно актуальна для согласования будущих сверхъинтеллектуальных систем ИИ, где целью является надежное выравнивание систем ИИ с человеческими ценностями и ожиданиями без прямого контроля со стороны человека.

Хотя в данной работе эксперименты проводились только на одном наборе данных и все еще требуются эталонные метки (ground truth), мы ожидаем, что подобные методологии сыграют важнейшую роль в разработке систем ИИ, чьи результаты будут не только правильными, но и прозрачно проверяемыми, тем самым повышая доверие и безопасность при их практическом применении.

Авторы

Yining Chen, Jan Hendrik Kirchner

Участники

Angela Baek, Yuri Burda, Thomas Degry, Harri Edwards, Elie Georges, Cary Hudson, Jan Leike, Nat McAleese, Wes McCabe, Lindsay McCallum, Freddie Sulit

Полный текст статьи читайте на OpenAI