Решение текстовых задач по математике

Мы обучили систему, которая решает школьные задачи по математике почти в два раза точнее дообученной модели GPT‑3. Она справляется примерно с 90% того объема задач, которые решают реальные дети: небольшая выборка детей 9–12 лет набрала 60% на тесте из нашего датасета, в то время как наша система набрала 55% на тех же самых задачах.
Почему это важно
Это важно потому, что современный ИИ все еще довольно слабо справляется с многошаговыми рассуждениями на основе здравого смысла, которые с легкостью даются даже младшеклассникам. Мы достигли таких результатов, обучив нашу модель распознавать свои ошибки, чтобы она могла предпринимать попытки снова и снова, пока не найдет работающее решение.
Введение
Большие языковые модели, такие как GPT‑3, обладают множеством впечатляющих навыков, включая способность имитировать различные стили письма и обширные фактические знания. Тем не менее, они испытывают трудности с выполнением задач, требующих точных многошаговых рассуждений, таких как решение текстовых задач по математике для младших классов. Хотя модель может имитировать ритм правильных решений, она регулярно допускает критические логические ошибки.
Чтобы соответствовать возможностям человека в сложных логических областях, наши модели должны научиться распознавать свои ошибки и тщательно продумывать каждый шаг. Для этого мы обучаем верификаторы оценивать, является ли предложенное решение правильным. Чтобы решить новую задачу, мы используем верификаторы для выбора лучшего варианта среди множества предложенных решений. Мы собрали новый датасет GSM8K для оценки наших методов и выпускаем его в открытый доступ для содействия исследованиям.
В десяти примерах ниже мы показываем решения, сгенерированные нашим новым методом верификации и нашим базовым методом дообучения.
Датасет GSM8K
GSM8K состоит из 8,5 тыс. высококачественных текстовых задач по математике для начальной школы. Решение каждой задачи занимает от 2 до 8 шагов и в основном сводится к выполнению последовательности элементарных вычислений с использованием базовых арифметических операций (+ − × ÷) для получения окончательного ответа. Дообученные современные языковые модели показывают на этом датасете плохие результаты, главным образом из-за высокого разнообразия задач. В то же время решения в GSM8K опираются только на элементарные понятия, поэтому достижение высоких показателей тестирования является вполне выполнимой задачей.
Решения в GSM8K записаны на естественном языке, а не в виде чистых математических выражений. Благодаря использованию естественного языка сгенерированные моделью решения легче поддаются интерпретации человеком, а наши методы остаются относительно универсальными для разных предметных областей.
Обучение верификаторов: модели, которые учатся на своих ошибках
Одна из серьезных проблем в математических рассуждениях — высокая чувствительность к отдельным ошибкам. Авторегрессионные модели, генерирующие каждое решение токен за токеном, не имеют механизмов для исправления собственных оплошностей. Решения, которые отклоняются от верного курса, быстро становятся неисправимыми, как видно на представленных примерах.
Мы решаем эту проблему путем обучения верификаторов для оценки правильности сгенерированных моделью решений. Верификаторам передается множество возможных решений, созданных самой моделью, и они обучаются определять, какие из них (если таковые имеются) являются правильными.
Чтобы решить новую задачу во время тестирования, мы генерируем 100 вариантов-кандидатов, а затем выбираем то решение, которое получило наивысшую оценку от верификатора. Верификаторы выигрывают за счет такой заложенной вариативности, а также благодаря тому, что верификация часто является более простой задачей, чем генерация.
Мы обнаруживаем, что верификация дает мощный прирост производительности, если датасет достаточно велик. Мы полагаем, что на слишком маленьких датасетах верификаторы переобучаются, просто запоминая конечные ответы из обучающей выборки, вместо того чтобы усваивать какие-либо более полезные свойства математических рассуждений.
На полном обучающем наборе данных модель верификации с 6 млрд параметров слегка превосходит дообученную модель со 175 млрд параметров, обеспечивая прирост производительности, примерно эквивалентный 30-кратному увеличению размера модели. Более того, судя по экстраполяции на основе текущих результатов, масштабирование с помощью верификации оказывается более эффективным при добавлении дополнительных данных.
Заключение
Построение корректных аргументов и распознавание некорректных — ключевые задачи на пути к созданию более универсального ИИ. Школьная математика представляет собой идеальную тестовую среду для этих возможностей. Задачи в GSM8K концептуально просты, однако одной небольшой ошибки достаточно, чтобы разрушить все решение целиком. Выявление и предотвращение таких ошибок — важнейший навык, который должны развить наши модели. Обучая верификаторы, мы учим наши модели отличать хорошие решения от тех, которые не совсем удались. Мы ожидаем, что эти навыки будут становиться все более востребованными по мере того, как мы будем пытаться применять наши модели в более сложных с точки зрения логики областях.
Авторы
Благодарности
Спасибо команде Surge AI за сбор данных для датасета GSM8K.
Спасибо соавторам нашей статьи: Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano и Christopher Hesse.
Спасибо всем, кто оставил отзывы об этом релизе: Dan Hendrycks, Leo Gao, Alec Radford, Giambattista Parascandolo, Harri Edwards, Yura Burda, Nick Ryder, Ilya Sutskever, Mira Murati, Sam Altman, Aris Konstantinidis, Andrew Mayne, Hannah Wong и Steve Dowling.
Спасибо учащимся, которые вызвались добровольно пройти наш тест!
Полный текст статьи читайте на OpenAI
