Повышение эффективности математических рассуждений с помощью надзора за процессами

Читать статьюПосмотреть примерыСкачать набор данных
Improving Mathematical Reasoning With Process Supervision

Мы обучили модель, которая достигла нового уровня в решении математических задач, вознаграждая каждый правильный шаг рассуждения («надзор за процессами» — process supervision) вместо простой оценки правильности конечного ответа («надзор за результатами» — outcome supervision). Помимо повышения производительности по сравнению с надзором за результатами, надзор за процессами также имеет важное преимущество с точки зрения соответствия (alignment): он напрямую обучает модель выстраивать цепочку рассуждений, одобренную человеком.

Введение

В последние годы большие языковые модели значительно улучшили свою способность выполнять сложные многоэтапные рассуждения. Однако даже самые современные модели все еще допускают логические ошибки, часто называемые галлюцинациями. Смягчение проблемы галлюцинаций — важнейший шаг на пути к созданию согласованного искусственного общего интеллекта (AGI).

Мы можем обучать модели вознаграждения (reward models) для обнаружения галлюцинаций, используя либо надзор за результатами, который предоставляет обратную связь на основе конечного результата, либо надзор за процессами, который оценивает каждый отдельный шаг в цепочке рассуждений. Опираясь на предыдущие работы1, мы проводим детальное сравнение этих двух методов, используя набор данных MATH2 в качестве тестового стенда. Мы обнаружили, что надзор за процессами обеспечивает значительно лучшую производительность, даже если оценивать результаты по конечным ответам. Чтобы стимулировать дальнейшие исследования, мы открываем доступ к нашему полному набору данных для надзора за процессами.

Влияние на соответствие (alignment)

Надзор за процессами имеет ряд преимуществ с точки зрения соответствия по сравнению с надзором за результатами. Он напрямую вознаграждает модель за следование согласованной цепочке рассуждений, поскольку каждый шаг в процессе получает точную оценку. Надзор за процессами также с большей вероятностью приводит к созданию интерпретируемых рассуждений, так как побуждает модель следовать одобренному человеком процессу. Напротив, надзор за результатами может поощрять несогласованный процесс, и его в целом сложнее контролировать.

В некоторых случаях более безопасные методы для систем ИИ могут приводить к снижению производительности3 — цена, известная как налог на соответствие (alignment tax). Как правило, любой налог на соответствие может препятствовать внедрению методов выравнивания из-за стремления развертывать наиболее способные модели. Наши результаты, представленные ниже, показывают, что надзор за процессами фактически влечет за собой отрицательный налог на соответствие, по крайней мере в области математики. Это может способствовать более широкому применению надзора за процессами, что, по нашему мнению, принесет положительные побочные эффекты для безопасности ИИ.

Решение математических задач

Мы оцениваем наши модели вознаграждения с надзором за процессами и результатами, используя задачи из тестового набора MATH. Мы генерируем множество решений для каждой задачи, а затем выбираем решение, получившее наивысший ранг от каждой модели вознаграждения. График показывает процент выбранных решений, приводящих к правильному окончательному ответу, в зависимости от количества рассматриваемых решений. Модель вознаграждения на основе процессов не только демонстрирует лучшие результаты по всем направлениям, но и разрыв в производительности увеличивается по мере рассмотрения большего числа решений для каждой задачи. Это показывает, что модель вознаграждения с надзором за процессами гораздо надежнее.

Ниже мы представляем 10 задач и решений, а также комментарии о сильных и слабых сторонах модели вознаграждения.

Пока неясно, насколько широко эти результаты будут применимы за пределами математики, и мы считаем важным для будущих исследований изучить влияние надзора за процессами в других областях. Если эти результаты подтвердятся шире, мы сможем обнаружить, что надзор за процессами дает нам лучшее из обоих миров — метод, который является одновременно более производительным и более согласованным, чем надзор за результатами.

Ссылки

  1. 1

    Uesato, J., Kushman N., Kumar R., Song F., Siegel N., Wang L., Creswell A., Irving G. and Higgins, I., 2022. Solving math word problems with process- and outcome-based feedback. arXiv preprint arXiv:2211.14275.

  2. 2

    Hendrycks D., Burns C., Kadavath S., Arora A., Basart S., Tang E., Song D. and Steinhardt J., 2021. Measuring Mathematical Problem Solving With the MATH Dataset. arXiv preprint arXiv:2103.03874.

  3. 3

    Ouyang L., Wu J., Jiang X., Almedia D., Wainwright C.L., Mishkin P., Zhang C., Agarwal S., Slama K., Ray A., Schulman J., Hilton J., Kelton F., Miller L., Simens M., Askell A., Welinder P., Christiano P., Leike J. and Lowe R., 2022. Training language models to follow instructions with human feedback. arXiv preprint arXiv:2203.02155.

Авторы

Karl Cobbe, Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Jan Leike, Ilya Sutskever

Участники

Bowen Baker, Teddy Lee, John Schulman, Greg Brockman, Kendra Rimbach, Hannah Wong, Thomas Degry

Полный текст статьи читайте на OpenAI