Повышение эффективности математических рассуждений с помощью надзора за процессами

Мы обучили модель, которая достигла нового уровня в решении математических задач, вознаграждая каждый правильный шаг рассуждения («надзор за процессами» — process supervision) вместо простой оценки правильности конечного ответа («надзор за результатами» — outcome supervision). Помимо повышения производительности по сравнению с надзором за результатами, надзор за процессами также имеет важное преимущество с точки зрения соответствия (alignment): он напрямую обучает модель выстраивать цепочку рассуждений, одобренную человеком.
Введение
В последние годы большие языковые модели значительно улучшили свою способность выполнять сложные многоэтапные рассуждения. Однако даже самые современные модели все еще допускают логические ошибки, часто называемые галлюцинациями. Смягчение проблемы галлюцинаций — важнейший шаг на пути к созданию согласованного искусственного общего интеллекта (AGI).
Мы можем обучать модели вознаграждения (reward models) для обнаружения галлюцинаций, используя либо надзор за результатами, который предоставляет обратную связь на основе конечного результата, либо надзор за процессами, который оценивает каждый отдельный шаг в цепочке рассуждений. Опираясь на предыдущие работы
Влияние на соответствие (alignment)
Надзор за процессами имеет ряд преимуществ с точки зрения соответствия по сравнению с надзором за результатами. Он напрямую вознаграждает модель за следование согласованной цепочке рассуждений, поскольку каждый шаг в процессе получает точную оценку. Надзор за процессами также с большей вероятностью приводит к созданию интерпретируемых рассуждений, так как побуждает модель следовать одобренному человеком процессу. Напротив, надзор за результатами может поощрять несогласованный процесс, и его в целом сложнее контролировать.
В некоторых случаях более безопасные методы для систем ИИ могут приводить к снижению производительности
Решение математических задач
Мы оцениваем наши модели вознаграждения с надзором за процессами и результатами, используя задачи из тестового набора MATH. Мы генерируем множество решений для каждой задачи, а затем выбираем решение, получившее наивысший ранг от каждой модели вознаграждения. График показывает процент выбранных решений, приводящих к правильному окончательному ответу, в зависимости от количества рассматриваемых решений. Модель вознаграждения на основе процессов не только демонстрирует лучшие результаты по всем направлениям, но и разрыв в производительности увеличивается по мере рассмотрения большего числа решений для каждой задачи. Это показывает, что модель вознаграждения с надзором за процессами гораздо надежнее.
Ниже мы представляем 10 задач и решений, а также комментарии о сильных и слабых сторонах модели вознаграждения.
Пока неясно, насколько широко эти результаты будут применимы за пределами математики, и мы считаем важным для будущих исследований изучить влияние надзора за процессами в других областях. Если эти результаты подтвердятся шире, мы сможем обнаружить, что надзор за процессами дает нам лучшее из обоих миров — метод, который является одновременно более производительным и более согласованным, чем надзор за результатами.
Ссылки
Авторы
Участники
Bowen Baker, Teddy Lee, John Schulman, Greg Brockman, Kendra Rimbach, Hannah Wong, Thomas Degry
Полный текст статьи читайте на OpenAI
