Законы масштабирования для переоптимизации моделей вознаграждения

Читать статью
Scaling Laws For Reward Model Overoptimization

Аннотация

При обучении с подкреплением на основе отзывов человека (RLHF) принято проводить оптимизацию по модели вознаграждения, обученной предсказывать предпочтения людей. Поскольку модель вознаграждения является несовершенным прокси-приближением, чрезмерная оптимизация ее значения может ухудшить качество результатов с точки зрения истинных данных (ground truth), в соответствии с законом Гудхарта. Этот эффект наблюдался неоднократно, однако его не удавалось тщательно измерить из-за высокой стоимости сбора данных о предпочтениях людей. В данной работе мы используем синтетическую среду, в которой фиксированная «эталонная» (gold-standard) модель вознаграждения выступает в роли людей, предоставляя разметку, используемую для обучения прокси-модели вознаграждения. Мы исследуем, как изменяется оценка эталонной модели вознаграждения при оптимизации против прокси-модели вознаграждения с использованием либо обучения с подкреплением, либо выборки best-of-n. Мы обнаруживаем, что эта зависимость следует разным функциональным формам в зависимости от метода оптимизации, и что в обоих случаях ее коэффициенты плавно масштабируются с ростом числа параметров модели вознаграждения. Мы также исследуем влияние на эту зависимость размера набора данных модели вознаграждения, количества параметров модели вознаграждения и политики, а также коэффициента штрафа Кульбака — Лейблера (KL), добавляемого к вознаграждению в схеме обучения с подкреплением. Мы анализируем значение этих эмпирических результатов для теоретических вопросов выравнивания искусственного интеллекта (AI alignment).

Авторы

Лео Гао, Джон Шулман, Джейкоб Хилтон

Полный текст статьи читайте на OpenAI