Измерение закона Гудхарта

Закон Гудхарта гласит: «Когда показатель становится целью, он перестает быть хорошим показателем». Хотя изначально этот принцип пришел из экономики, нам в OpenAI приходится сталкиваться с ним при решении задач оптимизации целей, которые трудно или дорого измерить.
Закон Гудхарта знаменит своим утверждением: «Когда показатель становится целью, он перестает быть хорошим показателем». Хотя изначально этот принцип пришел из экономики, нам в OpenAI приходится сталкиваться с ним при решении задач оптимизации целей, которые трудно или дорого измерить. Часто возникает необходимость ввести некоторую прокси-цель (цель-заменитель), которую проще или дешевле измерить, но в этом случае нужно следить за тем, чтобы не переусердствовать с ее оптимизацией.
Например, в рамках работы по согласованию таких моделей, как GPT-3, с человеческими намерениями и ценностями, мы хотели бы оптимизировать такие аспекты, как «Насколько полезен этот ответ?» или «Насколько фактически точна эта претензия?». Это сложные цели, требующие тщательной проверки людьми. По этой причине мы обучаем модель предсказывать такие человеческие предпочтения (эта модель известна как модель вознаграждения) и используем ее предсказания в качестве прокси-цели. Однако важно отслеживать, насколько хорошо оптимизируется истинная цель.
В этой статье мы рассмотрим математические основы такого подхода. Мы сосредоточимся на ситуации, которую особенно удобно анализировать и в которой у нас есть доступ к истинной цели. На практике даже человеческие предпочтения могут не отражать то, что нам действительно важно, но в данной публикации мы оставим эту проблему за кадром.
Выборка Best-of-n (лучшая из n)
Существует множество способов оптимизации прокси-цели, но, пожалуй, самым простым является выборка best-n n sampling, также известная как выборка с отклонением (rejection sampling) или переранжирование (reranking). Мы просто делаем выборку n раз и берем тот вариант, который получает наивысшую оценку согласно прокси-цели.
Хотя этот метод очень прост, он вполне может конкурировать с более продвинутыми методами, такими как обучение с подкреплением, пусть и ценой больших вычислительных затрат на этапе инференса. Например, в WebGPT наша модель с параметром best-of-64 превзошла модель обучения с подкреплением — возможно, отчасти потому, что модель best-of-64 имела возможность просматривать гораздо больше веб-сайтов. Даже применение best-of-4 обеспечило значительный прирост качества с точки зрения человеческих предпочтений.
Кроме того, выборка best-n n обладает надежной производительностью и легко поддается математическому анализу, что делает ее отлично подходящей для эмпирических исследований закона Гудхарта и связанных с ним явлений.
Математика выборки best-of-n
Давайте изучим выборку best-n n более формально. Предположим, у нас есть некоторое пространство выборок S S (например, множество возможных пар «вопрос-ответ»), некоторое вероятностное распределение P P над S S , истинная цель (или «награда») Rtrue: S→R R_{\text{true}}: S\to\mathbb R и прокси-цель Rproxy: S→R R_{\text{proxy}}: S\to\mathbb R. Допустим, мы каким-то образом оптимизируем Rproxy R_{\text{proxy}} и тем самым получаем новое распределение P′ P^\prime . Тогда:
- Ожидание Ex′∼P′[Rtrue (x′)] \mathbb E_{x^\prime\sim P^\prime}\left[R_{\text{true}}\left (x^\prime\right)\right] измеряет, насколько хорошо мы оптимизировали истинную цель.
- Дивергенция Кульбака — ЛейблераDKL (P′∥P) D_{\text{KL}}\left (P^\prime\parallel P\right) измеряет степень проведенной оптимизации. Например, если P′ P^\prime получено путем взятия первой выборки из P P , которая лежит в некотором подмножестве S′⊆S S^\prime\subseteq S , то эта KL-дивергенция представляет собой просто отрицательный логарифм вероятности того, что выборка из P P лежит в S′ S^\prime .
Оказывается, что в случае выборки best-n n обе эти величины могут быть эффективно оценены с использованием выборок из P P .
Сначала рассмотрим математическое ожидание. Наивный подход заключается в использовании монте-карловской оценки: выполнить выборку best-n n много раз, измерить истинную цель на этих выборках и усреднить результаты. Однако существует оценка получше. Если у нас в общей сложности есть N≥n N\geq n выборок из P P , мы можем одновременно рассмотреть каждое возможное подмножество этих выборок размера n n , взвесить каждую выборку числом подмножеств, для которых она является лучшей по прокси-цели, а затем вычислить взвешенное среднее значение оценки истинной цели. Этот вес представляет собой биномиальный коэффициент (k−1n−1) \binom{k-1}{n-1} , где k k — ранг выборки по прокси-цели: от 1 1 (худшая) до N N (лучшая).
Сумма этих весов равна (Nn) \binom{N}{n} , что дает доказательство тождества хоккейной клюшки. Формальный вывод описанной здесь оценки см. в Приложении I к документу по WebGPT.
Помимо более эффективного использования выборок, это также позволяет повторно использовать выборки для различных значений n n . Что касается дивергенции KL, то, как ни удивительно, для нее существует точная формула, работающая для любого непрерывного вероятностного распределения P P (то есть до тех пор, пока P P не имеет точечных масс). Можно наивно предположить, что ответом будет logn \log n , поскольку best-of-n n делает что-то вроде выбора верхней части 1n \frac 1n от распределения, и это примерно верно: точный ответ равен logn−n−1n \log n-\frac{n-1}n .
В совокупности эти оценки позволяют нам легко анализировать, как истинная цель изменяется в зависимости от объема оптимизации, применяемой к прокси-цели.
Вот реальный пример из WebGPT:
Выход за рамки выборки best-of-n
Главное ограничение выборки best-n n заключается в том, что дивергенция KL растет логарифмически с ростом n n , поэтому она подходит лишь для применения небольшого объема оптимизации.
Для применения более масштабной оптимизации мы обычно используем обучение с подкреплением. В изученных нами ранее сценариях, таких как суммирование текстов, мы обычно могли достичь значения KL около 10 натов с помощью обучения с подкреплением до того, как истинная цель начинает снижаться из-за закона Гудхарта. Нам пришлось бы взять n примерно равным 60 000, чтобы достичь такого значения KL с помощью best-of-n n , и мы надеемся достичь гораздо больших значений KL благодаря усовершенствованию методов моделирования вознаграждения и обучения с подкреплением.
Тем не менее, не все наты одинаковы. Эмпирически для небольших бюджетов KL метод best-of-n n лучше оптимизирует как прокси-цели, так и истинные цели, чем обучение с подкреплением. Интуитивно понятно, что best-of-n n — это подход «грубой силы», что делает его более эффективным с точки зрения теории информации, чем обучение с подкреплением, но менее эффективным с точки зрения вычислительных затрат при больших значениях KL.
Мы активно изучаем свойства масштабирования прокси-целей в рамках нашей работы посогласованиюнаших моделей с человеческими намерениями и ценностями. Если вы хотите помочь нам в этих исследованиях, мынанимаем сотрудников!
Сноски
Авторы
Благодарности
Спасибо Сучиру Балажи (Suchir Balaji), Полу Кристиано (Paul Christiano), Уильяму Гассу (William Guss), Виниту Косараджу (Vineet Kosaraju), Джону Шульману (John Schulman), Нисану Стеннону (Nisan Stiennon), Джеффу Ву (Jeff Wu) и Дэниелу Циглеру (Daniel Ziegler) за обсуждения идей, связанных с этой публикацией. Спасибо Грегу Брокману (Greg Brockman), Яну Лейке (Jan Leike), Холли Мандель (Holly Mandel), Джону Шульману (John Schulman) и Джеффу Ву (Jeff Wu) за отзывы о черновиках. Спасибо Бьянке Мартин (Bianca Martin), Стиву Даулингу (Steve Dowling), Натали Саммерс (Natalie Summers) и Джастину Джею Вангу (Justin Jay Wang) за коммуникацию и дизайн.
Полный текст статьи читайте на OpenAI
