Тонкая настройка GPT‑2 на основе предпочтений человека

Читать статьюПосмотреть код
The image shows an abstract painting with soft, blended strokes in warm tones of peach, orange, and pink, contrasted with patches of blue and yellow. The texture resembles a sky or landscape at sunset with a dreamy, impressionistic style.

Мы доработали языковую модель GPT-2 с 774 миллионами параметров, используя обратную связь от человека для различных задач. Нам удалось успешно совпасть с предпочтениями внешних оценщиков-людей, хотя эти предпочтения не всегда совпадали с нашими собственными. В частности, для задач суммаризации (составления резюме) оценщики отдавали предпочтение предложениям, скопированным целиком из входного текста (мы просили их лишь обеспечивать точность), поэтому наши модели научились заниматься копированием. Для суммаризации потребовалось 60 тысяч оценок людей; для более простых задач продолжения текста в различных стилях — всего 5 тысяч. Наша цель — приблизить методы обеспечения безопасности к общей задаче «общения машин с людьми», которая, как мы считаем, является ключом к извлечению информации о человеческих ценностях.

Мы верим, что язык является ключевым компонентом для того сделать обучение с подкреплением практичным и безопасным для реальных задач. Предыдущаяработа по обучению моделей на основе человеческих предпочтений была сосредоточена на простых симулированных средах (играх Atari или робототехнических задачах), которые не отражают всю сложность языка. Язык также является необходимым компонентом для таких алгоритмов, как амплификация (усиление) и дебаты, которые нацелены на понимание логики, стоящей за предпочтениями.

В этой работе обучение на основе человеческих предпочтений применяется к нескольким задачам обработки естественного языка: продолжению текста с позитивным настроем или с использованием описательного физического языка с помощью BookCorpus, а также суммаризации контента из наборов данных TL; DR и CNN/Daily Mail. Каждую из этих задач можно рассматривать как проблему дополнения текста: начиная с некоторого текста X, мы задаемся вопросом, какой текст Y должен следовать далее.A

Мы начинаем с предобученной языковой модели (версии GPT-2 с 774 миллионами параметров) и дорабатываем её, спрашивая оценщиков-людей, какой из четырёх вариантов является лучшим. Тонкая настройка для задач стилистического продолжения эффективна по числу примеров: 5 000 человеческих оценок достаточно для достижения высоких показателей по мнению людей. Для задач суммаризации модели, обученные на 60 000 сравнений, учатся копировать целые предложения из входных данных, пропуская при этом нерелевантное вступление; такое копирование — простой способ гарантировать точные резюме, но оно может эксплуатировать тот факт, что оценщики опираются на простые эвристики.

Стилистическое продолжение текста

Примеры для задач стилистического продолжения, сравнивающие исходную модель GPT-2 (774M) и наши доработанные версии, приведены ниже.B

По оценкам тех же людей-оценщиков, которые участвовали в их обучении, наши доработанные модели предпочитаются базовой модели GPT-2 (в режиме zero-shot) в 88% и 86% случаев для тональности и описательности соответственно.

Суммаризация

Мы также применили доработку на основе человеческих оценок к двум задачам суммаризации: составлению резюме статей из набора данных CNN/Daily Mail и фрагментов Reddit из набора данных TL; DR.

Эти задачи сложнее: наши основные модели используют 60 000 вариантов выбора из четырёх альтернатив. Нам также требуется сбор данных в режиме онлайн, при котором образцы, показываемые людям, собираются в процессе обучения по мере изменения политики модели. Стратегия сбора данных в режиме оффлайн, при которой людям демонстрируются только образцы от базовой языковой модели GPT-2, показала плохие результаты.

Наши модели достигают очень хороших результатов по мнению людей-оценщиков, но они, вероятнее всего, эксплуатируют тот факт, что оценщики опираются на простые эвристики: они предпочитают нашим моделям базовый метод lead-3 (копирование первых трех предложений). Тем не менее, при объединении контролируемой тонкой настройки (supervised fine-tuning) с доработкой на основе человеческих оценок, наши модели превосходят lead-3 по метрикам ROUGE.

Ниже приведены примеры для моделей в режиме zero-shot, базовых моделей с контролируемым обучением, а также для результатов RL-доработки каждого из вариантов.

Читатель мог заметить несколько особенностей в этих примерах. Во-первых, наша модель, доработанная с помощью RL, в основном представляет собой умный механизм копирования: она обычно составляет резюме, копируя целые предложения из статьи или фрагмента Reddit. В отличие от этого, примеры из моделей zero-shot и с контролируемой тонкой настройкой содержат больше новизны:

Модель

CNN/Daily Mail

tl; dr

Эталонные резюме

96.7

98.9

Zero-shot

91.7

96.3

Доработанная

2.5

29.0

С учителем

83.6

96.9

С учителем + доработанная

69.6

94.0

Новизна предложений: Процент предложений в резюме, которые не встречаются в исходном тексте.

Модель, доработанная с помощью RL, всё же варьирует места, откуда она производит копирование: хотя они копируют начало входных данных в 28,3% и 77,6% случаев на TL; DR и CNN/Daily Mail соответственно, эти показатели падают до 0,2% и 1,4%, если входные данные начинаются с неинформативного вступления (определяемого как «hi», «hello», «hey», «ok», «okay», «so» для TL; DR или наличие двоеточия в первых трех словах для CNN/Daily Mail, например «Winner: Саймон Вуд завоевал телевизионную корону […]»).

Визуализация ниже показывает различия в том, откуда модели суммаризации осуществляют копирование, иллюстрируемые наибольшей общей подпоследовательностью биграм между контекстом и резюме для случайно выбранных контекстов.

Во-вторых, хотя резюме от GPT-2 zero-shot и версии GPT-2 с контролируемой тонкой настройкой содержат больше новизны, если измерять её по n-граммам или предложениям, они также обладают большей новизной с точки зрения содержания. Иными словами, они не соответствуют действительности:

Модель

CNN/Daily Mail

tl; dr

Zero-shot

6/30

6/30

Доработанная

29/30

26/30

С учителем

19/30

8/30

С учителем + доработанная

20/30

11/30

Точность резюме: Частота точности сгенерированных резюме по оценке авторов на 30 статьях из каждого набора данных.

Существует по меньшей мере два способа интерпретации этих результатов. Первый заключается в том, что копирование — это самый простой способ быть точным. Оценщикам было велено штрафовать за неточность, но не за копирование. Zero-shot модель копирует в некоторых случаях, и когда она копировала, это было точным, поэтому копирование подкреплялось. В результате получается модель, которая в основном копирует, но по крайней мере не врет.

Тем не менее, это не полностью объясняет результаты оценки человеком: как наша модель, так и простой базовый метод lead-3, копирующий первые три предложения, настоятельно предпочитаются оценщиками эталонным резюме человека в обоих наборах данных. Авторы с этим не согласны: мы находим, что эталонные резюме являются точными и лучше передают общее сообщение. Это выявляет несоответствие между представлением о качестве, которому мы хотели научить нашу модель, и тем, что на самом деле оценивали люди-оценщики. Оценщики хотят работать как можно быстрее, и они могут работать очень быстро, следуя эвристике: «если резюме копирует текст, выберите его».

Проблемы и извлеченные уроки

Сбор данных онлайн — это сложно

Сбор данных онлайн был необходим для достижения наилучших результатов по суммаризации, но привел к множеству трудностей:

  1. Сложность программного обеспечения. Чередование сбора данных, обучения модели вознаграждения и RL-доработки привело к созданию гораздо более сложной системы, чем если бы каждый компонент существовал отдельно.
  2. Сложность машинного обучения. Ошибка машинного обучения в любом компоненте разрушала всю систему, и было неудобно отлаживать отдельный компонент изолированно.
  3. Проблемы контроля качества. Сбор оценок онлайн требовал низкой задержки между генерацией образца и получением данных от компании Scale (обычно около 30 минут). Контроль качества с низкой задержкой — сложная задача, и регрессии качества данных часто обнаруживались только после завершения циклов обучения.

Мы считаем, что правильной золотой серединой между оффлайн- и онлайн-сбором данных является пакетный (батчевый) сбор данных: мы бы чередовали сбор крупных пакетов данных (с большей задержкой) и обучение на собранных данных. Стоимость человеческих данных означает, что их объем всегда будет небольшим, поэтому каждый раз легко проводить повторное обучение с нуля (точнее, с отправной точки GPT-2).

Двусмысленные задачи затрудняют разметку

У отдельного человека может быть четкое представление о том, является ли конкретный образец точным, грамматически правильным, неизбывным или затрагивающим ключевые моменты, но сравнение двух резюме часто требует субъективного взвешивания различных видов недостатков. По возможности кажется лучшим разрабатывать менее двусмысленные задачи разметки, которые ведут к той же информации. Например, вместо того чтобы просить человека сравнить резюме, мы могли бы попросить дать словесное описание проблем с резюме или предложить исправление. Даже если два человека не согласны насчет наиболее важной проблемы, они могут сойтись на том, что другой обнаружил какую-то проблему, а большее согласие облегчает контроль качества данных и общий экспериментальный процесс.

Ошибки в коде могут приводить к оптимизации деструктивного поведения

Один из наших рефакторингов кода привнес ошибку, которая меняла знак вознаграждения. Изменение знака вознаграждения обычно приводило бы к бессвязному тексту, но та же ошибка также меняла знак штрафа Кульбака — Лейблера (KL). В результате получилась модель, которая оптимизировалась для отрицательной тональности, сохраняя при этом естественный язык. Поскольку наши инструкции предписывали людям ставить очень низкие оценки продолжениям с сексуально откровенным текстом, модель быстро научилась выдавать контент исключительно такого рода. Эта ошибка была примечательна тем, что на выходе получалась не бессмыслица, а максимально плохой результат. Авторы спали во время процесса обучения, поэтому проблему заметили только после его завершения. Такой механизм, как шнур Андон на производстве Toyota, мог бы предотвратить это, позволив любому оценщику остановить проблемный процесс обучения.

Взгляд в будущее

Мы продемонстрировали обучение с подкреплением на основе предпочтений человека (reward learning) для двух типов задач естественного языка: стилистического продолжения текста и суммаризации. Наши результаты неоднозначны: для продолжения текста мы достигаем хороших результатов при минимальном количестве примеров, однако наши модели суммаризации являются лишь «умными копировщиками» — они копируют исходный текст, пропуская при этом нерелевантное введение. Преимущество умного копирования заключается в правдивости: модели zero-shot и с учителем выдают естественные, правдоподобные на вид резюме, которые часто оказываются ложными. Мы полагаем, что ограничивающим фактором в наших экспериментах является качество данных, усугубляемое условиями сбора данных в реальном времени, и в будущем мы планируем использовать пакетный сбор данных (batched data collection).

Мы считаем, что применение обучения с подкреплением на основе обратной связи к языковым моделям важно как с точки зрения возможностей, так и с точки зрения безопасности. С точки зрения возможностей, обучение с подкреплением позволяет исправлять ошибки, которые не уловило бы обучение с учителем, однако обучение с подкреплением с программными функциями вознаграждения »может пагубно сказаться на качестве модели». С точки зрения безопасности, обучение с подкреплением для языка позволяет учитывать такие важные критерии, как «не лги», на этапе обучения и является шагом к масштабируемым методам обеспечения безопасности, таким как дебаты и усиление.

Сноски

  1. A

    Для суммаризации текстом является статья плюс строка «TL; DR:».

  2. B

    Каждая дообученная модель тренируется с использованием 5000 четырехсторонних сравнений людьми.

Авторы

Daniel Ziegler, Nisan Stiennon, Jeffrey Wu, Tom Brown, Dario Amodei, Alec Radford, Paul Christiano, Geoffrey Irving

Благодарности

Спасибо Этану Пересу (Ethan Perez), Джеку Кларку (Jack Clark), Эшли Пилиписин (Ashley Pilipiszyn) и Грегу Брокману (Greg Brockman) за отзывы об этой публикации. Спасибо Джастину Джей Вангу (Justin Jay Wang), Брук Чан (Brooke Chan) и Шан Картер (Shan Carter) за дизайн и разработку.

Полный текст статьи читайте на OpenAI