Обучение суммаризации с использованием обратной связи от человека
Мы применили обучение с подкреплением на основе отзывов людей для тренировки языковых моделей, которые лучше справляются с суммаризацией текста.

Почему это важно
Наши модели создают аннотации, которые превосходят по качеству аннотации от моделей, в 10 раз превышающих их по размеру и обученных исключительно с помощью обучения с учителем. Несмотря на то, что мы обучаем наши модели на наборе данных Reddit TL; DR, они успешно применяются для создания качественных аннотаций новостных статей CNN/DailyMail без какой-либо дополнительной точной настройки. Наши методы не ограничиваются только созданием аннотаций; в долгосрочной перспективе наша цель — сделать согласование систем ИИ с человеческими предпочтениями центральным компонентом исследований и развертывания ИИ во многих областях.
Крупномасштабные языковые модели демонстрируют все большую эффективность в задачах НЛП (обработки естественного языка). Обычно эти модели обучаются с целью предсказания следующего слова на датасете текстов, написанных людьми. Однако эта цель не полностью отражает то, чего мы на самом деле хотим: как правило, мы стремимся не к тому, чтобы наши модели имитировали людей, а к тому, чтобы они выдавали качественные ответы. Это несоответствие становится очевидным, когда модель обучается подражать низкокачественному человеческому тексту, но оно может проявляться и более тонким образом. Например, модель, обученная предсказывать слова человека, может выдумывать факты при неуверенности или генерировать предложения, отражающие вредные социальные предвзятости. Оба этих сбойных режима хорошо описаны в литературе., , ,
В рамках нашей работы по безопасности мы хотим разработать методы, которые согласуют цели наших моделей с конечным поведением, которое действительно имеет для нас значение. По мере того как модели становятся мощнее, мы верим, что согласование их целей с нашими будет иметь решающее значение для обеспечения их пользы для людей. В краткосрочной перспективе мы хотели проверить, могут ли методы использования человеческой обратной связи помочь нашим моделям улучшить производительность в полезных задачах.
Мы сосредоточились на суммаризации текста на английском языке, поскольку это сложная задача, в которой само понятие «хорошей аннотации» трудно формализовать без участия человека. Мы применяем наш метод главным образом к существующему набору данных
Сначала мы обучаем модель вознаграждения посредством обучения с учителем для предсказания того, какие аннотации понравятся людям.
Наш подход напрямую продолжает нашу предыдущую работу по обучению на основе человеческой обратной связи.
Результаты
Мы оценили несколько различных моделей суммаризации: некоторые из них были предварительно обучены на широком распределении текстов из интернета, некоторые — дообучены с помощью обучения с учителем для предсказания TL; DR, а некоторые — дообучены с использованием человеческой обратной связи.
Мы выяснили, что дообучение с подкреплением на основе человеческой обратной связи оказывает колоссальное влияние на качество по сравнению как с дообучением с учителем, так и с увеличением размера модели. В частности, наша модель с 1,3 миллиарда параметров (1,3B), обученная с использованием человеческой обратной связи, превосходит модель с 12 миллиардами параметров, обученную исключительно с учителем. Аннотации, созданные нашими моделями с человеческой обратной связью (на 1,3B и 6,7B параметров), разметчики предпочитают оригинальным написанным человеком TL; DR из набора данных.
При написании аннотаций люди делают различные компромиссы, в том числе между лаконичностью и полнотой охвата исходного текста; в зависимости от назначения аннотации могут предпочтительными оказывать тексты разной длины. Наши разметчики склонны предпочитать более длинные аннотации, поэтому наши модели адаптировались к этому предпочтению и сошлись к максимально допустимой длине. Контроль длины снизил предпочтение людьми аннотаций нашей модели на 6,7B с 70% до 65%, что объясняет лишь меньшую часть наших достижений.
Результаты переноса (трансфера)
Чтобы протестировать обобщающую способность наших моделей, мы также применили их напрямую к популярному набору новостных данных CNN/DM.
На этот раз мы оценивали модели, попросив разметчиков оценить их по шкале от 1 до 7.
Подход
Диаграмма нашего метода, которая похожа на метод, используемый в нашей предыдущей работе.
Наш основной метод состоит из четырех этапов: обучение исходной модели суммаризации, сбор датасета человеческих сравнений аннотаций, обучение модели вознаграждения для предсказания аннотации, предпочитаемой человеком, и последующее дообучение моделей суммаризации с помощью RL для получения высокого вознаграждения.
Мы обучили несколько базовых моделей с учителем, начиная с трансформерных моделей в стиле GPT, обученных на текстах из интернета, 20 и дообучая их предсказывать написанный человеком TL; DR с помощью обучения с учителем. Мы в основном используем модели с 1,3 и 6,7 миллиарда параметров. В качестве проверки на адекватность мы подтвердили, что эта процедура обучения приводит к конкурентоспособным результатам
Затем мы собрали набор данных оценок качества людьми. Для каждой оценки человек сравнивает две аннотации конкретного поста и выбирает ту, которая, по его мнению, лучше.
Наконец, мы оптимизируем политику относительно модели вознаграждения с помощью RL. Мы используем PPO с общим количеством в 1 миллион эпизодов, где каждый эпизод заключается в суммаризации одной статьи политикой с последующим получением вознаграждения r. Мы добавляем KL-штраф, который стимулирует политику оставаться близкой к исходной инициализации с учителем.
Сбор данных от людей
Любая процедура обучения, использующая человеческую обратную связь, напрямую зависит от конкретных людей, размечающих данные. В нашей предыдущей работе по дообучению языковых моделей на основе человеческих предпочтений7 наши разметчики часто давали высокие оценки аннотациям, которые мы считали средними, что отражалось на качестве наших обученных моделей.
В ответ на это в данном проекте мы вложили значительные средства в обеспечение высокого качества данных. Мы наняли около 80 подрядчиков через сторонние сайты-посредники
Оптимизация модели вознаграждения
Оптимизация на основе нашей модели вознаграждения должна согласовывать нашу стратегию (policy) с человеческими предпочтениями. Но модель вознаграждения — это лишь прокси для человеческих предпочтений, так как она анализирует лишь небольшой объем данных для сравнения из узкого распределения аннотаций (самари). Хотя модель вознаграждения хорошо справляется с теми типами аннотаций, на которых она обучалась, мы хотели узнать, насколько сильно мы можем ее оптимизировать, прежде чем она начнет давать бесполезные оценки.
Мы обучали стратегии при различных «уровнях оптимизации» на основе модели вознаграждения и просили наших разметчиков оценить аннотации, полученные от этих моделей. Мы делали это, варьируя коэффициент Кульбака — Лейблера (KL), который определяет баланс между стремлением получить более высокое вознаграждение и стремлением оставаться близкими к исходной стратегии с учителем. Мы выяснили, что лучшие образцы имеют примерно такое же предсказанное вознаграждение, как и 99-й перцентиль эталонных аннотаций из датасета. В конечном счете избыточная оптимизация модели вознаграждения только ухудшает результат.
Ограничения
Если у нас есть четкое представление о желаемом поведении модели, наш метод обучения на основе отзывов людей позволяет нам оптимизировать модель под это поведение. Однако это не метод определения того, каким именно должно быть желаемое поведение модели. Решить, что делает аннотацию хорошей, относительно просто, но для задач с более сложными целями, где мнения разных людей о правильном поведении модели могут расходиться, потребуется проявить особую осторожность. В таких случаях вряд ли уместно использовать оценки исследователей в качестве «золотого стандарта»; скорее, в процесс определения «хорошего» поведения должны быть вовлечены представители групп, на которые повлияет эта технология, а также нанятые в качестве разметчиков специалисты для закрепления такого поведения в модели.
Мы проводили обучение на датасете Reddit TL; DR1, поскольку задача суммаризации здесь значительно сложнее, чем на CNN/DM. Однако, поскольку датасет состоит из постов пользователей с минимальной модерацией, они иногда содержат оскорбительный контент или отражают вредные социальные предвзятости. Это означает, что наши модели могут генерировать предвзятые или оскорбительные аннотации, так как они обучались на суммаризации такого контента.
Часть нашего успеха заключается в масштабировании модели вознаграждения и размера стратегии. Для этого требуется значительный объем вычислительных ресурсов, доступных далеко не всем исследователям: в частности, дообучение нашей модели с 6,7 млрд параметров с помощью RL потребовало около 320 GPU-дней. Тем не менее, поскольку небольшие модели, обученные с использованием отзывов людей, могут превосходить по производительности гораздо более крупные модели, наша процедура оказывается более экономически эффективной, чем простое масштабирование для обучения высококачественных моделей под конкретные задачи.
Хотя мы превосходим написанные людьми эталонные аннотации в TL; DR, наши модели, вероятно, еще не достигли уровня человеческой производительности, поскольку базовые эталонные аннотации для TL; DR и CNN/DM не обладают максимально возможным качеством. Оценивая аннотации нашей модели для TL; DR по 7-балльной шкале по нескольким критериям качества (точность, полнота охвата, согласованность и общее впечатление), разметчики отмечают, что наши модели все еще могут генерировать неточные аннотации, и выставляют идеальную оценку общего впечатления в 45% случаев.
Направления будущих исследований
Мы заинтересованы в масштабировании человеческой обратной связи на задачи, где люди не могут легко оценить качество результатов работы модели. Например, мы можем захотеть, чтобы наши модели отвечали на вопросы, на проверку которых у людей ушло бы много времени и исследований; получение достаточного количества человеческих оценок для обучения наших моделей таким способом заняло бы слишком много времени. Один из подходов к решению этой проблемы — предоставление людям инструментов, помогающих оценивать быстрее и точнее. Если эти инструменты используют машинное обучение, мы также можем улучшать их с помощью отзывов людей, что позволит людям точно оценивать результаты работы моделей для все более сложных задач.
Помимо решения более сложных задач, мы также изучаем различные типы обратной связи, выходящие за рамки бинарных сравнений: мы можем просить людей предоставлять демонстрации, редактировать результаты работы моделей для их улучшения или давать объяснения, почему один результат модели лучше другого. Мы хотели бы выяснить, какие виды обратной связи наиболее эффективны для обучения моделей, согласованных с человеческими предпочтениями.
Если вам интересно работать над этими исследовательскими задачами, мы ищем сотрудников!
Сноски
Источники
Авторы
Благодарности
Мы хотели бы поблагодарить следующих людей, которые оставили отзывы о различных итерациях этой записи в блоге: Дуве Кила (Douwe Kiela), Зак Липтон (Zach Lipton), Алекс Ирпан (Alex Irpan), Джек Кларк (Jack Clark), Джейкоб Хилтон (Jacob Hilton), Раул Пури (Raul Puri), Майлз Брандадж (Miles Brundage), Грег Брокман (Greg Brockman), Илья Суцкевер (Ilya Sutskever), Келли Симс (Kelly Sims), Войцех Крысински (Wojciech Kryscinski) и Дзимитрий Бахадау (Dzimitry Bahdanau). Мы также хотели бы поблагодарить Джастина Джея Ванга (Justin Jay Wang) за разработку дизайна поста в блоге, Эшли Пилиписин (Ashley Pilipiszyn) за редактуру, Алека Радфорда (Alec Radford) и Дарио Амодеи (Dario Amodei) за руководство проектом, Шэна Картера (Shan Carter) за помощь в создании основной схемы, Гретхен Крюгер (Gretchen Krueger) за соавторство карточки модели, Бет Барнс (Beth Barnes) за помощь в найме разметчиков и общую поддержку, а также многих других сотрудников OpenAI за обучение наших крупных предобученных моделей, поддержку посредством улучшений и обслуживания вычислительной инфраструктуры и написание быстрых ядер графического процессора. Наконец, мы хотели бы поблагодарить всех наших подрядчиков за предоставление данных, которые были необходимы для обучения моделей в этом посте.
Полный текст статьи читайте на OpenAI
