Обучение суммаризации с использованием обратной связи от человека

Мы применили обучение с подкреплением на основе отзывов людей для тренировки языковых моделей, которые лучше справляются с суммаризацией текста.

Читать научную работуПосмотреть примеры
Learning To Summarize With Human Feedback

Почему это важно

Наши модели создают аннотации, которые превосходят по качеству аннотации от моделей, в 10 раз превышающих их по размеру и обученных исключительно с помощью обучения с учителем. Несмотря на то, что мы обучаем наши модели на наборе данных Reddit TL; DR, они успешно применяются для создания качественных аннотаций новостных статей CNN/DailyMail без какой-либо дополнительной точной настройки. Наши методы не ограничиваются только созданием аннотаций; в долгосрочной перспективе наша цель — сделать согласование систем ИИ с человеческими предпочтениями центральным компонентом исследований и развертывания ИИ во многих областях.

Крупномасштабные языковые модели демонстрируют все большую эффективность в задачах НЛП (обработки естественного языка). Обычно эти модели обучаются с целью предсказания следующего слова на датасете текстов, написанных людьми. Однако эта цель не полностью отражает то, чего мы на самом деле хотим: как правило, мы стремимся не к тому, чтобы наши модели имитировали людей, а к тому, чтобы они выдавали качественные ответы. Это несоответствие становится очевидным, когда модель обучается подражать низкокачественному человеческому тексту, но оно может проявляться и более тонким образом. Например, модель, обученная предсказывать слова человека, может выдумывать факты при неуверенности или генерировать предложения, отражающие вредные социальные предвзятости. Оба этих сбойных режима хорошо описаны в литературе.3, 4, 5, 6

В рамках нашей работы по безопасности мы хотим разработать методы, которые согласуют цели наших моделей с конечным поведением, которое действительно имеет для нас значение. По мере того как модели становятся мощнее, мы верим, что согласование их целей с нашими будет иметь решающее значение для обеспечения их пользы для людей. В краткосрочной перспективе мы хотели проверить, могут ли методы использования человеческой обратной связи помочь нашим моделям улучшить производительность в полезных задачах.

Мы сосредоточились на суммаризации текста на английском языке, поскольку это сложная задача, в которой само понятие «хорошей аннотации» трудно формализовать без участия человека. Мы применяем наш метод главным образом к существующему набору данных1 публикаций в социальной сети RedditB вместе с написанными людьми «TL; DR» (краткими резюме, составленными авторами постов).

Сначала мы обучаем модель вознаграждения посредством обучения с учителем для предсказания того, какие аннотации понравятся людям.A Затем мы производим дообучение языковой модели с помощью обучения с подкреплением (RL), чтобы она создавала аннотации, получающие высокую оценку от модели вознаграждения. Мы обнаружили, что это значительно повышает качество аннотаций по оценкам людей, даже на наборах данных, сильно отличающихся от тех, что использовались для дообучения.

Наш подход напрямую продолжает нашу предыдущую работу по обучению на основе человеческой обратной связи.7 Существуют и другие работы, посвященные использованию человеческой обратной связи для обучения моделей суммаризации.8 Мы развиваем этот подход дальше за счет масштабирования до более крупных моделей, сбора большего объема данных обратной связи, тщательного мониторинга согласованности между исследователями и разметчиками, а также предоставления разметчикам регулярных отзывов. Человеческая обратная связь также использовалась для обучения моделей в ряде других областей: в диалоговых системах, 9, 10, 11 семантическом парсинге, 12 переводе, 13, 14 генерации историй15 и отзывов, 16 извлечении доказательств17 и более традиционных задачах обучения с подкреплением.18, 19

Результаты

Мы оценили несколько различных моделей суммаризации: некоторые из них были предварительно обучены на широком распределении текстов из интернета, некоторые — дообучены с помощью обучения с учителем для предсказания TL; DR, а некоторые — дообучены с использованием человеческой обратной связи.D Для оценки каждой модели мы попросили ее составить аннотации для постов из валидационного набора, после чего люди сравнили эти аннотации с написанными человеком TL; DR. Результаты показаны на Рисунке 1.

Мы выяснили, что дообучение с подкреплением на основе человеческой обратной связи оказывает колоссальное влияние на качество по сравнению как с дообучением с учителем, так и с увеличением размера модели. В частности, наша модель с 1,3 миллиарда параметров (1,3B), обученная с использованием человеческой обратной связи, превосходит модель с 12 миллиардами параметров, обученную исключительно с учителем. Аннотации, созданные нашими моделями с человеческой обратной связью (на 1,3B и 6,7B параметров), разметчики предпочитают оригинальным написанным человеком TL; DR из набора данных.E

При написании аннотаций люди делают различные компромиссы, в том числе между лаконичностью и полнотой охвата исходного текста; в зависимости от назначения аннотации могут предпочтительными оказывать тексты разной длины. Наши разметчики склонны предпочитать более длинные аннотации, поэтому наши модели адаптировались к этому предпочтению и сошлись к максимально допустимой длине. Контроль длины снизил предпочтение людьми аннотаций нашей модели на 6,7B с 70% до 65%, что объясняет лишь меньшую часть наших достижений.F

Результаты переноса (трансфера)

Чтобы протестировать обобщающую способность наших моделей, мы также применили их напрямую к популярному набору новостных данных CNN/DM.2 Эти статьи более чем в два раза длиннее постов на Reddit и написаны в совершенно другом стиле. Наши модели видели новостные статьи во время предварительного обучения, однако все данные от людей и дообучение с подкреплением (RL) выполнялись исключительно на датасете Reddit TL; DR.

На этот раз мы оценивали модели, попросив разметчиков оценить их по шкале от 1 до 7.G Мы обнаружили, что модели, обученные на человеческой обратной связи, успешно переносят свои навыки на создание отличных кратких аннотаций новостных статей без какого-либо дополнительного обучения. При контроле длины аннотаций наша модель с человеческой обратной связью на 6,7B генерирует резюме, которые оцениваются выше, чем эталонные аннотации CNN/DM, написанные людьми. Это говорит о том, что наши модели с человеческой обратной связью усвоили нечто более универсальное о том, как суммаризировать текст, и их возможности не ограничиваются только постами на Reddit.

Подход

Approach

Диаграмма нашего метода, которая похожа на метод, используемый в нашей предыдущей работе.

Наш основной метод состоит из четырех этапов: обучение исходной модели суммаризации, сбор датасета человеческих сравнений аннотаций, обучение модели вознаграждения для предсказания аннотации, предпочитаемой человеком, и последующее дообучение моделей суммаризации с помощью RL для получения высокого вознаграждения.

Мы обучили несколько базовых моделей с учителем, начиная с трансформерных моделей в стиле GPT, обученных на текстах из интернета, 20 и дообучая их предсказывать написанный человеком TL; DR с помощью обучения с учителем. Мы в основном используем модели с 1,3 и 6,7 миллиарда параметров. В качестве проверки на адекватность мы подтвердили, что эта процедура обучения приводит к конкурентоспособным результатамH на датасете CNN/DM.

Затем мы собрали набор данных оценок качества людьми. Для каждой оценки человек сравнивает две аннотации конкретного поста и выбирает ту, которая, по его мнению, лучше.I Мы используем эти данные для обучения модели вознаграждения, которая сопоставляет пару (пост, аннотация) с наградой r. Модель вознаграждения обучается предсказывать, какой аннотации человек отдаст предпочтение, используя награды в качестве логитов.

Наконец, мы оптимизируем политику относительно модели вознаграждения с помощью RL. Мы используем PPO с общим количеством в 1 миллион эпизодов, где каждый эпизод заключается в суммаризации одной статьи политикой с последующим получением вознаграждения r. Мы добавляем KL-штраф, который стимулирует политику оставаться близкой к исходной инициализации с учителем.

Сбор данных от людей

Любая процедура обучения, использующая человеческую обратную связь, напрямую зависит от конкретных людей, размечающих данные. В нашей предыдущей работе по дообучению языковых моделей на основе человеческих предпочтений7 наши разметчики часто давали высокие оценки аннотациям, которые мы считали средними, что отражалось на качестве наших обученных моделей.

В ответ на это в данном проекте мы вложили значительные средства в обеспечение высокого качества данных. Мы наняли около 80 подрядчиков через сторонние сайты-посредникиJ и платили им почасовую ставку независимо от количества оцененных аннотаций.K Наем подрядчиков вместо использования краудсорсинговых платформ позволил нам поддерживать тесный контакт с разметчиками: мы создали процесс онбординга, разработали веб-сайт с настраиваемым интерфейсом для разметки, отвечали на вопросы в общем чате и проводили индивидуальные видеозвонки с разметчиками. Мы также позаботились о том, чтобы четко донести наше определение качества аннотаций (после того как сами потратили много времени на чтение резюме), и тщательно отслеживали уровень согласия между нами и разметчиками на протяжении всего проекта.

Оптимизация модели вознаграждения

Оптимизация на основе нашей модели вознаграждения должна согласовывать нашу стратегию (policy) с человеческими предпочтениями. Но модель вознаграждения — это лишь прокси для человеческих предпочтений, так как она анализирует лишь небольшой объем данных для сравнения из узкого распределения аннотаций (самари). Хотя модель вознаграждения хорошо справляется с теми типами аннотаций, на которых она обучалась, мы хотели узнать, насколько сильно мы можем ее оптимизировать, прежде чем она начнет давать бесполезные оценки.

Мы обучали стратегии при различных «уровнях оптимизации» на основе модели вознаграждения и просили наших разметчиков оценить аннотации, полученные от этих моделей. Мы делали это, варьируя коэффициент Кульбака — Лейблера (KL), который определяет баланс между стремлением получить более высокое вознаграждение и стремлением оставаться близкими к исходной стратегии с учителем. Мы выяснили, что лучшие образцы имеют примерно такое же предсказанное вознаграждение, как и 99-й перцентиль эталонных аннотаций из датасета. В конечном счете избыточная оптимизация модели вознаграждения только ухудшает результат.

Ограничения

Если у нас есть четкое представление о желаемом поведении модели, наш метод обучения на основе отзывов людей позволяет нам оптимизировать модель под это поведение. Однако это не метод определения того, каким именно должно быть желаемое поведение модели. Решить, что делает аннотацию хорошей, относительно просто, но для задач с более сложными целями, где мнения разных людей о правильном поведении модели могут расходиться, потребуется проявить особую осторожность. В таких случаях вряд ли уместно использовать оценки исследователей в качестве «золотого стандарта»; скорее, в процесс определения «хорошего» поведения должны быть вовлечены представители групп, на которые повлияет эта технология, а также нанятые в качестве разметчиков специалисты для закрепления такого поведения в модели.

Мы проводили обучение на датасете Reddit TL; DR1, поскольку задача суммаризации здесь значительно сложнее, чем на CNN/DM. Однако, поскольку датасет состоит из постов пользователей с минимальной модерацией, они иногда содержат оскорбительный контент или отражают вредные социальные предвзятости. Это означает, что наши модели могут генерировать предвзятые или оскорбительные аннотации, так как они обучались на суммаризации такого контента.

Часть нашего успеха заключается в масштабировании модели вознаграждения и размера стратегии. Для этого требуется значительный объем вычислительных ресурсов, доступных далеко не всем исследователям: в частности, дообучение нашей модели с 6,7 млрд параметров с помощью RL потребовало около 320 GPU-дней. Тем не менее, поскольку небольшие модели, обученные с использованием отзывов людей, могут превосходить по производительности гораздо более крупные модели, наша процедура оказывается более экономически эффективной, чем простое масштабирование для обучения высококачественных моделей под конкретные задачи.

Хотя мы превосходим написанные людьми эталонные аннотации в TL; DR, наши модели, вероятно, еще не достигли уровня человеческой производительности, поскольку базовые эталонные аннотации для TL; DR и CNN/DM не обладают максимально возможным качеством. Оценивая аннотации нашей модели для TL; DR по 7-балльной шкале по нескольким критериям качества (точность,  полнота охвата,  согласованность и общее впечатление), разметчики отмечают, что наши модели все еще могут генерировать неточные аннотации, и выставляют идеальную оценку общего впечатления в 45% случаев.L Кроме того, из соображений экономии мы не проводим прямого сравнения с выделением аналогичного бюджета на сбор высококачественных демонстраций и обучение на них с использованием стандартного дообучения с учителем.

Направления будущих исследований

Мы заинтересованы в масштабировании человеческой обратной связи на задачи, где люди не могут легко оценить качество результатов работы модели. Например, мы можем захотеть, чтобы наши модели отвечали на вопросы, на проверку которых у людей ушло бы много времени и исследований; получение достаточного количества человеческих оценок для обучения наших моделей таким способом заняло бы слишком много времени. Один из подходов к решению этой проблемы — предоставление людям инструментов, помогающих оценивать быстрее и точнее. Если эти инструменты используют машинное обучение, мы также можем улучшать их с помощью отзывов людей, что позволит людям точно оценивать результаты работы моделей для все более сложных задач.23

Помимо решения более сложных задач, мы также изучаем различные типы обратной связи, выходящие за рамки бинарных сравнений: мы можем просить людей предоставлять демонстрации, редактировать результаты работы моделей для их улучшения или давать объяснения, почему один результат модели лучше другого. Мы хотели бы выяснить, какие виды обратной связи наиболее эффективны для обучения моделей, согласованных с человеческими предпочтениями.

Если вам интересно работать над этими исследовательскими задачами, мы ищем сотрудников!

Сноски

  1. 1

    Для обучения мы используем набор данных Reddit TL; DR вместо более популярного набора данных CNN/DM, поскольку простые базовые методы копирования работают лучше, чем написанные людьми эталонные сводки на CNN/DM, чего нельзя сказать о TL; DR (см. Приложение D нашей статьи). Мы провели новый веб-краулинг, чтобы увеличить размер датасета TL; DR, потребовали, чтобы длина сводок составляла от 24 до 48 токенов, а также выполнили некоторую другую очистку и фильтрацию

  2. B

    Мы нанимаем разметчиков-людей для оценки качества сводок и внедряем контроль качества, чтобы гарантировать, что оценки разметчиков совпадают с нашими собственными. Ниже мы описываем нашу процедуру сбора данных от людей.

  3. C

    Интересно, что мы обнаружили, что человеческие оценщики предпочитали базовый подход Lead-3 (взятие первых 3 предложений статьи) эталонным сводкам датасета, и мы сами подтвердили это.

  4. D

    Мы генерируем все наши выборки при температуре 0, которая, как мы выяснили, больше всего нравится людям.

  5. E

    Хотя мы используем написанные людьми TL; DR в качестве основной точки для сравнения, они не всегда представляют собой оптимальную работу человека; иногда они призваны быть забавными или резюмировать только часть поста, а их грамматика и стиль самые разные.

  6. F

    Мы осуществляем контроль, обучая модель логистической регрессии для предсказания предпочитаемой сводки, основываясь только на ID политики и логарифмическом отношении длин сводок. Затем мы публикуем коэффициенты регрессии для каждого ID политики, соответствующие соотношению длины 1 по сравнению с эталонными сводками.

  7. G

    Мы применили этот подход, потому что трудно напрямую сравнивать наши обученные на TL; DR модели с моделями, обученными на CNN/DM; сводки CNN/DM гораздо длиннее и написаны в виде пунктов.

  8. 21

    С точки зрения результатов ROUGE на CNN/DM, наши supervised-модели с 6,7B параметров немного хуже, чем T5 , но немного лучше передовых моделей середины 2019 года.

  9. I

    Наши основные модели обучены примерно на 65 тысячах сравнений, хотя мы достигаем хороших результатов даже при наличии всего 8 тысяч сравнений.

  10. J

    В частности, мы используем Upwork, Scale и Lionbridge. Наши подрядчики имеют разный возраст, пол и уровень образования, и в основном они американцы или филиппинцы (демографические данные см. в Приложении C нашей статьи).

  11. K

    Наши критерии найма подрядчиков были следующими: (1) они были готовы выполнять задачу и (2) они прошли минимальный порог по скорости и согласованию с разметкой исследователей. Мы платили всем нашим подрядчикам не менее 15 долларов в час.

  12. L

    Это впечатляет по сравнению с эталонными сводками TL; DR, которые получают идеальную оценку overall (общую) в 23% случаев, но это указывает на то, что еще есть возможности для улучшения.

Источники

  1. 1

    Völske, M., Potthast, M., Syed, S., & Stein, B. (2017).»TL; DR: Майнинг Reddit для обучения автоматическому реферированию.» В материалах семинара по новым рубежам в реферировании (Proceedings of the Workshop on New Frontiers in Summarization) 2017.

  2. 2

    Hermann, K. M., Kocisky, T., Grefenstette, E., Espeholt, L., Kay, W., Suleyman, M., & Blunsom, P. (2015).» Обучение машин чтению и пониманию.» В Advances in neural information processing systems 2015.

  3. 3

    Maynez, J., Narayan, S., Bohnet, B., & McDonald, R. (2020).»О верности и фактичности в абстрактивном реферировании..» Препринт arXiv.

  4. 4

    Sheng, E., Chang, K. W., Natarajan, P., & Peng, N. (2019).»Женщина работала няней: О предвзятости в генерации языка.» Препринт arXiv.

  5. 5

    Bordia, S., & Bowman, S. R. (2019).»Выявление и снижение гендерной предвзятости в языковых моделях на уровне слов.» Препринт arXiv.

  6. 6

    Nadeem, M., Bethke, A., & Reddy, S. (2020).»StereoSet: Измерение стереотипной предвзятости в предобученных языковых моделях.» Препринт arXiv.

  7. 7

    Ziegler, D. M., Stiennon, N., Wu, J., Brown, T. B., Radford, A., Amodei, D., Christiano, P., & Irving, G. (2019).»Точная настройка языковых моделей на основе человеческих предпочтений.» Препринт arXiv.

  8. 8

    Böhm, F., Gao, Y., Meyer, C. M., Shapira, O., Dagan, I., & Gurevych, I. (2019).»Лучшие награды дают лучшие сводки: обучение реферированию без эталонов.» Препринт arXiv.

  9. 9

    Jaques, N., Ghandeharioun, A., Shen, J. H., Ferguson, C., Lapedriza, A., Jones, N., Gu, S., & Picard, R. (2019).»Внеполитическое пакетное глубокое обучение с подкреплением на основе неявных человеческих предпочтений в диалоге.» Препринт arXiv.

  10. 10

    Yi, S., Goel, R., Khatri, C., Cervone, A., Chung, T., Hedayatnia, B., … & Hakkani-Tur, D. (2019).»К когерентной и увлекательной генерации ответов в разговорном диалоге с использованием автоматических оценщиков беседы.» Препринт arXiv.

  11. 11

    Hancock, B., Bordes, A., Mazare, P. E., & Weston, J. (2019).»Обучение на основе диалога после развертывания: подпитай себя, чат-бот! .» Препринт arXiv.

  12. 12

    Lawrence, C., & Riezler, S. (2018).»Улучшение нейронного семантического парсера посредством контрфактического обучения на основе обратной связи человеческого бандита.» Препринт arXiv.

  13. 13

    Kreutzer, J., Khadivi, S., Matusov, E., & Riezler, S. (2018).»Можно ли улучшить нейронный машинный перевод с помощью отзывов пользователей? .» Препринт arXiv.

  14. 14

    Bahdanau, D., Brakel, P., Xu, K., Goyal, A., Lowe, R., Pineau, J., … & Bengio, Y. (2016).»Алгоритм «актер-критик» для предсказания последовательностей.» Препринт arXiv.

  15. 15

    Zhou, W., & Xu, K. (2020).»Обучение сравнению для лучшего обучения и оценки моделей генерации естественного языка открытого домена.» В AAAI 2020.

  16. 16

    Cho, W., & Zhang, P., & Zhang, Y., & Li, X., & Galley, M., & Brockett, C., & Wang, M., & Gao, J. (2018).»К когерентной и связанной генерации текста большой формы.» Препринт arXiv.

  17. 17

    Perez, E., & Karamcheti, S., & Fergus, R., & Weston, J., & Kiela, D., & Cho, K. (2019).» Поиск обобщаемых свидетельств путем обучения убеждению моделей вопрос-ответ (Q&A).» Препринт arXiv.

  18. 18

    Christiano, P. F., Leike, J., Brown, T., Martic, M., Legg, S., & Amodei, D. (2017).»Глубокое обучение с подкреплением на основе человеческих предпочтений.» В Advances in Neural Information Processing Systems 2017.

  19. 19

    Ibarz, B., Leike, J., Pohlen, T., Irving, G., Legg, S., & Amodei, D. (2018).»Обучение наград на основе человеческих предпочтений и демонстраций в Atari.» В Advances in Neural Information Processing Systems 2018.

  20. 20

    Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., … & Agarwal, S. (2020).» Языковые модели являются обучаемыми с минимальным количеством примеров (few-shot learners).» Препринт arXiv.

  21. 21

    Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., … & Liu, P. J. (2019).» Исследование пределов трансфертного обучения с помощью унифицированного трансформера «текст-текст».» Препринт arXiv.

  22. 22

    Zhang, Y., Li, D., Wang, Y., Fang, Y., & Xiao, W. (2019).» Исследование пределов трансфертного обучения с помощью унифицированного трансформера «текст-текст».» В Applied Sciences.

  23. 23

    Christiano, P., Shlegeris, B., & Amodei, D. (2018).» Контроль сильных учеников путем усиления слабых экспертов.» Препринт arXiv.

Авторы

Нисан Стеннон (Nisan Stiennon), Пол Кристиано (Paul Christiano), Дэниел Циглер (Daniel Ziegler), Райан Лоу (Ryan Lowe), Джеффри Ву (Jeffrey Wu), Челси Восс (Chelsea Voss), Лонг Оуян (Long Ouyang)

Благодарности

Мы хотели бы поблагодарить следующих людей, которые оставили отзывы о различных итерациях этой записи в блоге: Дуве Кила (Douwe Kiela), Зак Липтон (Zach Lipton), Алекс Ирпан (Alex Irpan), Джек Кларк (Jack Clark), Джейкоб Хилтон (Jacob Hilton), Раул Пури (Raul Puri), Майлз Брандадж (Miles Brundage), Грег Брокман (Greg Brockman), Илья Суцкевер (Ilya Sutskever), Келли Симс (Kelly Sims), Войцех Крысински (Wojciech Kryscinski) и Дзимитрий Бахадау (Dzimitry Bahdanau). Мы также хотели бы поблагодарить Джастина Джея Ванга (Justin Jay Wang) за разработку дизайна поста в блоге, Эшли Пилиписин (Ashley Pilipiszyn) за редактуру, Алека Радфорда (Alec Radford) и Дарио Амодеи (Dario Amodei) за руководство проектом, Шэна Картера (Shan Carter) за помощь в создании основной схемы, Гретхен Крюгер (Gretchen Krueger) за соавторство карточки модели, Бет Барнс (Beth Barnes) за помощь в найме разметчиков и общую поддержку, а также многих других сотрудников OpenAI за обучение наших крупных предобученных моделей, поддержку посредством улучшений и обслуживания вычислительной инфраструктуры и написание быстрых ядер графического процессора. Наконец, мы хотели бы поблагодарить всех наших подрядчиков за предоставление данных, которые были необходимы для обучения моделей в этом посте.

Полный текст статьи читайте на OpenAI