Суммаризация книг с использованием человеческой обратной связи

Масштабирование человеческого контроля над системами ИИ в задачах, которые трудно поддаются оценке.

Summarizing Books

Чтобы в будущем безопасно развертывать мощный искусственный интеллект общего назначения, нам необходимо убедиться, что модели машинного обучения действуют в соответствии с человеческими намерениями. Эта проблема известна как проблема согласования (alignment problem).

Масштабируемое решение проблемы согласования должно работать с задачами, результаты которых сложно или долго оценивать людям. Чтобы протестировать методы масштабируемого согласования, мы обучили модель суммаризировать целые книги, как показано в следующих примерах.A Наша модель работает следующим образом: сначала она суммаризирует небольшие разделы книги, затем сводит эти краткие изложения в резюме более высокого уровня и так далее.

Наша лучшая модель дообучена на базе GPT‑3 и генерирует осмысленные аннотации к целым книгам, порой даже достигая среднего качества резюме, написанных людьми: она получает оценку 6/7 (что аналогично среднему резюме, написанному человеком) от людей, прочитавших книгу, в 5% случаев, и оценку 5/7 в 15% случаев. Наша модель также демонстрирует передовые результаты на датасете BookSum для суммаризации книг. Модель вопросно-ответной системы в режиме zero-shot может использовать резюме нашей модели для получения конкурентоспособных результатов на датасете NarrativeQA для ответов на вопросы по текстам книг.B

Наш подход: сочетание обучения с подкреплением на основе отзывов людей и рекурсивной декомпозиции задач

Рассмотрим задачу суммаризации текста. Крупные предобученные модели не очень хорошо справляются с суммаризацией. В прошлом мы обнаружили, что обучение модели с помощью обучения с подкреплением на основе предпочтений человека помогает согласовывать резюме моделей с человеческими предпочтениями для коротких постов и статей. Но оценивать резюме целых книг напрямую требует огромных усилий, так как человеку пришлось бы прочитать всю книгу целиком, а это занимает много часов.

Чтобы решить эту проблему, мы дополнительно используем рекурсивную декомпозицию задач: мы процедурно разбиваем сложную задачу на более простые. В данном случае мы разделяем задачу суммаризации длинного текста на суммаризацию нескольких более коротких фрагментов. По сравнению с методом сквозного (end-to-end) обучения, рекурсивная декомпозиция имеет следующие преимущества:

  1. Декомпозиция позволяет людям быстрее оценивать резюме модели, используя краткие изложения меньших частей книги вместо чтения исходного текста.
  2. Процесс создания резюме становится проще отслеживать. Например, можно проследить, в каком именно месте оригинального текста происходят те или иные события из резюме. Оцените это сами в нашем проводнике по резюме!
  3. Наш метод можно использовать для суммаризации книг неограниченной длины, не ограничиваясь длиной контекста используемых трансформерных моделей.

Почему мы работаем над этим

Эта работа является частью наших текущихисследований в области согласования продвинутых систем ИИ, что имеет ключевое значение для нашей миссии. По мере того как мы обучаем наши модели выполнять все более сложные задачи, людям будет все труднее делать осознанные оценки результатов их работы. Это усложняет обнаружение скрытых проблем в результатах моделей, которые могут привести к негативным последствиям при их развертывании. Поэтому мы хотим, чтобы наша способность оценивать модели росла вместе с ростом их возможностей.

Наш текущий подход к этой проблеме заключается в том, чтобы дать людям возможность оценивать результаты работы моделей машинного обучения с помощью других моделей. В данном случае для оценки аннотаций к книгам мы предоставляем людям резюме отдельных глав, написанные нашей моделью, что экономит им время по сравнению с чтением исходного текста. Наш прогресс в области суммаризации книг — это первая крупномасштабная эмпирическая работа по масштабированию методов согласования.

В дальнейшем мы планируем исследовать новые способы помощи людям в оценке поведения моделей с целью поиска методов, масштабируемых до уровня согласования искусственного интеллекта общего назначения (AGI).

Мы всегда ищем талантливых людей, готовых присоединиться к нам; если эта работа вам интересна, пожалуйста, подайте заявку на вступление в нашу команду!

Сноски

  1. A

    Эти примеры были выбраны из произведений, находящихся в общественном достоянии, и являются частью предобучающих данных GPT-3. Чтобы исключить влияние этого фактора и исключительно в исследовательских целях, в нашей научной работе оцениваются аннотации к книгам, с которыми модель ранее никогда не сталкивалась.

  2. B

    Мы внесли изменения в наше первоначальное утверждение о результатах на NarrativeQA после того, как узнали о предыдущих исследованиях с лучшими результатами, чем у нас.

Авторы

Jeffrey Wu, Ryan Lowe, Jan Leike

Благодарности

Мы хотели бы выразить признательность нашим соавторам статьи: Лонгу Оуяну (Long Ouyang), Дэниелу Циглеру (Daniel Ziegler), Нисану Стьеннону (Nisan Stiennon) и Полу Кристиано (Paul Christiano).

Спасибо следующим лицам за отзывы об этом релизе: Стиву Даулингу (Steve Dowling), Ханне Вонг (Hannah Wong), Майлзу Брандаджу (Miles Brundage), Гретхен Крюгер (Gretchen Krueger), Илье Суцкевичу (Ilya Sutskever) и Сэму Альтману (Sam Altman).

Благодарности

Дизайн: Джастин Джей Ван (Justin Jay Wang)

Иллюстрация на обложке книги: DALL·E

Полный текст статьи читайте на OpenAI