Темы



Суммаризация книг с использованием человеческой обратной связи

Масштабирование человеческого контроля над системами ИИ в задачах, которые трудно поддаются оценке.

Summarizing Books

Чтобы в будущем безопасно развертывать мощный искусственный интеллект общего назначения, нам необходимо убедиться, что модели машинного обучения действуют в соответствии с человеческими намерениями. Эта проблема известна как проблема согласования (alignment problem).

Масштабируемое решение проблемы согласования должно работать с задачами, результаты которых сложно или долго оценивать людям. Чтобы протестировать методы масштабируемого согласования, мы обучили модель суммаризировать целые книги, как показано в следующих примерах.A Наша модель работает следующим образом: сначала она суммаризирует небольшие разделы книги, затем сводит эти краткие изложения в резюме более высокого уровня и так далее.

Наша лучшая модель дообучена на базе GPT‑3 и генерирует осмысленные аннотации к целым книгам, порой даже достигая среднего качества резюме, написанных людьми: она получает оценку 6/7 (что аналогично среднему резюме, написанному человеком) от людей, прочитавших книгу, в 5% случаев, и оценку 5/7 в 15% случаев. Наша модель также демонстрирует передовые результаты на датасете BookSum⁠ для суммаризации книг. Модель вопросно-ответной системы в режиме zero-shot может использовать резюме нашей модели для получения конкурентоспособных результатов на датасете NarrativeQA⁠ для ответов на вопросы по текстам книг.B

Наш подход: сочетание обучения с подкреплением на основе отзывов людей и рекурсивной декомпозиции задач

Рассмотрим задачу суммаризации текста. Крупные предобученные модели не очень хорошо справляются с суммаризацией⁠. В прошлом мы обнаружили, что обучение модели с помощью обучения с подкреплением на основе предпочтений человека⁠ помогает согласовывать резюме моделей с человеческими предпочтениями для коротких постов и статей. Но оценивать резюме целых книг напрямую требует огромных усилий, так как человеку пришлось бы прочитать всю книгу целиком, а это занимает много часов.

Чтобы решить эту проблему, мы дополнительно используем рекурсивную декомпозицию задач: мы процедурно разбиваем сложную задачу на более простые. В данном случае мы разделяем задачу суммаризации длинного текста на суммаризацию нескольких более коротких фрагментов. По сравнению с методом сквозного (end-to-end) обучения, рекурсивная декомпозиция имеет следующие преимущества:

  1. Декомпозиция позволяет людям быстрее оценивать резюме модели, используя краткие изложения меньших частей книги вместо чтения исходного текста.
  2. Процесс создания резюме становится проще отслеживать. Например, можно проследить, в каком именно месте оригинального текста происходят те или иные события из резюме. Оцените это сами в нашем проводнике по резюме⁠!
  3. Наш метод можно использовать для суммаризации книг неограниченной длины, не ограничиваясь длиной контекста используемых трансформерных моделей.

Почему мы работаем над этим

Эта работа является частью наших текущих⁠исследований⁠ в области согласования продвинутых систем ИИ, что имеет ключевое значение для нашей миссии.⁠ По мере того как мы обучаем наши модели выполнять все более сложные задачи, людям будет все труднее делать осознанные оценки результатов их работы. Это усложняет обнаружение скрытых проблем в результатах моделей, которые могут привести к негативным последствиям при их развертывании. Поэтому мы хотим, чтобы наша способность оценивать модели росла вместе с ростом их возможностей.

Наш текущий подход к этой проблеме заключается в том, чтобы дать людям возможность оценивать результаты работы моделей машинного обучения с помощью других моделей⁠. В данном случае для оценки аннотаций к книгам мы предоставляем людям резюме отдельных глав, написанные нашей моделью, что экономит им время по сравнению с чтением исходного текста. Наш прогресс в области суммаризации книг — это первая крупномасштабная эмпирическая работа по масштабированию методов согласования.

В дальнейшем мы планируем исследовать новые способы помощи людям в оценке поведения моделей с целью поиска методов, масштабируемых до уровня согласования искусственного интеллекта общего назначения (AGI).

Мы всегда ищем талантливых людей, готовых присоединиться к нам; если эта работа вам интересна, пожалуйста, подайте заявку на вступление в нашу команду⁠!

Сноски

  1. A

    Эти примеры были выбраны из произведений, находящихся в общественном достоянии⁠, и являются частью предобучающих данных GPT-3. Чтобы исключить влияние этого фактора и исключительно в исследовательских целях, в нашей научной работе⁠ оцениваются аннотации к книгам, с которыми модель ранее никогда не сталкивалась.

  2. B

    Мы внесли изменения в наше первоначальное утверждение о результатах на NarrativeQA после того, как узнали о предыдущих исследованиях с лучшими результатами, чем у нас.

Авторы

Jeffrey Wu, Ryan Lowe, Jan Leike

Благодарности

Мы хотели бы выразить признательность нашим соавторам статьи: Лонгу Оуяну (Long Ouyang), Дэниелу Циглеру (Daniel Ziegler), Нисану Стьеннону (Nisan Stiennon) и Полу Кристиано (Paul Christiano).

Спасибо следующим лицам за отзывы об этом релизе: Стиву Даулингу (Steve Dowling), Ханне Вонг (Hannah Wong), Майлзу Брандаджу (Miles Brundage), Гретхен Крюгер (Gretchen Krueger), Илье Суцкевичу (Ilya Sutskever) и Сэму Альтману (Sam Altman).

Благодарности

Дизайн: Джастин Джей Ван (Justin Jay Wang)

Иллюстрация на обложке книги: DALL·E⁠

Полный текст статьи читайте на OpenAI