Улучшение поведения языковых моделей посредством обучения на отборном наборе данных

Наше последнее исследование показывает, что мы можем улучшить поведение языковых моделей в отношении конкретных поведенческих ценностей с помощью дообучения на небольшом специализированном наборе данных.

Читать документ
Improving Language Model Behavior By Training On A Curated Dataset

Мы обнаружили, что можем улучшить поведение языковых моделей в отношении конкретных поведенческих ценностей путем дообучения на тщательно отобранном наборе данных, содержащем менее 100 примеров проявления этих ценностей. Мы также выяснили, что этот процесс становится более эффективным по мере увеличения моделей. Хотя этот метод еще находится на начальной стадии развития, мы ищем пользователей API OpenAI, которые хотели бы опробовать его и заинтересованы в поиске способов применения этих и других методов в реальных сценариях использования.

Языковые модели могут выдавать практически любой текст в любом тоне или стиле в зависимости от пользовательского ввода. Наш подход призван предоставить операторам языковых моделей инструменты для сужения этого универсального набора поведений до ограниченного набора ценностей. Хотя OpenAI предоставляет защитные механизмы и мониторинг для обеспечения соответствия вариантов использования моделей нашемуУставу, мы рассматриваем выбор точного набора ценностей, совместимых с Уставом, как задачу, которую наши пользователи должны решить для своих конкретных приложений.

Наши качественные проверки показывают, что модели, ориентированные на определенные ценности, в целом более строго следовали желаемому поведенческому образцу: A

Адекватное или желательное поведение языковой модели, подобно надлежащему человеческому поведению, не может быть сведено к одному универсальному стандарту; желательное поведение различается в зависимости от приложения и социального контекста. Мы разработали процесс улучшения поведения в заданном социальном контексте путем создания набора данных, ориентированного на определенные ценности. Наш анализ показывает статистически значимое улучшение поведения без ущерба для производительности при выполнении основных задач. Он также показывает, что наш процесс более эффективен для более крупных моделей, что означает, что люди смогут использовать относительно меньшее количество примеров для адаптации поведения больших языковых моделей к собственным ценностям. Поскольку формулирование ценностей для больших групп людей сопряжено с риском маргинализации меньшинств, мы стремились сделать наш процесс относительно масштабируемым по сравнению с переобучением с нуля.

Наш процесс

Мы разработали наш процесс в ходе работы над сценарием использования для клиента API с целью достижения уважительного поведения. Мы выполнили следующие шаги:

Шаг первый: категории деликатных тем и описание желательного поведения

Мы выбрали категории, которые, по нашим оценкам, имеют прямое влияние на благополучие человека, и описали желательное поведение в каждой категории, опираясь главным образом на американское и международное законодательство в области прав человека, а также на западные социальные движения за равенство людей, такие как Движение за гражданские права в США.

  • Злоупотребления, насилие и угрозы (включая самоповреждение): противодействие насилию или угрозам; поощрение обращения за помощью к соответствующим органам.
  • Здоровье (физическое и психическое): воздержание от постановки диагнозов или назначения лечения; противодействие нетрадиционным методам лечения как научной альтернативе медицинскому лечению.
  • Человеческие характеристики и поведение: противодействие нездоровым стандартам красоты или привлекательности; поддержка того факта, что добродетель и привлекательность субъективны.
  • Несправедливость и неравенство (включая дискриминацию социальных групп): противодействие проявлениям несправедливости и неравенства по отношению к людям, а также любой деятельности, усугубляющей их. Сюда входят вредные стереотипы и предрассудки, особенно в отношении социальных групп в соответствии с международным правом.
  • Политические взгляды и дестабилизация: нейтралитет, если это не подрывает права человека или закон; противодействие вмешательству, подрывному для демократических процессов.
  • Отношения (романтические, семейные, дружеские и т. д.): противодействие действиям без согласия или нарушениям доверия; поддержка стандартов, согласованных обеими сторонами, с учетом культурного контекста и личных потребностей.
  • Сексуальная активность (включая порнографию): противодействие незаконной и принудительной сексуальной активности.
  • Терроризм (включая превосходство белой расы): противодействие террористической деятельности или угрозе терроризма.

Обратите внимание, что выбранные нами категории не являются исчерпывающими. Хотя при оценке мы уделяли равное внимание каждой категории, расстановка приоритетов зависит от контекста.

Шаг второй: создание набора данных и дообучение

Мы создали набор текстовых образцов из 80 элементов, ориентированный на определенные ценности; каждый образец был представлен в формате «вопрос-ответ» и содержал от 40 до 340 слов. (Для понимания масштаба: наш набор данных составлял около 120 КБ, что равняется примерно 0,000000211% от объема обучающих данных GPT‑3.B)

Обучение большой языковой модели с нуля требует огромного количества данных. Например, GPT‑3 обучалась на 570 ГБ данных. См. [Brown, Mann, Ryder, Subbiah et al].

Затем мы дообучили модели GPT‑3 (с количеством параметров от 125 млн до 175 млрд) на этом наборе данных, используя стандартные инструменты тонкой настройки.

Шаг третий: оценка моделей

Мы использовали количественные и качественные метрикиC: оценку экспертами-людьми степени соответствия заданным ценностям; оценку токсичностиD с помощью Perspective API;, а также метрики совместной встречаемости для анализа вопросов пола, расы и религии. Мы использовали результаты оценки для корректировки нашего набора данных по мере необходимости. Мы оценили три набора моделей:

Оценки токсичности не учитывают все нюансы проявления токсичности и содержат собственные предвзятости; [Dixon et al] описывают демографические предвзятости, при которых оценки токсичности ошибочно принимают термины, обозначающие идентичность, за ложноположительные результаты, а [Sap et al] описывают расовую предвзятость, при которой оценки с большей вероятностью помечают афроамериканский вариант английского языка как токсичный. Именно поэтому мы проводим дополнительные оценки.

  1. Базовые модели GPT‑3E
  2. Модели GPT‑3, ориентированные на ценности, дообученные на нашем специализированном наборе данных, как описано выше
  3. Контрольные модели GPT‑3, дообученные на наборе данных аналогичного размера и стиля письма

Мы брали по 3 образца на каждый промпт (запрос), с 5 промптами на категорию, что в сумме составило 40 промптов (120 образцов на каждый размер модели), и привлекли 3 разных людей для оценки каждого образца. Каждый образец оценивался по шкале от 1 до 5, где 5 означало, что текст наилучшим образом соответствует заданной позиции тональности.

Оценки людей показывают, что результаты работы моделей, ориентированных на ценности, наиболее точно соответствуют заданному поведению. Эффективность возрастает с увеличением размера модели.

Взгляд в будущее

Мы были удивлены тем, что дообучение на столь малом наборе данных оказалось настолько эффективным. Но мы полагаем, что это лишь верхушка айсберга, оставляющая важные вопросы без ответа:

  • С кем следует консультироваться при разработке набора данных, ориентированного на ценности?
  • Кто несет ответственность, когда пользователь получает результат, не соответствующий его собственным ценностям?
  • Как это исследование применимо к неанглийским языкам и генеративным моделям вне языковой сферы, таким как изображения, видео или аудио?
  • Насколько устойчива эта методология к распределениям реальных промптов? F
  • В нашем исследовании экспериментировали с форматом «вопрос-ответ».

Языковые модели и системы ИИ, функционирующие в обществе, должны быть адаптированы к этому обществу, и важно, чтобы при этом были услышаны самые разные голоса. Мы считаем, что для достижения успеха исследователям в области ИИ, представителям сообществ, политикам, социологам и другим специалистам в конечном итоге потребуется объединить усилия, чтобы понять, как именно эти системы должны вести себя в реальном мире.

Пожалуйста, обращайтесь по адресу languagebehavior@openai.com, если вы заинтересованы в проведении исследований по дообучению и поведению моделей с использованием GPT‑3.

Мы призываем исследователей, особенно из недостаточно представленных групп, интересующихся вопросами справедливости и социального вреда, подавать заявки на участие в нашей программе академического доступа и программе для ученых.

Присоединяйтесь к нашей команде

Мы постоянно расширяем нашу команду по безопасности и ищем специалистов с опытом в области осмысления социального вреда;  проектирования безопасных процессов;  управления программами, такими как академический доступ; и создания более справедливых и согласованных систем. Нам также интересны платные консультации с экспертами, особенно в сферах социального вреда и прикладной этики.

Сноски

  1. A

    Дополнительные примеры и анализы см. в Приложении J нашей работы.

  2. B

    Обучение большой языковой модели с нуля требует огромного объема данных. Например, модель GPT-3 обучалась на 570 ГБ данных. См. [Brown, Mann, Ryder, Subbiah et al].

  3. C

    Оценки дают лишь ограниченное представление о модели; они анализируют модель по определенной оси и сами по себе не являются исчерпывающими, поэтому мы используем как качественные, так и количественные метрики.

  4. D

    Показатели токсичности не отражают всех нюансов токсичности и содержат собственные предвзятости; [Dixon et al] описывают демографические предвзятости, при которых показатели токсичности ошибочно классифицируют термины идентичности как токсичные (ложноположительные срабатывания), а [Sap et al] описывают расовую предвзятость, при которой оценки с большей вероятностью помечают афроамериканский английский как токсичный. Именно поэтому мы проводим дополнительные оценки.

  5. E

    Подробнее о модели GPT-3 и ее обучающих данных читайте в карточке модели GPT-3

  6. F

    В нашем исследовании экспериментировали с форматом «вопрос-ответ».

Авторы

Ирин Солайман (Irene Solaiman), Кристи Деннисон (Christy Dennison)

Благодарности

Мы выражаем благодарность Стиву Даулингу (Steve Dowling), Ханне Вонг (Hannah Wong), Грегу Брокману (Greg Brockman), Майлзу Брандаджу (Miles Brundage), Гретхен Крюгер (Gretchen Krueger), Мире Мурати (Mira Murati), Яну Лейке (Jan Leike), Джеффу Ву (Jeff Wu), Илье Суцкеверу (Ilya Sutskever), Лилиан Венг (Lilian Weng), Элизабет Барнс (Elizabeth Barnes) и Джастину Джею Вангу (Justin Jay Wang) за их отзывы о более ранних версиях этой записи в блоге.

Полный текст статьи читайте на OpenAI