Наш подход к исследованиям в области согласования

Мы совершенствуем способность наших систем ИИ учиться на основе отзывов людей и помогать людям оценивать ИИ. Наша цель — создать достаточно согласованную систему ИИ, которая поможет нам решить все остальные проблемы согласования.

Our Approach To Alignment Research

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Наши исследования в области согласования направлены на то, чтобы сделать искусственный интеллект общего назначения (AGI) соответствующим человеческим ценностям и подчиняющимся намерениям человека. Мы используем итеративный, эмпирический подход: пытаясь согласовать высокопроизводительные системы ИИ, мы можем узнать, что работает, а что нет, и тем самым усовершенствовать нашу способность делать системы ИИ более безопасными и согласованными. С помощью научных экспериментов мы изучаем, как масштабируются методы согласования и где они дают сбой.

Мы решаем проблемы согласования как в наших самых мощных системах ИИ, так и те проблемы согласования, с которыми мы ожидаем столкнуться на пути к AGI. Наша главная цель — максимально продвинуть текущие идеи согласования, а также точно понять и задокументировать, как они могут преуспеть или почему они потерпят неудачу. Мы верим, что даже без принципиально новых идей согласования мы, вероятно, сможем создать достаточно согласованные системы ИИ для существенного продвижения самих исследований в области согласования.

Несогласованный AGI может представлять существенные риски для человечества, а решение проблемы согласования AGI может оказаться настолько сложным, что потребует совместной работы всего человечества. Поэтому мы стремимся открыто делиться результатами наших исследований в области согласования, когда это безопасно: мы хотим быть прозрачными в отношении того, насколько хорошо наши методы согласования работают на практике, и мы хотим, чтобы каждый разработчик AGI использовал лучшие в мире методы согласования.

На высоком уровне наш подход к исследованиям в области согласования сосредоточен на разработке масштабируемого сигнала обучения для очень умных систем ИИ, который согласован с намерениями человека. Он состоит из трех основных столпов:

  1. Обучение систем ИИ с использованием отзывов людей
  2. Обучение систем ИИ помощи в оценке человеком
  3. Обучение систем ИИ проведению исследований по согласованию

Согласование систем ИИ с человеческими ценностями также порождает ряд других серьезных социотехнических проблем, таких как решение о том, с кем именно должны быть согласованы эти системы. Решение этих проблем важно для достижения нашей миссии, однако мы не обсуждаем их в этой статье.

«Мы хотим быть прозрачными в отношении того, насколько хорошо наши методы согласования работают на практике, и мы хотим, чтобы каждый разработчик AGI использовал лучшие в мире методы согласования».

Обучение систем ИИ с использованием отзывов людей

Обучение с подкреплением на основе отзывов людей (RLHF) — это наш основной метод согласования развернутых языковых моделей на сегодняшний день. Мы обучаем класс моделей под названием InstructGPT, созданных на основе предварительно обученных языковых моделей, таких как GPT-3. Эти модели обучены следовать человеческим намерениям: как явным намерениям, заданным инструкцией, так и неявным, таким как правдивость, справедливость и безопасность.

Наши результаты показывают, что в области дообучения, сфокусированного на согласовании, сейчас много низко висящих фруктов: InstructGPT предпочитается людьми по сравнению с предварительно обученной моделью, которая в 100 раз больше, в то время как затраты на ее дообучение составляют <2% от вычислительных затрат на предварительное обучение GPT-3 и около 20 000 часов человеческих отзывов. Мы надеемся, что наша работа вдохновит других участников индустрии увеличить инвестиции в согласование больших языковых моделей и повысит планку ожиданий пользователей в отношении безопасности развернутых моделей.

Наш API естественного языка является очень полезной средой для наших исследований в области согласования: он обеспечивает нас богатой обратной связью о том, насколько хорошо наши методы согласования работают на практике в реальном мире, на основе самого разнообразного набора задач, за решение которых наши клиенты готовы платить деньги. В среднем наши клиенты уже предпочитают использовать InstructGPT нашим предварительно обученным моделям.

Тем не менее, сегодняшние версии InstructGPT весьма далеки от полной согласованности: они иногда не справляются с простыми инструкциями, не всегда говорят правду, не всегда надежно отказываются от выполнения вредоносных задач и порой выдают предвзятые или токсичные ответы. Некоторые клиенты находят ответы InstructGPT значительно менее креативными, чем у предварительно обученных моделей — этого мы не осознавали, запуская InstructGPT на общедоступных бенчмарках. Мы также работаем над созданием более детального научного понимания обучения с подкреплением на основе отзывов людей и над тем, как повысить качество этих отзывов.

Согласование нашего API гораздо проще, чем согласование AGI, поскольку большинство задач в нашем API не слишком сложны для контроля людьми, а наши развернутые языковые модели не умнее людей. Мы не ожидаем, что обучение с подкреплением на основе отзывов людей окажется достаточным для согласования AGI, но оно является ключевым строительным блоком для тех предложений по масштабируемому согласованию, которые вызывают у нас наибольший энтузиазм, поэтому совершенствование этой методологии представляет большую ценность.

Обучение моделей помощи в оценке человеком

Обучение с подкреплением на основе отзывов людей имеет фундаментальное ограничение: оно предполагает, что люди могут точно оценивать задачи, выполняемые нашими системами ИИ. Сегодня люди неплохо справляются с этим, но по мере того, как модели становятся более способными, они смогут выполнять задачи, которые людям оценивать гораздо труднее (например, находить все изъяны в крупной кодовой базе или научной статье). Наши модели могут научиться говорить нашим оценщикам-людям то, что те хотят услышать, вместо того чтобы говорить им правду. Чтобы масштабировать согласование, мы хотим использовать такие методы, как рекурсивное моделирование вознаграждения (RRM), дебаты и итеративное усиление.

В настоящее время наше основное направление основано на RRM: мы обучаем модели, которые могут помогать людям оценивать наши модели в задачах, которые слишком сложны для прямой оценки человеком. Например:

  • Мы обучили модель составлять краткое содержание книг. Оценка краткого содержания книг занимает много времени у людей, если они не знакомы с книгой, но наша модель может помочь экспертам-людям, написав краткое содержание глав.
  • Мы обучили модель помогать людям оценивать фактическую точность путем поиска в интернете и предоставления цитат и ссылок. По простым вопросам результаты работы этой модели уже предпочитаются ответам, написанным людьми.
  • Мы обучили модель писать критические комментарии к собственным результатам: в задаче обобщения на основе запросов помощь в виде критических комментариев увеличивает количество изъянов, обнаруживаемых людьми в результатах модели, в среднем на 50%. Это справедливо даже тогда, когда мы просим людей написать правдоподобно выглядящие, но некорректные аннотации.
  • Мы создаем набор задач по программированию, выбранных таким образом, чтобы их было очень трудно надежно оценить невооруженному человеку. Мы надеемся выпустить этот набор данных в ближайшее время.

Наши методы согласования должны работать даже тогда, когда наши системы ИИ предлагают очень креативные решения (например, 37-й ход AlphaGo), поэтому мы особенно заинтересованы в обучении моделей помощи людям в отделении правильных решений от вводящих в заблуждение или обманчивых. Мы считаем, что лучший способ узнать как можно больше о том, как заставить оценку с помощью ИИ работать на практике — это создавать помощников на базе ИИ.

Обучение систем ИИ проведению исследований по согласованию

В настоящее время не существует известного бесконечно масштабируемого решения проблемы согласования. По мере развития ИИ мы ожидаем столкнуться с рядом новых проблем согласования, которые мы еще не наблюдаем в нынешних системах. Некоторые из этих проблем мы предвидим уже сейчас, а некоторые будут совершенно новыми.

Мы считаем, что поиск бесконечно масштабируемого решения, вероятно, очень сложен. Вместо этого мы стремимся к более прагматичному подходу: созданию и согласованию системы, которая может продвигаться в исследованиях по согласованию быстрее и лучше, чем люди.

По мере того как мы будем добиваться успехов в этом направлении, наши системы ИИ смогут брать на себя все большую часть нашей работы по согласованию и в конечном итоге придумывать, реализовывать, изучать и разрабатывать лучшие методы согласования, чем те, что есть у нас сейчас. Они будут работать вместе с людьми, чтобы гарантировать, что их собственные преемники будут еще более согласованы с людьми.

Мы считаем, что оценка исследований по согласованию существенно проще, чем их проведение, особенно при наличии помощи в оценке. Поэтому исследователи-люди будут все больше сосредоточивать свои усилия на рецензировании исследований по согласованию, проделанных системами ИИ, вместо того чтобы генерировать эти исследования самостоятельно. Наша цель — обучить модели настолько согласованными, чтобы мы могли переложить на них практически всю когнитивную работу, необходимую для исследований в области согласования.

Важно отметить, что для достижения в исследованиях по согласованию результатов не хуже человеческих нам нужны лишь «более узкие» системы ИИ, обладающие возможностями человеческого уровня в соответствующих областях. Мы ожидаем, что такие системы ИИ проще согласовать, чем системы общего назначения или системы, значительно превосходящие людей по интеллекту.

Языковые модели особенно хорошо подходят для автоматизации исследований по согласованию, поскольку они «предзагружены» большим объемом знаний и информации о человеческих ценностях, полученных при чтении интернета. Сами по себе они не являются независимыми агентами и поэтому не преследуют в мире свои собственные цели. Для проведения исследований по согласованию им не нужен неограниченный доступ в интернет. Тем не менее, множество исследовательских задач по согласованию можно сформулировать как задачи на естественном языке или задачи программирования.

Будущие версии WebGPT, InstructGPT и Codex могут стать основой для ассистентов в исследованиях по согласованию, однако они пока недостаточно способны. Хотя мы не знаем, когда наши модели будут достаточно способны для значимого вклада в исследования по согласованию, мы считаем важным начать эту работу заранее. Как только мы обучим модель, которая может оказаться полезной, мы планируем сделать ее доступной для внешнего сообщества исследователей согласования.

Ограничения

Мы очень воодушевлены этим подходом к согласованию AGI, но мы ожидаем, что его нужно будет адаптировать и совершенствовать по мере того, как мы будем узнавать больше о развитии технологий ИИ. Наш подход также имеет ряд важных ограничений:

  • Путь, изложенный здесь, недооценивает важность исследований надежности и интерпретируемости — двух областей, в которые OpenAI в настоящее время инвестирует недостаточно. Если ваш профиль соответствует этому, пожалуйста, подайте заявку на наши вакансии научных сотрудников!
  • Использование помощи ИИ для оценки создает потенциал для масштабирования или усиления даже тонких несоответствий, предвзятостей или уязвимостей, присутствующих в ИИ-ассистенте.
  • Согласование AGI, вероятно, предполагает решение совершенно иных проблем, чем согласование современных систем ИИ. Мы ожидаем, что переход будет в некоторой степени непрерывным, но если возникнут серьезные разрывы или сдвиги парадигмы, то большинство уроков, извлеченных из согласования моделей вроде InstructGPT, могут оказаться не слишком полезными.
  • Самые сложные части проблемы согласования могут быть не связаны с разработкой масштабируемого и согласованного сигнала обучения для наших систем ИИ. Даже если это так, подобный сигнал обучения будет необходим.
  • Согласование моделей, способных существенно ускорить исследования по согласованию, может оказаться не принципиально проще, чем согласование самого AGI. Другими словами, наименее способные модели, которые могут помочь в исследованиях по согласованию, могут уже оказаться слишком опасными, если они должным образом не согласованы. Если это так, мы не получим большой помощи от собственных систем в решении проблем согласования.

Мы ищем больше талантливых людей для этого направления исследований! Если вам это интересно, мы нанимаеминженеров-исследователейинаучных сотрудников.

Авторы

Ян Лейке (Jan Leike), Джон Шульман (John Schulman), Джеффри Ву (Jeffrey Wu)

Полный текст статьи читайте на OpenAI