Как должны вести себя ИИ-системы и кто должен это решать?
Мы рассказываем о том, как формируется поведение ChatGPT, о наших планах по его улучшению, расширении возможностей настройки для пользователей, а также о привлечении общественности к принятию решений в этой сфере.

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)
Миссия OpenAI заключается в том, чтобы искусственный интеллект общего назначения (AGI)
Ниже мы подводим итоги:
- Как формируется поведение ChatGPT;
- Как мы планируем улучшить поведение ChatGPT по умолчанию;
- О нашем намерении предоставить больше возможностей настройки системы;
- О наших усилиях по привлечению общественного мнения к процессу принятия решений.
Текущее положение дел
В отличие от обычного программного обеспечения, наши модели представляют собой масштабные нейронные сети. Их поведение формируется на основе обучения на широком спектре данных, а не задается путем явного программирования. Хотя это сравнение не совсем идеально, данный процесс больше похож на дрессировку собаки, чем на привычное программирование. Сначала идет этап «предварительного обучения» (pre-training), в ходе которого модель учится прогнозировать следующее слово в предложении на основе большого объема текстов из интернета (и самых разных точек зрения). За этим следует второй этап, на котором мы «дообучаем» (fine-tune) наши модели, чтобы сузить рамки поведения системы.
На сегодняшний день этот процесс несовершенен. Иногда этап дообучения расходится с нашими намерениями (создать безопасный и полезный инструмент) и намерениями пользователя (получить полезный ответ на заданный ввод). Совершенствование наших методов согласования ИИ-систем с общечеловеческими ценностями является для нашей компании главной задачей, особенно по мере того, как ИИ-системы становятся все более мощными.
Двухэтапный процесс: предварительное обучение и дообучение
Два основных этапа создания ChatGPT работают следующим образом:
Сначала мы »предварительно обучаем» («pre-train») модели, заставляя их предсказывать следующее слово в большом наборе данных, содержащем фрагменты интернета. Например, они могут научиться дополнять предложение: «вместо того чтобы повернуть налево, она повернула ___». Обучаясь на миллиардах предложений, наши модели усваивают грамматику, множество фактов об окружающем мире и некоторые навыки рассуждения. Кроме того, они перенимают предвзятость и предубеждения, присутствующие в этих миллиардах предложений.
Затем мы »дообучаем» («fine-tune») эти модели на более узком наборе данных, который мы тщательно формируем при участии людей-рецензентов, следующих предоставленным нами рекомендациям. Поскольку мы не можем предсказать все возможные запросы, которые будущие пользователи могут ввести в нашу систему, мы не пишем детальные инструкции для каждого конкретного случая, с которым столкнется ChatGPT. Вместо этого мы описываем в рекомендациях несколько категорий, которые рецензенты используют для оценки возможных вариантов ответов модели на различные примеры запросов. Затем, в процессе использования, модели обобщают эту обратную связь от рецензентов, чтобы реагировать на самые разнообразные специфические запросы конкретного пользователя.
Роль рецензентов и политики OpenAI в разработке систем
В некоторых случаях мы даем рецензентам указания относительно определенных типов ответов (например, «не выполнять запросы на создание нелегального контента»). В других случаях наши рекомендации носят более общий характер (например, «избегайте принятия определенной стороны в спорных вопросах»). Важно отметить, что наше сотрудничество с рецензентами — это не разовое мероприятие, а постоянный процесс взаимодействия, в ходе которого мы многому учимся благодаря их экспертизе.
Важная часть процесса дообучения заключается в поддержании непрерывной обратной связи с нашими рецензентами. Это включает еженедельные встречи для обсуждения возникающих у них вопросов или уточнения наших рекомендаций. Такой итеративный процесс обратной связи позволяет нам со временем делать модель все лучше и лучше.
Борьба с предвзятостью
Многие справедливо обеспокоены проблемой предвзятости при проектировании и использовании ИИ-систем. Мы стремимся решительно бороться с этой проблемой и сохранять прозрачность в отношении как наших намерений, так и достигнутых результатов. С этой целью мы публикуем часть наших рекомендаций, касающихся политических и спорных тем. В наших правилах четко указано, что рецензенты не должны отдавать предпочтение какой-либо политической группе. Предвзятость, которая тем не менее может возникать в результате описанного выше процесса, является ошибкой (багом), а не заложенной функцией.
Хотя разногласия будут существовать всегда, мы надеемся, что публикация этой статьи и инструкций поможет лучше понять то, как мы смотрим на этот критически важный аспект столь фундаментальной технологии. Мы убеждены, что технологические компании должны нести ответственность за разработку правил, способных выдержать любую критику.
Мы постоянно работаем над повышением ясности этих рекомендаций и, основываясь на опыте запуска ChatGPT, намерены предоставлять рецензентам более четкие инструкции относительно возможных подводных камней и трудностей, связанных с предвзятостью, а также спорными фигурами и темами. Кроме того, в рамках инициатив по обеспечению прозрачности мы работаем над публикацией обобщенных демографических данных о наших рецензентах таким образом, чтобы не нарушать правила и нормы конфиденциальности, поскольку состав рецензентов является дополнительным источником потенциальной предвзятости в ответах системы.
В настоящее время мы исследуем способы сделать процесс дообучения более понятным и управляемым, опираясь на внешние наработки, такие как награждение на основе правил (rule-based rewards) и конституционный ИИ (Constitutional AI).
Куда мы движемся: основные компоненты будущих систем
Следуя нашей миссии, мы стремимся обеспечить всеобщий доступ к ИИ и AGI, а также сделать так, чтобы они приносили пользу всем и чтобы каждый мог влиять на их развитие. Мы считаем, что для достижения этих целей в контексте поведения ИИ-систем необходимы по меньшей мере три компонента.
1. Улучшение поведения по умолчанию. Мы хотим, чтобы как можно большему числу пользователей наши ИИ-системы казались полезными «из коробки» и чтобы люди чувствовали, что наша технология понимает и уважает их ценности.
С этой целью мы инвестируем в исследования и разработку инженерных решений, направленных на уменьшение как явных, так и скрытых предвзятостей в ответах ChatGPT на различные запросы. В некоторых случаях ChatGPT в настоящее время отказывается давать ответы, когда не должен этого делать, а в некоторых случаях — напротив, не отказывается, когда это необходимо. Мы уверены, что улучшения возможны в обоих направлениях.
Кроме того, у нас есть возможности для совершенствования и в других аспектах поведения системы — например, в склонности системы «выдумывать факты». Отзывы пользователей бесценны для реализации этих улучшений.
2. Определение ценностей вашего ИИ в широких рамках. Мы считаем, что искусственный интеллект должен быть полезным инструментом для каждого человека и поэтому настраиваться каждым пользователем в пределах границ, определяемых обществом. В связи с этим мы разрабатываем обновление для ChatGPT, которое позволит пользователям легко настраивать его поведение.
Это будет означать разрешение таких ответов системы, с которыми другие люди (включая нас самих) могут категорически не соглашаться. Найти правильный баланс здесь будет непросто: доведение настройки до крайности чревато рисками использования нашей технологии в злонамеренных целях, а также появлением угодливых ИИ, которые бездумно усиливают существующие убеждения людей.
Поэтому в отношении поведения системы всегда будут действовать определенные ограничения. Задача заключается в том, чтобы определить, какими именно должны быть эти границы. Если мы попытаемся принимать все эти решения самостоятельно или попытаемся разработать единую монолитную ИИ-систему, мы нарушим обязательство, взятое на себя в нашем Уставе, — «избегать чрезмерной концентрации власти».
3. Общественное обсуждение параметров по умолчанию и жестких границ. Один из способов избежать чрезмерной концентрации власти — предоставить людям, которые используют такие системы, как ChatGPT, или подвергаются их влиянию, возможность влиять на правила этих систем.
Мы считаем, что многие решения относительно настроек по умолчанию и жестких границ должны приниматься коллективно. И хотя практическая реализация этой задачи представляет собой сложность, мы стремимся учесть как можно больше точек зрения. В качестве отправной точки мы запрашивали внешние отзывы о нашей технологии в формате имитации атак (red teaming). Мы также недавно начали собирать отзывы общественности об использовании ИИ в сфере образования (это одна из тех сфер, где внедрение нашей технологии имеет особое значение).
Мы находимся на ранних этапах пилотных проектов по сбору мнений общественности по таким темам, как поведение систем, механизмы раскрытия информации (например, водяные знаки) и наша политика развертывания в целом. Мы также изучаем возможность партнерства с внешними организациями для проведения независимого аудита наших усилий в области безопасности и соблюдения норм.
Заключение
Сочетание трех описанных выше компонентов дает следующую картину нашего дальнейшего пути:
Иногда мы будем совершать ошибки. Когда это будет происходить, мы будем делать выводы и совершенствовать наши модели и системы.
Мы ценим бдительность сообщества пользователей ChatGPT, а также широкой общественности, которые помогают нам не терять ответственность, и с нетерпением ждем возможности поделиться новыми результатами нашей работы в трех упомянутых выше областях в ближайшие месяцы.
Если вы заинтересованы в проведении исследований, способствующих реализации этого видения (включая, помимо прочего, исследования в области справедливости и репрезентативности, выравнивания, а также социотехнические исследования влияния ИИ на общество), пожалуйста, подайте заявку на льготный доступ к нашему API черезПрограмму доступа для исследователей (Researcher Access Program).
Мы такженанимаемсотрудников на различные позиции в области исследований, выравнивания, инженерии и не только.
Сноски
Автор
Полный текст статьи читайте на OpenAI
