Извлеченные уроки безопасности и предотвращения злоупотреблений языковыми моделями
Мы описываем наши последние наработки в надежде помочь другим разработчикам ИИ решать проблемы безопасности и предотвращения злоупотреблений развернутыми моделями.

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)
Резюме
Внедрение мощных систем ИИ расширило наше понимание безопасности и возможных злоупотреблений гораздо сильнее, чем это было бы возможно только за счет научных исследований. В частности: злоупотребления языковыми моделями на базе API часто принимают формы, отличные от тех, которых мы опасались больше всего; мы выявили ограничения в существующих методах оценки языковых моделей и устраняем их с помощью новых бенчмарков и классификаторов;, а фундаментальные исследования в области безопасности приносят значительную пользу коммерческой применимости систем ИИ.
За последние два года мы многое узнали о том, как можно использовать и злоупотреблять языковыми моделями — это выводы, которые мы не смогли бы получить без опыта реального развертывания. В июне 2020 года мы начали предоставлять разработчикам и исследователям доступ к OpenAI API, интерфейсу для доступа к новым моделям ИИ, разработанным OpenAI, и создания приложений на их основе. Развертывание GPT‑3, Codex и других моделей таким образом, чтобы снизить риски причинения вреда, поставило перед нами различные технические и политические задачи.
Обзор нашего подхода к развертыванию моделей
Большие языковые модели теперь способны выполнять самый широкий спектр задач, зачастую сразу после запуска. Профили их рисков, потенциальные применения и более широкое влияние на общество по-прежнемуплохоизучены. В результате наш подход к развертыванию делает упор на непрерывную итерацию и использует следующие стратегии, направленные на максимизацию преимуществ развертывания при одновременном снижении сопутствующих рисков:
- Анализ рисков перед развертыванием с использованием растущего набора оценок безопасности и инструментов имитации атак (red teaming) (например, мы проверили InstructGPT на предмет снижения уровня безопасности с помощью оценок, описанных ниже)
- Начало работы с небольшой пользовательской базой (например, и GPT‑3, и наша серия InstructGPT начинались как закрытые бета-версии)
- Изучение результатов пилотных проектов с новыми сценариями использования (например, изучение условий, при которых мы могли бы безопасно разрешить генерацию объемного контента, работая с небольшим числом клиентов)
- Внедрение процессов, помогающих держать руку на пульсе использования (например, проверка сценариев использования, квоты токенов и ограничения скорости запросов)
- Проведение детальных ретроспективных обзоров (например, инцидентов безопасности и крупных развертываний)
Универсального средства для ответственного развертывания не существует, поэтому мы стараемся изучать и устранять ограничения наших моделей, а также потенциальные возможности их неправомерного использования на каждом этапе разработки и развертывания. Такой подход позволяет нам узнать как можно больше о проблемах безопасности и политики в небольшом масштабе и учесть эти выводы до запуска масштабных развертываний.
«Универсального средства для ответственного развертывания не существует.»
Хотя список не является исчерпывающим, некоторые направления, в которые мы инвестировали средства на данный момент, включают в себя
- Курирование и фильтрация данных для предварительного обучения
- Тонкая настройка (fine-tuning) моделей для лучшего следования инструкциям
- Анализ рисков потенциальных развертываний
- Предоставление подробной документации для пользователей
- Создание инструментов для фильтрации вредоносных результатов работы моделей
- Проверка сценариев использования на соответствие нашим политикам
- Мониторинг признаков злоупотребления
- Изучение влияния наших моделей
Поскольку каждый этап вмешательства имеет свои ограничения, необходим комплексный подход.
Есть области, в которых мы могли бы сделать больше и где у нас все еще есть возможности для улучшения. Например, когда мы только начинали работать с GPT‑3, мы рассматривали ее скорее как внутренний исследовательский артефакт, а не как производственную систему, и не были столь агрессивны в фильтрации токсичных обучающих данных, как могли бы быть в противном случае. Мы инвестировали больше средств в исследование и удаление таких материалов для последующих моделей. Нам потребовалось больше времени для реагирования на некоторые случаи злоупотреблений в тех ситуациях, когда у нас не было четких правил на этот счет, и мы стали лучше совершенствовать эти правила в ходе итераций. И мы продолжаем двигаться к созданию пакета требований безопасности, который будет максимально эффективен в борьбе с рисками, в то же время четко доноситься до разработчиков и сводить к минимуму излишние трения.
Тем не менее, мы считаем, что наш подход позволил нам измерить и снизить различные виды вреда от использования языковых моделей по сравнению с более невмешательским подходом, одновременно обеспечивая широкий спектр научных, художественных и коммерческих применений наших моделей.
Множество форм и проявлений злоупотребления языковыми моделями
OpenAI активно исследует риски злоупотребления ИИ со времен нашей ранней работы над злонамеренным использованием ИИ в 2018 году и над GPT‑2 в 2019 году, причем особое внимание мы уделяли системам ИИ, способствующим проведению информационных операций. Мы работали с внешними экспертами над созданием прототипов (proof of concept) и способствовали тщательномуанализу таких рисков третьими сторонами. Мы по-прежнему привержены задаче устранения рисков, связанных с информационными операциями на базе языковых моделей, и недавно соорганизовали семинар на эту тему.
Тем не менее, мы обнаружили и пресекли действия сотен субъектов, пытавшихся использовать GPT‑3 для гораздо более широкого круга целей, чем создание дезинформации для информационных операций, в том числе такими способами, которые мы либо не предвидели, либо предвидели, но не ожидали столь широкого распространения.
Чтобы поддержать изучение злоупотреблений языковыми моделями и борьбу с ними, мы активно ищем возможности поделиться статистикой инцидентов безопасности в этом году, чтобы сделать дискуссии о злоупотреблении языковыми моделями более предметными.
Сложность измерения рисков и воздействия
Многие аспекты рисков и влияния языковых моделей по-прежнему трудно измерить, а значит, трудно отслеживать, минимизировать и раскрывать подотчетным образом. Мы активно используем существующие академические бенчмарки для оценки языковых моделей и стремимся и дальше опираться на сторонние наработки, но мы также обнаружили, что существующие наборы данных для бенчмарков часто не отражают те риски безопасности и злоупотреблений, с которыми мы сталкиваемся на практике.
Такие ограничения отражают тот факт, что академические наборы данных редко создаются с явной целью информирования о продакшн-использовании языковых моделей и не используют опыт, полученный в результате масштабного развертывания таких моделей. В результате мы разрабатываем новые наборы данных для оценки и фреймворки для измерения безопасности наших моделей, которые планируем выпустить в ближайшее время. В частности, мы разработали новые метрики оценки для измерения токсичности в результатах работы моделей, а также создали собственные классификаторы для обнаружения контента, нарушающего нашу политику в отношении контента, такую как эротический контент, язык вражды, насилие, домогательства и членовредительство. И то, и другое впоследствии было использовано для улучшения наших данных предварительного обучения
Надежная классификация результатов работы отдельных моделей по различным измерениям — сложная задача, а измерение их социального воздействия в масштабах OpenAI API — задача еще более трудная. Мы провели несколько внутренних исследований, чтобы сформировать институциональную экспертизу для таких измерений, но они часто порождали больше вопросов, чем ответов.
Мы особенно заинтересованы в том, чтобы лучше понять экономическое влияние наших моделей и распределение этого влияния. У нас есть веские основания полагать, что влияние развертывания текущих моделей на рынок труда может быть значительным уже в абсолютном выражении, и что оно будет расти по мере расширения возможностей и охвата наших моделей. На сегодняшний день мы узнали о различных локальных эффектах, включая массовый рост производительности при выполнении существующих задач отдельными специалистами, такими как копирайтинг и создание выжимок (иногда это способствует вытеснению и созданию рабочих мест), а также о случаях, когда API открывал новые возможности для приложений, которые ранее были невыполнимы, например синтез крупномасштабных качественных отзывов. Но у нас нет четкого понимания суммарного эффекта.
Мы считаем, что разработчикам и лицам, внедряющим мощные технологии ИИ, важно напрямую решать проблемы как положительного, так и отрицательного влияния своей работы. Некоторые шаги в этом направлении мы обсуждаем в заключительной части этой публикации.
Взаимосвязь между безопасностью и полезностью систем ИИ
В нашем Уставе, опубликованном в 2018 году, мы говорим, что «обеспокоены тем, что разработка ОИИ (AGI) на поздних этапах может превратиться в соревновательную гонку без времени на адекватные меры предосторожности». Затем мы опубликовали подробный анализ конкурентной разработки ИИ и внимательно следили за последующими исследованиями. В то же время развертывание систем ИИ через OpenAI API углубило наше понимание синергии между безопасностью и полезностью.
Например, разработчики в подавляющем большинстве предпочитают наши модели InstructGPT, которые прошли тонкую настройку для следования намерениям пользователя
Отрадно наблюдать случаи сильной синергии между безопасностью и полезностью, но мы по-прежнему привержены инвестициям в исследования безопасности и политики, даже когда они идут вразрез с коммерческой полезностью.
«Мы привержены инвестициям в исследования безопасности и политики, даже когда они идут вразрез с коммерческой полезностью.»
Способы принять участие
Каждый из уроков выше ставит новые вопросы. Какие именно инциденты безопасности мы всё ещё можем упускать из виду и не предвидеть? Как мы можем лучше измерять риски и последствия? Как мы можем продолжать повышать как безопасность, так и полезность наших моделей, а также справляться с неизбежными противоречиями между этими двумя аспектами?
Мы активно обсуждаем многие из этих вопросов с другими компаниями, внедряющими языковые модели. Но мы также понимаем, что ни одна организация или группа организаций не обладает всеми ответами, и хотели бы выделить несколько способов, с помощью которых читатели могут глубже понять процесс развертывания передовых систем искусственного интеллекта и повлиять на него.
Во-первых, получение непосредственного опыта взаимодействия с передовыми системами ИИ неоценимо для понимания их возможностей и последствий. Мы недавно закрыли список ожидания API, убедившись в нашей способности эффективно обнаруживать ненадлежащее использование и реагировать на него. Лица в поддерживаемых странах и территориях могут быстро получить доступ к API OpenAI, зарегистрировавшись здесь.
Во-вторых, исследователи, работающие над темами, представляющими для нас особый интерес (такими как предвзятость и ненадлежащее использование), и нуждающиеся в финансовой поддержке, могут подать заявку на получение субсидированных кредитов для API, используя эту форму. Внешние исследования жизненно важны как для нашего собственного понимания этих многоаспектных систем, так и для их более широкого понимания общественностью.
Наконец, сегодня мы публикуем план исследований, изучающий влияние нашего семейства моделей Codex на рынок труда, и призываем внешних исследователей к сотрудничеству в проведении этой работы. Мы рады сотрудничать с независимыми исследователями для изучения эффектов наших технологий с целью выработки надлежащих мер политики, а в дальнейшем — распространить наши наработки с генерации кода на другие модальности.
Если вы заинтересованы в работе по ответственному внедрению передовых технологий ИИ, подайте заявкуна работу в OpenAI!
Сноски
Авторы
Благодарности
Спасибо Лилиан Венг, Рози Кэмпбелл, Анне Маканжу, Бобу МакГрю, Ханне Вонг, Райану Лоу, Стиву Даулингу, Мире Мурати, Сэму Альтману, Грегу Брокману, Илье Суцкевиру, Перси Лиангу, Питеру Велиндеру, Итану Пересу, Элли Эванс, Хелен Нго, Хелен Тонер, Джастину Джей Вангу, Джеку Кларку, Риши Боммасани, Гиришу Састри, Саре Шокер, Мэтту Найту, Бьянке Мартин, Бобу Ротстеду, Ламе Ахмад, Токи Шербакову и другим за отзывы об этой статье и связанной с ней работе.
Полный текст статьи читайте на OpenAI
