Извлеченные уроки безопасности и предотвращения злоупотреблений языковыми моделями

Мы описываем наши последние наработки в надежде помочь другим разработчикам ИИ решать проблемы безопасности и предотвращения злоупотреблений развернутыми моделями.

Читать исследовательскую повестку
Language Model Safety And Misuse

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Резюме

Внедрение мощных систем ИИ расширило наше понимание безопасности и возможных злоупотреблений гораздо сильнее, чем это было бы возможно только за счет научных исследований. В частности: злоупотребления языковыми моделями на базе API часто принимают формы, отличные от тех, которых мы опасались больше всего; мы выявили ограничения в существующих методах оценки языковых моделей и устраняем их с помощью новых бенчмарков и классификаторов;, а фундаментальные исследования в области безопасности приносят значительную пользу коммерческой применимости систем ИИ.

За последние два года мы многое узнали о том, как можно использовать и злоупотреблять языковыми моделями — это выводы, которые мы не смогли бы получить без опыта реального развертывания. В июне 2020 года мы начали предоставлять разработчикам и исследователям доступ к OpenAI API, интерфейсу для доступа к новым моделям ИИ, разработанным OpenAI, и создания приложений на их основе. Развертывание GPT‑3, Codex и других моделей таким образом, чтобы снизить риски причинения вреда, поставило перед нами различные технические и политические задачи.

Обзор нашего подхода к развертыванию моделей

Большие языковые модели теперь способны выполнять самый широкий спектр задач, зачастую сразу после запуска. Профили их рисков, потенциальные применения и более широкое влияние на общество по-прежнемуплохоизучены. В результате наш подход к развертыванию делает упор на непрерывную итерацию и использует следующие стратегии, направленные на максимизацию преимуществ развертывания при одновременном снижении сопутствующих рисков:

  • Анализ рисков перед развертыванием с использованием растущего набора оценок безопасности и инструментов имитации атак (red teaming) (например, мы проверили InstructGPT на предмет снижения уровня безопасности с помощью оценок,  описанных ниже)
  • Начало работы с небольшой пользовательской базой (например, и GPT‑3, и наша серия InstructGPT начинались как закрытые бета-версии)
  • Изучение результатов пилотных проектов с новыми сценариями использования (например, изучение условий, при которых мы могли бы безопасно разрешить генерацию объемного контента, работая с небольшим числом клиентов)
  • Внедрение процессов, помогающих держать руку на пульсе использования (например, проверка сценариев использования, квоты токенов и ограничения скорости запросов)
  • Проведение детальных ретроспективных обзоров (например, инцидентов безопасности и крупных развертываний)
Flow diagram of a Development & Deployment Lifecycle

Универсального средства для ответственного развертывания не существует, поэтому мы стараемся изучать и устранять ограничения наших моделей, а также потенциальные возможности их неправомерного использования на каждом этапе разработки и развертывания. Такой подход позволяет нам узнать как можно больше о проблемах безопасности и политики в небольшом масштабе и учесть эти выводы до запуска масштабных развертываний.

«Универсального средства для ответственного развертывания не существует.»

Хотя список не является исчерпывающим, некоторые направления, в которые мы инвестировали средства на данный момент, включают в себяA:

  • Курирование и фильтрация данных для предварительного обучения
  • Тонкая настройка (fine-tuning) моделей для лучшего следования инструкциям
  • Анализ рисков потенциальных развертываний
  • Предоставление подробной документации для пользователей
  • Создание инструментов для фильтрации вредоносных результатов работы моделей
  • Проверка сценариев использования на соответствие нашим политикам
  • Мониторинг признаков злоупотребления
  • Изучение влияния наших моделей

Поскольку каждый этап вмешательства имеет свои ограничения, необходим комплексный подход.

Есть области, в которых мы могли бы сделать больше и где у нас все еще есть возможности для улучшения. Например, когда мы только начинали работать с GPT‑3, мы рассматривали ее скорее как внутренний исследовательский артефакт, а не как производственную систему, и не были столь агрессивны в фильтрации токсичных обучающих данных, как могли бы быть в противном случае. Мы инвестировали больше средств в исследование и удаление таких материалов для последующих моделей. Нам потребовалось больше времени для реагирования на некоторые случаи злоупотреблений в тех ситуациях, когда у нас не было четких правил на этот счет, и мы стали лучше совершенствовать эти правила в ходе итераций. И мы продолжаем двигаться к созданию пакета требований безопасности, который будет максимально эффективен в борьбе с рисками, в то же время четко доноситься до разработчиков и сводить к минимуму излишние трения.

Тем не менее, мы считаем, что наш подход позволил нам измерить и снизить различные виды вреда от использования языковых моделей по сравнению с более невмешательским подходом, одновременно обеспечивая широкий спектр научных, художественных и коммерческих применений наших моделей.B

Множество форм и проявлений злоупотребления языковыми моделями

OpenAI активно исследует риски злоупотребления ИИ со времен нашей ранней работы над злонамеренным использованием ИИ в 2018 году и над GPT‑2 в 2019 году, причем особое внимание мы уделяли системам ИИ, способствующим проведению информационных операций. Мы работали с внешними экспертами над созданием прототипов (proof of concept) и способствовали тщательномуанализу таких рисков третьими сторонами. Мы по-прежнему привержены задаче устранения рисков, связанных с информационными операциями на базе языковых моделей, и недавно соорганизовали семинар на эту тему.C

Тем не менее, мы обнаружили и пресекли действия сотен субъектов, пытавшихся использовать GPT‑3 для гораздо более широкого круга целей, чем создание дезинформации для информационных операций, в том числе такими способами, которые мы либо не предвидели, либо предвидели, но не ожидали столь широкого распространения.D Наши рекомендации по сценариям использования,  рекомендации по контенту, а также инфраструктура внутреннего обнаружения и реагирования изначально были ориентированы на риски, которые мы предвидели на основе внутренних и внешних исследований, такие как генерация вводящего в заблуждение политического контента с помощью GPT‑3 или генерация вредоносного ПО с помощью Codex. Наши усилия по обнаружению и реагированию со временем эволюционировали в ответ на реальные случаи злоупотреблений, с которыми мы столкнулись в «реальных условиях» (in the wild) и которые не занимали столь заметного места в наших первоначальных оценках рисков, как информационные операции. Примеры включают спам-рекламу сомнительных медицинских товаров и ролевые игры на расистские темы.

Чтобы поддержать изучение злоупотреблений языковыми моделями и борьбу с ними, мы активно ищем возможности поделиться статистикой инцидентов безопасности в этом году, чтобы сделать дискуссии о злоупотреблении языковыми моделями более предметными.

Сложность измерения рисков и воздействия

Многие аспекты рисков и влияния языковых моделей по-прежнему трудно измерить, а значит, трудно отслеживать, минимизировать и раскрывать подотчетным образом. Мы активно используем существующие академические бенчмарки для оценки языковых моделей и стремимся и дальше опираться на сторонние наработки, но мы также обнаружили, что существующие наборы данных для бенчмарков часто не отражают те риски безопасности и злоупотреблений, с которыми мы сталкиваемся на практике.E

Такие ограничения отражают тот факт, что академические наборы данных редко создаются с явной целью информирования о продакшн-использовании языковых моделей и не используют опыт, полученный в результате масштабного развертывания таких моделей. В результате мы разрабатываем новые наборы данных для оценки и фреймворки для измерения безопасности наших моделей, которые планируем выпустить в ближайшее время. В частности, мы разработали новые метрики оценки для измерения токсичности в результатах работы моделей, а также создали собственные классификаторы для обнаружения контента, нарушающего нашу политику в отношении контента, такую как эротический контент, язык вражды, насилие, домогательства и членовредительство. И то, и другое впоследствии было использовано для улучшения наших данных предварительного обученияF — в частности, за счет использования классификаторов для фильтрации контента и метрик оценки для измерения эффекта от вмешательства в наборы данных.

Надежная классификация результатов работы отдельных моделей по различным измерениям — сложная задача, а измерение их социального воздействия в масштабах OpenAI API — задача еще более трудная. Мы провели несколько внутренних исследований, чтобы сформировать институциональную экспертизу для таких измерений, но они часто порождали больше вопросов, чем ответов.

Мы особенно заинтересованы в том, чтобы лучше понять экономическое влияние наших моделей и распределение этого влияния. У нас есть веские основания полагать, что влияние развертывания текущих моделей на рынок труда может быть значительным уже в абсолютном выражении, и что оно будет расти по мере расширения возможностей и охвата наших моделей. На сегодняшний день мы узнали о различных локальных эффектах, включая массовый рост производительности при выполнении существующих задач отдельными специалистами, такими как копирайтинг и создание выжимок (иногда это способствует вытеснению и созданию рабочих мест), а также о случаях, когда API открывал новые возможности для приложений, которые ранее были невыполнимы, например синтез крупномасштабных качественных отзывов. Но у нас нет четкого понимания суммарного эффекта.

Мы считаем, что разработчикам и лицам, внедряющим мощные технологии ИИ, важно напрямую решать проблемы как положительного, так и отрицательного влияния своей работы. Некоторые шаги в этом направлении мы обсуждаем в заключительной части этой публикации.

Взаимосвязь между безопасностью и полезностью систем ИИ

В нашем Уставе, опубликованном в 2018 году, мы говорим, что «обеспокоены тем, что разработка ОИИ (AGI) на поздних этапах может превратиться в соревновательную гонку без времени на адекватные меры предосторожности». Затем мы опубликовали подробный анализ конкурентной разработки ИИ и внимательно следили за последующими исследованиями. В то же время развертывание систем ИИ через OpenAI API углубило наше понимание синергии между безопасностью и полезностью.

Например, разработчики в подавляющем большинстве предпочитают наши модели InstructGPT, которые прошли тонкую настройку для следования намерениям пользователя G — базовым моделям GPT‑3. Примечательно, однако, что модели InstructGPT изначально мотивировались не коммерческими соображениями, а стремлением добиться прогресса в решении долгосрочныхпроблем выравнивания (alignment). На практике это означает, что клиенты, что, пожалуй, неудивительно, гораздо больше предпочитают модели, которые не отвлекаются от задачи и понимают намерения пользователя, а также модели, которые с меньшей вероятностью выдадут вредный или неверный результат.H Другие фундаментальные исследования, такие как наша работа поиспользованию информации, извлеченной из интернета, для более правдивых ответов на вопросы, также обладают потенциалом для повышения коммерческой полезности систем ИИ.I Такая синергия будет возникать не всегда. Например, более мощные системы часто требуют больше времени для эффективной оценки и выравнивания, что закрывает возможности для получения немедленной прибыли. Кроме того, полезность для конкретного пользователя и полезность для общества могут не совпадать из-за негативных внешних эффектов — рассмотрите полностью автоматизированный копирайтинг, который может быть полезен для создателей контента, но вреден для информационной экосистемы в целом.

Отрадно наблюдать случаи сильной синергии между безопасностью и полезностью, но мы по-прежнему привержены инвестициям в исследования безопасности и политики, даже когда они идут вразрез с коммерческой полезностью.

«Мы привержены инвестициям в исследования безопасности и политики, даже когда они идут вразрез с коммерческой полезностью.»

Способы принять участие

Каждый из уроков выше ставит новые вопросы. Какие именно инциденты безопасности мы всё ещё можем упускать из виду и не предвидеть? Как мы можем лучше измерять риски и последствия? Как мы можем продолжать повышать как безопасность, так и полезность наших моделей, а также справляться с неизбежными противоречиями между этими двумя аспектами?

Мы активно обсуждаем многие из этих вопросов с другими компаниями, внедряющими языковые модели. Но мы также понимаем, что ни одна организация или группа организаций не обладает всеми ответами, и хотели бы выделить несколько способов, с помощью которых читатели могут глубже понять процесс развертывания передовых систем искусственного интеллекта и повлиять на него.

Во-первых, получение непосредственного опыта взаимодействия с передовыми системами ИИ неоценимо для понимания их возможностей и последствий. Мы недавно закрыли список ожидания API, убедившись в нашей способности эффективно обнаруживать ненадлежащее использование и реагировать на него. Лица в поддерживаемых странах и территориях могут быстро получить доступ к API OpenAI, зарегистрировавшись здесь.

Во-вторых, исследователи, работающие над темами, представляющими для нас особый интерес (такими как предвзятость и ненадлежащее использование), и нуждающиеся в финансовой поддержке, могут подать заявку на получение субсидированных кредитов для API, используя эту форму. Внешние исследования жизненно важны как для нашего собственного понимания этих многоаспектных систем, так и для их более широкого понимания общественностью.

Наконец, сегодня мы публикуем план исследований, изучающий влияние нашего семейства моделей Codex на рынок труда, и призываем внешних исследователей к сотрудничеству в проведении этой работы. Мы рады сотрудничать с независимыми исследователями для изучения эффектов наших технологий с целью выработки надлежащих мер политики, а в дальнейшем — распространить наши наработки с генерации кода на другие модальности.

Если вы заинтересованы в работе по ответственному внедрению передовых технологий ИИ, подайте заявкуна работу в OpenAI!

Сноски

  1. A

    Эта публикация основана на нашем подходе к развертыванию языковых моделей через API, и поэтому описанные уроки и меры по смягчению рисков наиболее актуальны для тех, кто также использует развертывание на основе API. Тем не менее, мы также рассчитываем, что часть обсуждения будет полезной для создающих собственные приложения на базе языковых моделей, а также для тех, кто рассматривает возможность выпуска языковых моделей с открытым исходным кодом.

  2. B

    Эта публикация призвана объяснить и поделиться выводами из нашего подхода, а не утверждать, что все участники рынка должны обязательно перенимать ту же стратегию или что она применима ко всем возможным системам ИИ. Разные подходы к развертыванию имеют свои плюсы и минусы, разные модели получат больше или меньше пользы от предварительного изучения перед развертыванием, и в некоторых случаях полезно, когда различные игроки выбирают уникальные пути развертывания.

  3. C

    Более подробная информация об этом семинаре будет представлена в готовящейся на его основе публикации.

  4. D

    Меры по смягчению рисков, на которых мы делаем акцент в ответ на ненадлежащее использование, также эволюционировали. Например, изначально мы фокусировались на генерации длинного текста как на векторе угрозы, учитывая прошлые случаи кампаний влияния, в рамках которых люди вручную создавали вводящий в заблуждение длинный контент. Исходя из этого акцента, мы установили максимальную длину вывода для генерируемого текста. Однако пилотное исследование генерации длинного текста показало, что ограничения вывода мало влияли на нарушения правил — вместо этого мы пришли к выводу, что больший риск может представлять короткий контент, усиливающий или повышающий вовлеченность во вводимый в заблуждение материал.

  5. E

    Примеры ограничений существующих наборов данных с точки зрения специалистов, стремящихся к комплексной оценке безопасности реальных результатов работы языковых моделей, включают в себя: излишне узкую направленность (например, измерение только профессиональной гендерной предвзятости), излишне широкую направленность (например, измерение всего под зонтичным термином «токсичность»), тенденцию абстрагироваться от специфики использования и контекста, неспособность измерить генеративное измерение использования языковой модели (например, использование формата с множественным выбором), промпты, стилистически отличающиеся от тех, что обычно применяются в реальных сценариях использования, несоответствие измерениям аспектов безопасности, важных на практике (например, следование или игнорирование ограничения в инструкции, продиктованного соображениями безопасности), или неучет типов вывода, которые, как мы обнаружили, коррелируют с ненадлежащим использованием (например, контент эротического характера).

  6. F

    Хотя наши усилия специально направлены на устранение ограничений в существующих бенчмарках и в наших собственных моделях, мы также признаем ограничения используемых нами методов, таких как фильтрация данных на основе классификаторов. Например, операциональное определение областей контента, которые мы стремимся выявлять с помощью фильтрации, представляет собой сложную задачу, и сама фильтрация может вносить вредную предвзятость. Кроме того, разметка токсичных данных является важнейшим компонентом этой работы, а обеспечение психического здоровья разметчиков — общеотраслевая задача.

  7. G

    Соответствующим «пользователем» нашего API может быть разработчик, создающий приложение, или конечный пользователь, взаимодействующий с таким приложением, в зависимости от контекста. Существуют глубокие вопросы о ценностях, которые отражают наши выровненные модели, и мы надеемся сформировать более тонкое понимание того, как балансировать ценности широкого круга возможных пользователей и конкурирующие цели при выравнивании языковых моделей, чтобы делать их более полезными, правдивыми и менее вредными.

  8. H

    Более выровненные модели также обладают практическими преимуществами, такими как снижение потребности в «промпт-инжиниринге» (предоставлении примеров желаемого поведения для направления модели в нужное русло), что экономит место в контекстном окне модели, которое можно использовать для других целей.

  9. I

    Помимо исследований, мы обнаружили, что другие меры, мотивированные безопасностью, иногда приносят неожиданную пользу клиентам. Например, ограничения частоты запросов (rate limits), призванные пресекать спам или вводящий в заблуждение контент, также помогают клиентам контролировать расходы.

Авторы

Майлс Брандаж, Кэти Майер, Тина Элонду, Сандини Агарвал, Стивен Адлер, Гретхен Крюгер, Ян Лейке, Памела Мишкин

Благодарности

Спасибо Лилиан Венг, Рози Кэмпбелл, Анне Маканжу, Бобу МакГрю, Ханне Вонг, Райану Лоу, Стиву Даулингу, Мире Мурати, Сэму Альтману, Грегу Брокману, Илье Суцкевиру, Перси Лиангу, Питеру Велиндеру, Итану Пересу, Элли Эванс, Хелен Нго, Хелен Тонер, Джастину Джей Вангу, Джеку Кларку, Риши Боммасани, Гиришу Састри, Саре Шокер, Мэтту Найту, Бьянке Мартин, Бобу Ротстеду, Ламе Ахмад, Токи Шербакову и другим за отзывы об этой статье и связанной с ней работе.

Полный текст статьи читайте на OpenAI