Сеть ред-теминга OpenAI

Мы объявляем открытый набор в Сеть ред-теминга OpenAI (OpenAI Red Teaming Network) и приглашаем экспертов в различных областях, заинтересованных в повышении безопасности моделей OpenAI, присоединиться к нашей работе.

Red Teaming Network

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Обновление: прием заявок в Сеть ред-теминга на этот этап завершился 1 декабря 2023 года. Мы планируем уведомить заявителей о результатах до конца года. Мы ценим ваш интерес и, возможно, возобновим прием заявок для будущих этапов в ближайшем будущем!

Мы объявляем открытый набор в Сеть ред-теминга OpenAI и приглашаем экспертов в различных областях, заинтересованных в повышении безопасности моделей OpenAI, присоединиться к нашей работе. Мы ищем специалистов из разных сфер для сотрудничества в рамках тщательной оценки и проведения ред-теминга наших моделей ИИ.

Что такое Сеть ред-теминга OpenAI?

Ред-теминг (red teaming)A представляет собой неотъемлемую часть нашего процесса итеративного развертывания. За последние несколько лет наша деятельность по ред-темингу выросла от сосредоточенности на внутреннем состязательном тестировании (adversarial testing) в OpenAI до сотрудничества с группой внешних экспертовB, которые помогают разрабатывать специализированные классификации рисков и оценивать потенциально опасные возможности новых систем. Вы можете подробнее узнать о наших прошлых инициативах по ред-темингу, включая сотрудничество с внешними экспертами в отношении таких моделей, как DALL·E 2 и GPT‑4.C

Сегодня мы запускаем более масштабную инициативу, опирающуюся на эти ранние наработки, чтобы углубить и расширить сотрудничество со сторонними экспертами в целях повышения безопасности наших моделей. Взаимодействие с отдельными экспертами, научно-исследовательскими институтами и организациями гражданского общества — важная часть нашего процесса. Мы рассматриваем эту работу как дополнение к практике внешнего управления, такой как независимый аудит.

Сеть ред-теминга OpenAI — это сообщество надежных и опытных экспертов, которые могут помочь в более широкой оценке рисков и мерах по их минимизации, заменяя разовые привлечения и отборочные процедуры перед масштабным развертыванием моделей. Участники сети будут привлекаться на основе их экспертных знаний для проведения ред-теминга на различных этапах жизненного цикла модели и продукта. Не каждый участник будет задействован в работе с каждой новой моделью или продуктом, а объем затрачиваемого времени будет определяться индивидуально для каждого члена сети и может составлять всего 5–10 часов в год.

Помимо кампаний по ред-темингу по заказу OpenAI, участники получат возможность общаться друг с другом по поводу общих практик и результатов ред-теминга. Цель состоит в том, чтобы обеспечить более разнообразный и постоянный приток идей, сделав ред-теминг более итеративным процессом. Эта сеть дополняет другие инициативы в области безопасности ИИ, включая нашу программу доступа для исследователей (Researcher Access Program) и оценки с открытым исходным кодом.

Зачем присоединяться к Сети ред-теминга OpenAI?

Эта сеть предлагает уникальную возможность формировать разработку более безопасных технологий и политик в сфере ИИ, а также влиять на то, как ИИ отражается на нашей жизни, работе и общении. Став частью этой сети, вы войдете в наш кадровый резерв профильных экспертов, к которым можно будет обращаться для оценки наших моделей и систем на различных этапах их развертывания.

Поиск разнообразной экспертизы

Оценка систем ИИ требует понимания самых разных областей, разнообразных перспектив и жизненного опыта. Мы приглашаем подавать заявки экспертов со всего мира и уделяем первостепенное внимание географическому разнообразию, а также разнообразию областей знаний при отборе кандидатов.

Некоторые из интересующих нас областей включают в себя (но не ограничиваются ими):

Когнитивные науки

Химия

Биология

Физика

Информатика

Стеганография

Политология

Психология

Убеждение

Экономика

Антропология

Социология

Взаимодействие человека с компьютером (HCI)

Справедливость и предвзятость

Согласование (Alignment)

Образование

Здравоохранение

Право

Безопасность детей

Кибербезопасность

Финансы

Дезинформация и фейки

Политическое использование

Конфиденциальность

Биометрия

Языки и лингвистика

Предыдущий опыт работы с системами ИИ или языковыми моделями не обязателен, но может быть полезен. Больше всего мы ценим вашу готовность к сотрудничеству и способность привнести свое видение в оценку влияния систем ИИ.

Компенсация и конфиденциальность

Всем участникам Сети ред-теминга OpenAI выплачивается компенсация за их вклад при участии в проекте ред-теминга. Хотя членство в этой сети не ограничивает вас в публикации ваших исследований или преследовании других возможностей, следует учитывать, что любое участие в ред-теминге и других проектах часто подпадает под действие соглашений о неразглашении (NDA) или остается конфиденциальным в течение неопределенного периода времени.

Как подать заявку

Прием заявок окончен. Присоединяйтесь к нашей миссии по созданию безопасного ОИИ (AGI), который приносит пользу всему человечеству. Подайте заявку на участие в Сети ред-теминга OpenAI уже сегодня.

Часто задаваемые вопросы (FAQ)

В: Что предполагает участие в сети?

О: Быть частью сети означает, что с вами могут связаться по поводу возможностей протестировать новую модель или проверить определенную область интересов на уже развернутой модели. Работа, выполняемая в рамках сети, проводится на условиях соглашения о неразглашении (NDA), хотя исторически мы публиковали многие результаты нашего ред-теминга в карточках систем (System Cards) и блогах. Вам будет выплачена компенсация за время, потраченное на проекты по ред-темингу.

В: Каковы ожидаемые временные затраты на участие в сети?

О: Время, которое вы решите уделить, может быть скорректировано в зависимости от вашего графика. Обратите внимание, что не каждый участник сети будет привлекаться к каждой возможности: OpenAI будет делать выбор на основе соответствия конкретному проекту ред-теминга, делая акцент на новых перспективах в последующих кампаниях ред-теминга. Даже всего 5 часов в год будут ценны для нас, поэтому не стесняйтесь подавать заявку, если вы заинтересованы, но ваше время ограничено.

В: Когда кандидаты будут уведомлены о своем принятии?

О: OpenAI будет отбирать участников сети на постоянной основе, и вы могли подать заявку до 1 декабря 2023 года. После этого периода подачи заявок мы повторно оценим возможность открытия новых возможностей для подачи заявок в будущем.

В: Означает ли участие в сети, что меня попросят проводить ред-теминг для каждой новой модели?

О: Нет, OpenAI будет осуществлять отбор на основе соответствия конкретному проекту ред-теминга, и вам не следует ожидать тестирования каждой новой модели.

В: Каковы некоторые критерии отбора участников сети?

О: Некоторые из критериев, которые мы ищем:

  • Продемонстрированный опыт или квалификация в определенной области, имеющей отношение к ред-темингу
  • Увлеченность идеей повышения безопасности ИИ
  • Отсутствие конфликта интересов
  • Разнообразный опыт и принадлежность к традиционно недопредставленным группам
  • Разнообразное географическое представительство
  • Владение более чем одним языком
  • Технические навыки (не обязательно)

В: Какие еще существуют возможности для совместной работы в сфере безопасности?

О: Помимо вступления в сеть, существуют и другие возможности внести свой вклад в безопасность ИИ. Например, один из вариантов — создание или проведение оценок безопасности систем ИИ и анализ полученных результатов.

Репозиторий с открытым исходным кодом Evals от OpenAI (выпущенный в рамках запуска GPT‑4) предлагает удобные шаблоны и примеры методов для быстрого старта этого процесса.

Оценки могут варьироваться от простых тестов в формате вопросов и ответов до более сложных симуляций. В качестве конкретных примеров приводим типовые оценки, разработанные OpenAI для оценки поведения ИИ с различных точек зрения:

Убеждение (Persuasion)

  • MakeMeSay: Насколько хорошо система ИИ может заставить другую систему ИИ сказать секретное слово?
  • MakeMePay: Насколько хорошо система ИИ может убедить другую систему ИИ пожертвовать деньги?
  • Ballot Proposal: Насколько хорошо система ИИ может повлиять на поддержку другой системой ИИ какого-либо политического предложения?

Стеганография (скрытая передача сообщений)

  • Steganography: Насколько хорошо система ИИ может передавать секретные сообщения так, чтобы другая система ИИ этого не заметила?
  • Text Compression: Насколько хорошо система ИИ может сжимать и распаковывать сообщения для сокрытия секретной информации?
  • Schelling Point: Насколько хорошо система ИИ может координировать действия с другой системой ИИ без прямой связи?

Мы поощряем творческий подход и эксперименты при оценке систем ИИ. После завершения работы мы приглашаем вас внести свою оценку в репозиторий Evals с открытым исходным кодом для использования более широким сообществом специалистов по ИИ.

Вы также можете подать заявку на нашу программу доступа для исследователей (Researcher Access Program), которая предоставляет кредиты для поддержки исследователей, использующих наши продукты при изучении тем, связанных с ответственным развертыванием ИИ и смягчением сопутствующих рисков.

Сноски

  1. A

    Термин «ред-тиминг» (red teaming) используется для обозначения широкого спектра методов оценки рисков для систем ИИ, включая качественное обнаружение возможностей, стресс-тестирование средств защиты, автоматизированный ред-тиминг с использованием языковых моделей, предоставление отзывов о масштабах риска для конкретной уязвимости и т. д. Чтобы уменьшить путаницу, связанную с термином «ред-тим», помочь читателям наших материалов лучше понять их контекст и особенно избежать ложной уверенности, мы работаем над внедрением более чсущейся терминологии, как рекомендуется в Khlaaf, 2023, однако для простоты и использования терминологии, согласованной с нашими партнерами, мы используем термин «ред-тим».

  2. B

    Мы используем термин «эксперт» для обозначения специалиста, обладающего знаниями в определенной области и практическим опытом

  3. C

    Мы также получали отзывы о профиле риска наших систем в других формах, таких как Программа поиска уязвимостей (Bug Bounty) и Конкурс отзывов о ChatGPT.

Автор

OpenAI

Полный текст статьи читайте на OpenAI