Темы



Сеть ред-теминга OpenAI

Мы объявляем открытый набор в Сеть ред-теминга OpenAI (OpenAI Red Teaming Network) и приглашаем экспертов в различных областях, заинтересованных в повышении безопасности моделей OpenAI, присоединиться к нашей работе.

Red Teaming Network

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

Обновление: прием заявок в Сеть ред-теминга на этот этап завершился 1 декабря 2023 года. Мы планируем уведомить заявителей о результатах до конца года. Мы ценим ваш интерес и, возможно, возобновим прием заявок для будущих этапов в ближайшем будущем!

Мы объявляем открытый набор в Сеть ред-теминга OpenAI и приглашаем экспертов в различных областях, заинтересованных в повышении безопасности моделей OpenAI, присоединиться к нашей работе. Мы ищем специалистов из разных сфер для сотрудничества в рамках тщательной оценки и проведения ред-теминга наших моделей ИИ.

Что такое Сеть ред-теминга OpenAI?

Ред-теминг (red teaming)A представляет собой неотъемлемую часть нашего процесса итеративного развертывания⁠. За последние несколько лет наша деятельность по ред-темингу выросла от сосредоточенности на внутреннем состязательном тестировании (adversarial testing) в OpenAI до сотрудничества с группой внешних экспертовB, которые помогают разрабатывать специализированные классификации рисков и оценивать потенциально опасные возможности новых систем. Вы можете подробнее узнать о наших прошлых инициативах по ред-темингу, включая сотрудничество с внешними экспертами в отношении таких моделей, как DALL·E 2⁠ и GPT‑4⁠.C

Сегодня мы запускаем более масштабную инициативу, опирающуюся на эти ранние наработки, чтобы углубить и расширить сотрудничество со сторонними экспертами в целях повышения безопасности наших моделей. Взаимодействие с отдельными экспертами, научно-исследовательскими институтами и организациями гражданского общества — важная часть нашего процесса. Мы рассматриваем эту работу как дополнение к практике внешнего управления, такой как независимый аудит.

Сеть ред-теминга OpenAI — это сообщество надежных и опытных экспертов, которые могут помочь в более широкой оценке рисков и мерах по их минимизации, заменяя разовые привлечения и отборочные процедуры перед масштабным развертыванием моделей. Участники сети будут привлекаться на основе их экспертных знаний для проведения ред-теминга на различных этапах жизненного цикла модели и продукта. Не каждый участник будет задействован в работе с каждой новой моделью или продуктом, а объем затрачиваемого времени будет определяться индивидуально для каждого члена сети и может составлять всего 5–10 часов в год.

Помимо кампаний по ред-темингу по заказу OpenAI, участники получат возможность общаться друг с другом по поводу общих практик и результатов ред-теминга. Цель состоит в том, чтобы обеспечить более разнообразный и постоянный приток идей, сделав ред-теминг более итеративным процессом. Эта сеть дополняет другие инициативы в области безопасности ИИ, включая нашу программу доступа для исследователей (Researcher Access Program)⁠ и оценки с открытым исходным кодом⁠.

Зачем присоединяться к Сети ред-теминга OpenAI?

Эта сеть предлагает уникальную возможность формировать разработку более безопасных технологий и политик в сфере ИИ, а также влиять на то, как ИИ отражается на нашей жизни, работе и общении. Став частью этой сети, вы войдете в наш кадровый резерв профильных экспертов, к которым можно будет обращаться для оценки наших моделей и систем на различных этапах их развертывания.

Поиск разнообразной экспертизы

Оценка систем ИИ требует понимания самых разных областей, разнообразных перспектив и жизненного опыта. Мы приглашаем подавать заявки экспертов со всего мира и уделяем первостепенное внимание географическому разнообразию, а также разнообразию областей знаний при отборе кандидатов.

Некоторые из интересующих нас областей включают в себя (но не ограничиваются ими):

Когнитивные науки

Химия

Биология

Физика

Информатика

Стеганография

Политология

Психология

Убеждение

Экономика

Антропология

Социология

Взаимодействие человека с компьютером (HCI)

Справедливость и предвзятость

Согласование (Alignment)

Образование

Здравоохранение

Право

Безопасность детей

Кибербезопасность

Финансы

Дезинформация и фейки

Политическое использование

Конфиденциальность

Биометрия

Языки и лингвистика

Предыдущий опыт работы с системами ИИ или языковыми моделями не обязателен, но может быть полезен. Больше всего мы ценим вашу готовность к сотрудничеству и способность привнести свое видение в оценку влияния систем ИИ.

Компенсация и конфиденциальность

Всем участникам Сети ред-теминга OpenAI выплачивается компенсация за их вклад при участии в проекте ред-теминга. Хотя членство в этой сети не ограничивает вас в публикации ваших исследований или преследовании других возможностей, следует учитывать, что любое участие в ред-теминге и других проектах часто подпадает под действие соглашений о неразглашении (NDA) или остается конфиденциальным в течение неопределенного периода времени.

Как подать заявку

Прием заявок окончен. Присоединяйтесь к нашей миссии по созданию безопасного ОИИ (AGI), который приносит пользу всему человечеству. Подайте заявку на участие в Сети ред-теминга OpenAI уже сегодня.

Часто задаваемые вопросы (FAQ)

В: Что предполагает участие в сети?

О: Быть частью сети означает, что с вами могут связаться по поводу возможностей протестировать новую модель или проверить определенную область интересов на уже развернутой модели. Работа, выполняемая в рамках сети, проводится на условиях соглашения о неразглашении (NDA), хотя исторически мы публиковали многие результаты нашего ред-теминга в карточках систем (System Cards) и блогах. Вам будет выплачена компенсация за время, потраченное на проекты по ред-темингу.

В: Каковы ожидаемые временные затраты на участие в сети?

О: Время, которое вы решите уделить, может быть скорректировано в зависимости от вашего графика. Обратите внимание, что не каждый участник сети будет привлекаться к каждой возможности: OpenAI будет делать выбор на основе соответствия конкретному проекту ред-теминга, делая акцент на новых перспективах в последующих кампаниях ред-теминга. Даже всего 5 часов в год будут ценны для нас, поэтому не стесняйтесь подавать заявку, если вы заинтересованы, но ваше время ограничено.

В: Когда кандидаты будут уведомлены о своем принятии?

О: OpenAI будет отбирать участников сети на постоянной основе, и вы могли подать заявку до 1 декабря 2023 года. После этого периода подачи заявок мы повторно оценим возможность открытия новых возможностей для подачи заявок в будущем.

В: Означает ли участие в сети, что меня попросят проводить ред-теминг для каждой новой модели?

О: Нет, OpenAI будет осуществлять отбор на основе соответствия конкретному проекту ред-теминга, и вам не следует ожидать тестирования каждой новой модели.

В: Каковы некоторые критерии отбора участников сети?

О: Некоторые из критериев, которые мы ищем:

  • Продемонстрированный опыт или квалификация в определенной области, имеющей отношение к ред-темингу
  • Увлеченность идеей повышения безопасности ИИ
  • Отсутствие конфликта интересов
  • Разнообразный опыт и принадлежность к традиционно недопредставленным группам
  • Разнообразное географическое представительство
  • Владение более чем одним языком
  • Технические навыки (не обязательно)

В: Какие еще существуют возможности для совместной работы в сфере безопасности?

О: Помимо вступления в сеть, существуют и другие возможности внести свой вклад в безопасность ИИ. Например, один из вариантов — создание или проведение оценок безопасности систем ИИ и анализ полученных результатов.

Репозиторий с открытым исходным кодом Evals⁠ от OpenAI (выпущенный в рамках запуска GPT‑4⁠) предлагает удобные шаблоны и примеры методов для быстрого старта этого процесса.

Оценки могут варьироваться от простых тестов в формате вопросов и ответов до более сложных симуляций. В качестве конкретных примеров приводим типовые оценки, разработанные OpenAI для оценки поведения ИИ с различных точек зрения:

Убеждение (Persuasion)

  • MakeMeSay⁠: Насколько хорошо система ИИ может заставить другую систему ИИ сказать секретное слово?
  • MakeMePay⁠: Насколько хорошо система ИИ может убедить другую систему ИИ пожертвовать деньги?
  • Ballot Proposal⁠: Насколько хорошо система ИИ может повлиять на поддержку другой системой ИИ какого-либо политического предложения?

Стеганография (скрытая передача сообщений)

  • Steganography⁠: Насколько хорошо система ИИ может передавать секретные сообщения так, чтобы другая система ИИ этого не заметила?
  • Text Compression⁠: Насколько хорошо система ИИ может сжимать и распаковывать сообщения для сокрытия секретной информации?
  • Schelling Point⁠: Насколько хорошо система ИИ может координировать действия с другой системой ИИ без прямой связи?

Мы поощряем творческий подход и эксперименты при оценке систем ИИ. После завершения работы мы приглашаем вас внести свою оценку в репозиторий Evals⁠ с открытым исходным кодом для использования более широким сообществом специалистов по ИИ.

Вы также можете подать заявку на нашу программу доступа для исследователей (Researcher Access Program)⁠, которая предоставляет кредиты для поддержки исследователей, использующих наши продукты при изучении тем, связанных с ответственным развертыванием ИИ и смягчением сопутствующих рисков.

Сноски

  1. A

    Термин «ред-тиминг» (red teaming) используется для обозначения широкого спектра методов оценки рисков для систем ИИ, включая качественное обнаружение возможностей, стресс-тестирование средств защиты, автоматизированный ред-тиминг с использованием языковых моделей, предоставление отзывов о масштабах риска для конкретной уязвимости и т. д. Чтобы уменьшить путаницу, связанную с термином «ред-тим», помочь читателям наших материалов лучше понять их контекст и особенно избежать ложной уверенности, мы работаем над внедрением более чсущейся терминологии, как рекомендуется в Khlaaf, 2023⁠, однако для простоты и использования терминологии, согласованной с нашими партнерами, мы используем термин «ред-тим».

  2. B

    Мы используем термин «эксперт» для обозначения специалиста, обладающего знаниями в определенной области и практическим опытом

  3. C

    Мы также получали отзывы о профиле риска наших систем в других формах, таких как Программа поиска уязвимостей (Bug Bounty)⁠ и Конкурс отзывов о ChatGPT⁠.

Автор

OpenAI

Полный текст статьи читайте на OpenAI