Расширение нашей программы выплаты вознаграждений за обнаружение уязвимостей в безопасности моделей

Security locks

Стремительное развитие возможностей ИИ-моделей требует столь же быстрого совершенствования протоколов безопасности. По мере работы над созданием нового поколения наших систем защиты ИИ мы расширяем программу выплаты вознаграждений за уязвимости (bug bounty) и запускаем новую инициативу, направленную на поиск изъянов в механизмах защиты, которые мы используем для предотвращения ненадлежащего использования наших моделей.

Программы bug bounty играют важнейшую роль в укреплении безопасности и надежности технологических систем. Наша новая инициатива сосредоточена на выявлении и устранении универсальных атак типа «джейлбрейк» (обход системных ограничений). Это эксплойты, которые могут позволить стабильно обходить защитные механизмы ИИ в самых разных областях. Нацеливаясь на универсальные джейлбрейки, мы стремимся устранить наиболее серьезные уязвимости в критических областях с высоким уровнем риска, таких как CBRN (химические, биологические, радиологические и ядерные материалы) и кибербезопасность.

Мы рады сотрудничать с мировым сообществом исследователей в области безопасности и приглашаем всех заинтересованных специалистов подать заявку на участие в нашей программе и оценить наши новые средства защиты.

Наш подход

До сих пор мы проводили программу bug bounty только по приглашениям в партнерстве с HackerOne, вознаграждая исследователей за выявление проблем безопасности в наших общедоступных ИИ-моделях. Инициатива, о которой мы объявляем сегодня, будет тестировать нашу систему нового поколения для смягчения рисков безопасности ИИ, которую мы еще не развернули публично. Вот как это будет работать:

  • Ранний доступ: Участники получат ранний доступ для тестирования нашей новейшей системы обеспечения безопасности до ее публичного запуска. В рамках этого участникам будет предложено выявить потенциальные уязвимости или способы обхода наших мер безопасности в контролируемой среде.
  • Сфера применения программы: Мы предлагаем вознаграждение в размере до 15 000 долларов США за новые универсальные джейлбрейк-атаки, которые могут выявить уязвимости в критических областях с высоким уровнем риска, таких как CBRN (химические, биологические, радиологические и ядерные материалы) и кибербезопасность. Как мы уже писали ранее, джейлбрейк-атака в сфере ИИ — это метод, используемый для обхода встроенных мер безопасности и этических принципов ИИ-системы, позволяющий пользователю получить от ИИ ответы или реакции, которые обычно ограничены или запрещены. Универсальный джейлбрейк — это тип уязвимости в системах ИИ, который позволяет пользователю стабильно обходить меры безопасности по широкому кругу тем. Выявление и устранение универсальных джейлбрейков является ключевой целью этой инициативы bug bounty. В случае использования такие уязвимости могут иметь далеко идущие последствия в самых разных вредных, неэтичных или опасных сферах. Джейлбрейк будет считаться универсальным, если с его помощью удается заставить модель ответить на заданное количество конкретных вредоносных вопросов. Подробные инструкции и обратная связь будут предоставлены участникам программы.

Присоединяйтесь к работе

Эта инициатива по безопасности моделей начнется в закрытом режиме по приглашениям в партнерстве с HackerOne. Хотя на начальном этапе участие будет осуществляться только по приглашениям, в будущем мы планируем расширить эту инициативу. Этот начальный этап позволит нам отладить процессы и своевременно предоставлять участникам конструктивные отзывы. Если вы являетесь опытным исследователем безопасности ИИ или имеете подтвержденный опыт выявления джейлбрейков в языковых моделях, мы рекомендуем вам подать заявку на получение приглашения через нашу форму заявки до пятницы, 16 августа. Мы свяжемся с отобранными кандидатами осенью.

Тем временем мы активно ждем любых сообщений о проблемах безопасности моделей, чтобы постоянно совершенствовать наши текущие системы. Если вы обнаружили потенциальную проблему безопасности в наших текущих системах, пожалуйста, сообщите о ней по адресу usersafety@anthropic.com, указав достаточно деталей для воспроизведения проблемы. Для получения дополнительной информации обратитесь к нашей Политике ответственного раскрытия информации.

Эта инициатива согласуется с обязательствами, которые мы взяли на себя совместно с другими компаниями в области ИИ для разработки ответственного искусственного интеллекта, такими как Добровольные обязательства в сфере ИИ, объявленные Белым домом, и Этический кодекс для организаций, разрабатывающих передовые системы ИИ, разработанный в рамках Хиросимского процесса G7.Наша цель — помочь ускорить прогресс в предотвращении универсальных джейлбрейков и укрепить безопасность ИИ в зонах высокого риска. Если у вас есть опыт в этой области, присоединяйтесь к нам в этой важнейшей работе. Ваш вклад может сыграть ключевую роль в том, чтобы по мере развития возможностей ИИ наши меры безопасности не отставали от них.

Полный текст статьи читайте на Anthropic