Проверка нашей системы защиты с помощью новой программы поиска уязвимостей (bug bounty)

Сегодня мы запускаем новую программу bug bounty для стресс-тестирования наших новейших мер безопасности. Как и в случае с программой, о которой мы объявили прошлым летом, мы предлагаем исследователям найти универсальные обходы (jailbreak) в классификаторах безопасности, которые мы еще не развернули публично. Эти средства защиты являются частью передовых мер безопасности, разработанных нами для соответствия Стандарту развертывания уровня искусственного интеллекта 3 (ASL-3) в рамках нашей Политики ответственного масштабирования — концепции, которая определяет, как мы безопасно разрабатываем и внедряем все более способные модели ИИ.
Программа bug bounty, проводимая в партнерстве с HackerOne, будет тестировать обновленную версию нашей системы конституционных классификаторов (Constitutional Classifiers). Конституционные классификаторы — это разработанный нами метод защиты от обходов системы безопасности, которые могут извлекать информацию, связанную с химоружием, биологическим, радиологическим и ядерным оружием (ХБРЯ). Эта система следует списку принципов, определяющих, какой контент должен и не должен разрешаться при взаимодействии с Claude, и узко сфокусирована на конкретных угрозах.
Участники получат ранний доступ к тестированию наших классификаторов на Claude 3.7 Sonnet. Мы предлагаем вознаграждения до 25 000 долларов США за подтвержденные универсальные обходы, обнаруженные в невыпущенной системе. Универсальный обход — это уязвимость, которая стабильно обходит меры безопасности Claude в самых разных темах. В рамках данной инициативы нас интересуют универсальные обходы, которые могут быть использованы для злоупотреблений в темах, связанных с ХБРЯ.
Наши модели становятся все более мощными, и, как мы уже отмечали ранее, мы считаем, что некоторым будущим моделям может потребоваться продвинутый уровень безопасности и защиты ASL-3, описанный в нашей Политике ответственного масштабирования. Эта инициатива bug bounty внесет свой вклад в работу, которую мы проделали за последние несколько месяцев по итерации и стресс-тестированию наших средств защиты ASL-3.
Мы запустили эту новую инициативу bug bounty при участии исследователей, которые присоединились к нашей прошлогодней программе, а также предоставляем возможность поучаствовать новым исследователям. Если вы являетесь опытным специалистом по red teaming или обладаете подтвержденным опытом выявления обходов в языковых моделях, мы рекомендуем вам подать заявку на получение приглашения через нашу форму заявки. Подробные инструкции и отзывы будут предоставлены выбранным участникам. Прием заявок открывается сегодня и продлится до воскресенья, 18 мая. Эта инициатива доступна только по приглашениям, чтобы мы могли оперативно реагировать на отправленные материалы.
Мы благодарны сообществу специалистов по безопасности за партнерство, помогающее делать системы ИИ более безопасными.
Обновление от 22 мая 2025 г.
Программа bug bounty, описанная в этом посте, завершена. Участники перейдут к новой инициативе bug bounty, которую мы запускаем сегодня и которая сосредоточена на стресс-тестировании нашей системы конституционных классификаторов на новой модели Claude Opus 4, а также на тестировании других систем безопасности, которые мы можем разработать. Мы по-прежнему принимаем заявки на участие в этой новой программе, доступной только по приглашениям. Вы можете подать заявку на получение приглашения через нашу форму заявки.
Для дальнейшего продвижения безопасности ИИ мы также принимаем сообщения об универсальных обходах для сценариев использования, вызывающих обеспокоенность в рамках ASL-3 (то есть тех, которые извлекают информацию, связанную с биологическими угрозами), обнаруженных на публичных платформах или форумах, таких как социальные сети. Для получения дополнительной информации см. здесь.
Полный текст статьи читайте на Anthropic
