Повышение уровня нашей защиты благодаря сотрудничеству с US CAISI и UK AISI
За последний год мы наладили сотрудничество с Американским центром стандартов и инноваций в области искусственного интеллекта (US CAISI) и Британским институтом безопасности искусственного интеллекта (UK AISI) — государственными ведомствами, созданными для оценки и повышения безопасности систем ИИ. Наша совместная работа на добровольной основе начиналась с предварительных консультаций, но со временем переросла в постоянное партнерство, в рамках которого команды CAISI и AISI получали доступ к нашим системам на различных этапах разработки моделей, что позволяло проводить их непрерывное тестирование.
Правительства привносят в эту работу уникальные возможности, в частности глубокую экспертизу в областях национальной безопасности, таких как кибербезопасность, аналитика разведданных и моделирование угроз. В сочетании с их опытом в области машинного обучения это позволяет оценивать конкретные векторы атак и механизмы защиты. Их отзывы помогают нам совершенствовать меры безопасности, чтобы наши системы могли противостоять наиболее изощренным попыткам злоумышленного использования.
Работа с независимыми внешними экспертами для выявления уязвимостей в системах ИИ является важнейшей частью подхода компании Anthropic к обеспечению безопасности (Safeguards) и играет ключевую роль в предотвращении такого использования наших моделей, которое может нанести реальный ущерб.
Выявление уязвимостей и устранение их последствий
Это сотрудничество уже привело к ключевым открытиям, которые помогли нам усовершенствовать инструменты, используемые для предотвращения вредоносного применения наших моделей. В рамках наших соответствующих соглашений с CAISI и AISI каждая организация перед развертыванием оценивала несколько итераций наших конституционных классификаторов (Constitutional Classifiers) — защитной системы, которую мы применяем для обнаружения и предотвращения обхода ограничений (джейлбрейков) на таких моделях, как Claude Opus 4 и 4.1, что помогло выявить уязвимости и выстроить надежные механизмы защиты.
Тестирование конституционных классификаторов. Мы предоставили CAISI и AISI доступ к нескольким ранним версиям наших конституционных классификаторов и продолжали открывать доступ к нашим новейшим системам по мере их совершенствования. Вместе мы провели стресс-тестирование этих классификаторов: государственные команды «красных шапок» (red-teamers) выявили целый ряд уязвимостей как до, так и после развертывания, а наша техническая команда использовала эти результаты для усиления защиты. В качестве примеров можно привести следующие уязвимости:
- Выявление уязвимостей к инъекциям промптов (prompt injection). Государственные эксперты по тестированию на проникновение обнаружили слабые места в наших ранних классификаторах с помощью атак путем внедрения инструкций. Подобные атаки используют скрытые указания, чтобы заставить модели вести себя непредусмотренным разработчиком системы образом. Тестировщики обнаружили, что определенные аннотации, например ложные утверждения о прохождении проверки человеком, могут полностью обходить обнаружение классификатором. Мы устранили эти уязвимости.
- Стресс-тестирование архитектур безопасности. Они разработали сложный универсальный джейлбрейк, который кодировал вредоносные взаимодействия способами, позволявшими обойти наши стандартные методы обнаружения. Вместо простого устранения этого конкретного эксплойта данное открытие побудило нас коренным образом перестроить архитектуру нашей защиты для устранения всего класса лежащих в его основе уязвимостей.
- Выявление атак на основе шифров. Кодирование вредоносных запросов с помощью шифров, подстановки символов и других методов обфускации с целью обхода наших классификаторов. Эти результаты способствовали усовершенствованию наших систем обнаружения, позволив им распознавать и блокировать замаскированный вредоносный контент независимо от метода кодирования.
- Атаки с обфускацией входных и выходных данных. Были обнаружены универсальные джейлбрейки, использующие изощренные методы обфускации, адаптированные под наши конкретные средства защиты, такие как фрагментация вредоносных строк на кажущиеся безобидными компоненты в более широком контексте. Выявление этих «слепых зон» позволило целенаправленно улучшить механизмы фильтрации.
- Автоматизированная оптимизация атак. Были созданы новые автоматизированные системы, которые постепенно оптимизируют стратегии атак. Недавно они использовали эту систему для создания эффективного универсального джейлбрейка путем итеративного изменения менее эффективного метода обхода, и теперь мы применяем этот опыт для совершенствования нашей защиты.
Оценка и методология рисков. Помимо выявления конкретных уязвимостей, команды CAISI и AISI помогли укрепить наш общий подход к безопасности. Их внешний взгляд на требования к доказательствам, мониторинг развертывания и возможности быстрого реагирования оказался неоценимым для критической проверки наших предположений и определения областей, где могут потребоваться дополнительные доказательства для поддержки наших моделей угроз.
Ключевые уроки для эффективного сотрудничества
Наш опыт преподал нам несколько важных уроков о том, как эффективно взаимодействовать с государственными исследовательскими и стандартизирующими органами для повышения безопасности и защищенности наших моделей.
Всесторонний доступ к моделям повышает эффективность тестирования на проникновение. Наш опыт показывает, что предоставление государственным специалистам более глубокого доступа к нашим системам позволяет эффективнее выявлять уязвимости. Мы предоставили несколько ключевых ресурсов:
- Прототипы средств защиты до их развертывания. Тестировщики могли оценивать и дорабатывать защитные системы до их запуска в работу, выявляя слабые места до внедрения мер безопасности.
- Множественные конфигурации систем. Мы предоставили модели из всего спектра средств защиты — от полностью незащищенных версий до моделей с полным комплексом защитных механизмов. Такой подход позволяет тестировщикам сначала разрабатывать атаки против базовых моделей, а затем постепенно совершенствовать методы обхода все более сложных систем защиты. Варианты моделей, ориентированных исключительно на полезность (helpful-only), также позволили проводить точную оценку вредоносных ответов и бенчмаркинг возможностей.
- Обширная документация и внутренние ресурсы. Мы предоставили доверенным правительственным командам детали нашей архитектуры безопасности, задокументированные уязвимости, отчеты о защите и подробную информацию о политике в отношении контента (включая конкретные запрещенные запросы и критерии оценки). Такая прозрачность помогла командам сосредоточиться на ценных областях тестирования, а не искать слабые места вслепую.
- Данные о защите в реальном времени ускоряют обнаружение уязвимостей. Мы предоставили государственным экспертам прямой доступ к оценкам классификатора. Это позволило тестировщикам уточнить стратегии атак и проводить более целенаправленные исследовательские изыскания.
Итеративное тестирование позволяет выявлять сложные уязвимости. Хотя единичные оценки приносят пользу, устойчивое сотрудничество позволяет внешним командам обрести глубокую экспертную специализацию в отношении систем и обнаруживать более сложные уязвимости. На критических этапах мы поддерживали каналы ежедневной связи и проводили частые глубокие технические обсуждения с нашими партнерами.
Взаимодополняющие подходы обеспечивают более надежную безопасность. Оценки CAISI и AISI работают в синергии с нашей более широкой экосистемой. Программы выплаты вознаграждений за найденные ошибки (bug bounty) генерируют масштабные и разнообразные отчеты об уязвимостях от широкого пула специалистов, в то время как специализированные экспертные команды помогают выявить сложные, неочевидные векторы атак, для обнаружения которых требуются глубокие технические знания. Эта многоуровневая стратегия помогает гарантировать, что мы отлавливаем как распространенные эксплойты, так и сложные граничные случаи.
Дальнейшее сотрудничество
Обеспечение безопасности и полезности мощных моделей ИИ требует не только технологических инноваций, но и новых форм сотрудничества между индустрией и государством. Наш опыт показывает, что государственно-частное партнерство наиболее эффективно, когда технические команды тесно работают вместе для выявления рисков и противодействия им.
По мере развития возможностей ИИ роль независимой оценки мер по снижению рисков приобретает все большее значение. Мы воодушевлены тем, что другие разработчики ИИ также сотрудничают с этими государственными ведомствами, и призываем другие компании делать то же самое и активнее делиться собственным опытом.
Мы выражаем искреннюю благодарность техническим командам американского центра US CAISI и британского института UK AISI за их строгие тесты, ценные отзывы и постоянное сотрудничество. Их работа существенно повысила безопасность наших систем и продвинула вперед область измерения эффективности мер защиты ИИ.
Полный текст статьи читайте на Anthropic
