Проблемы при проведении «красного тестирования» (red teaming) систем ИИ

Computer chip and a flame

В этой статье мы подробно описываем выводы, полученные на основе ряда подходов к «красному тестированию» (red teaming), которые мы использовали для проверки наших систем искусственного интеллекта. В ходе этой работы мы начали собирать эмпирические данные о том, какие инструменты лучше всего подходят для конкретных ситуаций, а также о сопутствующих преимуществах и проблемах каждого подхода. Мы надеемся, что эта статья окажется полезной для других компаний, стремящихся протестировать свои ИИ-системы методом «красного тестирования», для директивных органов, интересующихся тем, как это работает на практике, и для организаций, желающих проводить независимую проверку ИИ-технологий.

Что такое «красное тестирование» (red teaming)?

«Красное тестирование» (red teaming) — это важнейший инструмент для повышения безопасности и защищенности систем искусственного интеллекта. Оно предполагает состязательное тестирование технологической системы с целью выявления потенциальных уязвимостей. Сегодня исследователи и разработчики ИИ используют широкий спектр методов «красного тестирования» для проверки своих систем, и каждый из них имеет свои плюсы и минусы.

Ситуацию еще больше осложняет отсутствие стандартизированных практик для «красного тестирования» ИИ. Разработчики могут использовать разные методы для оценки одного и того же типа угроз, и даже при применении одинаковых методов сам процесс тестирования на практике может выглядеть совершенно по-разному. Такая несогласованность затрудняет объективное сравнение относительной безопасности различных систем ИИ.

Для решения этой проблемы сфере искусственного интеллекта необходимы устоявшиеся практики и стандарты систематического «красного тестирования». Мы считаем важным заняться этой работой уже сейчас, чтобы организации были готовы справляться с современными рисками и смягчать будущие угрозы по мере существенного роста возможностей моделей. Стремясь внести свой вклад в достижение этой цели, мы делимся обзором некоторых опробованных нами методов «красного тестирования» и показываем, как их можно интегрировать в итеративный процесс: от качественного тестирования до разработки автоматизированных оценок. В заключение мы приводим перечень рекомендуемых мер, которые могут предпринять директивные органы для формирования надежной экосистемы тестирования ИИ.

Методы «красного тестирования», рассматриваемые в этой статье:

Предметно-ориентированное экспертное «красное тестирование»

  • Доверие и безопасность: тестирование уязвимостей политик
  • Национальная безопасность: «красное тестирование» передовых угроз
  • Учет региональной специфики: многоязычное и мультикультурное «красное тестирование»

Использование языковых моделей для «красного тестирования»

  • Автоматизированное «красное тестирование»

«Красное тестирование» в новых модальностях

  • Мультимодальное «красное тестирование»

Открытое общее «красное тестирование»

  • Краудсорсинговое «красное тестирование» общих рисков нанесения вреда
  • Общинное (community-based) «красное тестирование» общих рисков и системных ограничений

В следующих разделах мы подробно рассмотрим каждый из этих методов, изучив их уникальные преимущества и проблемы (некоторые из описанных нами достоинств и трудностей могут быть применимы ко всем методам «красного тестирования»).

Предметно-ориентированное экспертное тестирование

В общих чертах предметно-ориентированное экспертное тестирование заключается в сотрудничестве со специалистами в конкретных областях для выявления и оценки потенциальных уязвимостей или рисков в системах ИИ в пределах их сферы компетенции. Привлечение экспертов позволяет глубже понять сложные, специфичные для конкретного контекста проблемы.

Тестирование уязвимости политик в отношении рисков доверия и безопасности (Trust & Safety)

Угрозы высокого риска, способные нанести серьезный ущерб людям или оказать негативное влияние на общество, требуют применения сложных методов «красного тестирования» и сотрудничества с внешними экспертами в соответствующих областях. В сфере доверия и безопасности (Trust & Safety) мы используем форму «красного тестирования», называемую «тестированием уязвимости политик» (Policy Vulnerability Testing — PVT). PVT представляет собой углубленное качественное тестирование, которое мы проводим совместно с внешними экспертами по различным темам политик, охватываемым нашей политикой использования. Мы сотрудничаем с такими экспертами, как Thorn по вопросам безопасности детей, Институт стратегического диалога (Institute for Strategic Dialogue) по вопросам целостности выборов, Глобальный проект против ненависти и экстремизма (Global Project Against Hate and Extremism) по вопросам радикализации и др.

Policy Vulnerability Testing Benefits and Challenges

«Красное тестирование» передовых угроз для оценки рисков национальной безопасности

С момента публикации нашей статьи в блоге о нашем подходе к «красному тестированию» систем ИИ на предмет рисков национальной безопасности мы продолжаем развивать методы оценки для измерения «передовых угроз» (областей, которые могут представлять существенную опасность для национальной безопасности), а также расширять круг внешних партнеров, обладающих глубокими знаниями в конкретных предметных областях, для тестирования наших систем. Наша работа по «красному тестированию» передовых направлений в первую очередь сосредоточена на химических, биологических, радиологических и ядерных (ХБРЯ) угрозах, кибербезопасности и рисках автономного ИИ. Мы работаем с экспертами в этих областях как над тестированием наших систем, так и над совместной разработкой новых методов оценки. В зависимости от модели угроз, внешние специалисты могут работать со стандартными развернутыми версиями Claude для исследования рисков в «реальных» условиях или использовать некоммерческие версии с иным набором средств минимизации рисков.

Frontier Threats Benefits and Challenges

Многоязычное и мультикультурное «красное тестирование»

Большая часть нашей работы по «красному тестированию» ведется на английском языке и, как правило, с точки зрения специалистов, базирующихся в Соединенных Штатах. Один из способов лучше понять и по возможности устранить этот недостаток репрезентативности заключается в проведении «красного тестирования» на других языках и в иных культурных контекстах. Усилия государственного сектора по наращиванию потенциала могут стимулировать местное население тестировать ИИ-системы на знание языков и тем, актуальных для конкретного сообщества. В качестве примера можно привести наше успешное партнерство с Управлением по развитию инфокоммуникационных средств массовой информации Сингапура (IMDA) и Фондом AI Verify в рамках проекта по «красному тестированию», охватывающего четыре языка (английский, тамильский, китайский мандаринский и малайский) и темы, важные для сингапурской аудитории и пользовательской базы. Мы с нетерпением ждем публикации от IMDA и Фонда AI Verify более подробной информации об этой работе и общих выводах по результатам тестирования.

Multilingual Benefits and Challenges

Использование языковых моделей для «красного тестирования»

Использование языковых моделей для «красного тестирования» предполагает задействование возможностей систем ИИ для автоматической генерации состязательных примеров и проверки надежности других моделей ИИ. Это потенциально может дополнить ручное тестирование и сделать процедуру «красного тестирования» более эффективной и комплексной.

Автоматизированное «красное тестирование»

По мере того как модели становятся все более способными, мы изучаем возможности их применения для дополнения ручного тестирования с помощью автоматизированного «красного тестирования», выполняемого самими моделями. В частности, мы хотим понять, насколько эффективным может быть такое тестирование для снижения вредоносного поведения. Для этого мы используем динамику взаимодействия красной и синей команд («red team / blue team»): мы применяем одну модель для генерации атак, которые с наибольшей вероятностью вызовут целевое поведение (красная команда), а затем дорабатываем (fine-tune) другую модель на этих результатах, чтобы повысить ее устойчивость к аналогичным типам атак (синяя команда). Мы можем повторять этот процесс многократно для создания новых векторов атак и, в идеале, повышения устойчивости наших систем к целому ряду состязательных атак.

Automated Red Teaming Benefits and Challenges

«Красное тестирование» в новых модальностях

«Красное тестирование» в новых модальностях включает в себя проверку систем ИИ, способных обрабатывать различные формы ввода и отвечать на них (например, изображения или аудио). Это помогает выявить новые риски и типы сбоев, связанные с расширенными возможностями, еще до внедрения систем.

Мультимодальное «красное тестирование»

Семейство моделей Claude 3 является мультимодальным: хотя они не генерируют изображения, они могут воспринимать визуальную информацию (например, фотографии, эскизы, графики) и выдавать в ответ текстовые данные. Эта способность порождает потенциально новые риски (например, мошенническую деятельность, угрозы безопасности детей, насильственный экстремизм и т. д.). Перед развертыванием Claude 3 наша команда по вопросам доверия и безопасности (Trust & Safety) провела «красное тестирование» наших систем на предмет рисков, связанных с изображениями и текстом, а также привлекла внешних специалистов для оценки того, насколько эффективно наши модели отказываются работать с вредоносными входными данными (как визуальными, так и текстовыми). Предэксплуатационное «красное тестирование» критически важно для любого релиза, особенно когда он включает новые возможности и модальности моделей.

Multimodal Red Teaming Benefits and Challenges

Открытое общее «красное тестирование»

Краудсорсинговое «красное тестирование» общих рисков нанесения вреда

Когда в середине 2022 года мы только начинали наши исследования в области «красного тестирования», существовало множество литературы по тестированию программных систем на наличие уязвимостей безопасности, но стандарты для «красного тестирования» языковых моделей практически отсутствовали. Наша работа на тот момент носила исключительно исследовательский характер (мы еще не выпустили нашего ИИ-ассистента Claude), поэтому мы решили сотрудничать с краудсорсинговыми работниками в строго контролируемой среде и просили их руководствоваться собственным здравым смыслом и допустимым уровнем риска при выборе типов атак, а не ставить перед ними задачи по поиску конкретных угроз.

Общинное (community-based) «красное тестирование» общих рисков и системных ограничений

Поскольку «красное тестирование» моделей ИИ стало более распространенным, такие инициативы, как AI Village на конференции DEF CON, привлекли к тестированию публично развернутых систем более широкие слои общества. В 2023 году в рамках конкурса Generative Red Teaming (GRT) Challenge приняли участие тысячи людей самого разного возраста и профессий, включая множество непрофессионалов. Их пригласили протестировать модели, предоставленные Anthropic и другими лабораториями. Нас впечатлили энтузиазм и креативность участников, и мы надеемся, что конкурс GRT и подобные мероприятия вдохновят еще более широкий круг людей на участие в обеспечении безопасности ИИ.

Изучив эти разнообразные методы «красного тестирования», каждый из которых обладает своими сильными сторонами и сложностями, мы переходим к обсуждению того, как они могут способствовать достижению нашей цели по внедрению более стандартизированных практик тестирования в индустрии ИИ.

Community Red Teaming Benefits and Challenges

Как перейти от качественного «красного тестирования» к количественным оценкам?

Помимо выявления потенциальных рисков, описанные выше методы «красного тестирования» могут послужить основой для создания автоматизированных количественных методов оценки. Это мета-задача для всей сферы «красного тестирования»: как превратить результаты тестов в нечто, способное приносить возрастающую пользу организации, чьи системы подвергаются проверке? В идеале «красное тестирование» является частью итеративного цикла, который включает в себя оценку модели ИИ (как вручную, так и с помощью автоматизированных методов) на предмет различных рисков, внедрение соответствующих мер минимизации и проверку эффективности таких защитных барьеров.

В начале процесса эксперты разрабатывают детальное описание потенциальной модели угроз, а затем исследуют модель ИИ, пытаясь спровоцировать эти угрозы специальным образом. По мере того как тестировщики глубже погружаются в проблемную область, они начинают стандартизировать свои методы, изменяя входные данные для более эффективного вызова вредоносного поведения.

Исходя из этого, мы можем использовать языковую модель для генерации сотен или тысяч вариаций таких входных данных, чтобы охватить большую площадь поверхности атак, причем за малую долю времени. Благодаря этому процессу мы переходим от эпизодического качественного тестирования людьми к более тщательному, количественному и автоматизированному подходу. Мы приняли этот итеративный подход для разработки масштабируемых оценок в рамках работы по «красному тестированию» передовых угроз национальной безопасности, а также при тестировании уязвимости политик в отношении рисков для честности выборов, и мы с нетерпением ждем возможности применить его к другим моделям угроз.

Рекомендации по политике

Для поддержки дальнейшего внедрения и стандартизации «красного тестирования» мы призываем директивные органы рассмотреть следующие предложения:

  1. Финансировать такие организации, как Национальный институт стандартов и технологий (NIST), для разработки технических стандартов и передового опыта безопасного и эффективного «красного тестирования» систем ИИ.
  2. Финансировать создание и текущую деятельность независимых государственных органов и некоммерческих организаций, которые могли бы сотрудничать с разработчиками для проведения «красного тестирования» систем на предмет потенциальных рисков в различных областях. Например, в отношении рисков, связанных с национальной безопасностью, большая часть необходимых экспертных знаний будет сосредоточена в государственных ведомствах.
  3. Стимулировать развитие и рост рынка профессиональных услуг по «красному тестированию» ИИ, а также создать процесс сертификации организаций, которые проводят такие проверки в соответствии с общими техническими стандартами.
  4. Побуждать компании, занимающиеся разработкой ИИ, разрешать и облегчать стороннее «красное тестирование» своих систем проверенными (и в перспективе сертифицированными) внешними группами. Разработать стандарты прозрачности и доступа к моделям для обеспечения этого в безопасных и надежных условиях.
  5. Побуждать ИИ-компании увязывать практику «красного тестирования» с четкими правилами относительно условий, которые они должны выполнять для продолжения масштабирования разработки и/или выпуска новых моделей (например, принятие таких обязательств, как Политика ответственного масштабирования).

Заключение

«Красное тестирование» — это ценный метод выявления и минимизации рисков в системах искусственного интеллекта. Различные подходы к нему, рассмотренные в этой статье, подчеркивают разнообразие методик, доступных для различных сценариев использования и моделей угроз. Мы с нетерпением ждем возможности сотрудничать с другими участниками индустрии для совершенствования этих методов и движения к общим стандартам тестирования безопасности. Инвестируя в «красное тестирование», мы можем приблизиться к созданию ИИ-систем, которые будут безопасными и принесут пользу обществу. Это один из нескольких инструментов в рамках более масштабной работы по обеспечению того, чтобы искусственный интеллект развивался продуманно и с надежными средствами защиты.

Полный текст статьи читайте на Anthropic