Оценка передовых угроз (red teaming) для обеспечения безопасности ИИ


«Красное командование» (red teaming), или состязательное тестирование — это общепризнанный метод оценки и повышения защищенности систем. Хотя в предыдущем исследовании Anthropic сообщалось о методах и результатах такого тестирования с привлечением краудворкеров, исследователи ИИ уже некоторое время отмечают, что со временем ИИ-модели могут приобрести возможности в сферах, затрагивающих национальную безопасность. Например, исследователи призывали измерять и контролировать эти риски, а также писали работы, подтверждающие их наличие. Генеральный директор Anthropic Дарио Амодей также затронул эту тему в ходе недавнего выступления в Сенате. Учитывая это, мы с радостью поддержали и присоединились к обязательствам, объявленным в Белом доме 21 июля, которые включают «внутреннее и внешнее тестирование безопасности [наших] ИИ-систем» для защиты от «некоторых из наиболее серьезных источников рисков ИИ, таких как биобезопасность и кибербезопасность». Однако тестирование на проникновение в этих специализированных областях требует значительных затрат времени и экспертных знаний.

В этой статье мы рассказываем о нашем подходе к «оценке передовых угроз», делимся ключевыми результатами тестового проекта по оценке биологических рисков, извлеченными уроками и нашими планами на будущее в этой области.

Наша цель в этой работе — оценить базовый уровень риска и создать воспроизводимый способ проведения оценки передовых угроз в различных предметных областях. Что касается биологии, то хотя детали наших выводов являются конфиденциальными, мы считаем важным поделиться основными выводами из этой работы. Подводя итог, можно сказать, что в сотрудничестве с экспертами мы выяснили, что в случае отсутствия мер по снижению рисков модели могут вскоре представлять угрозу для национальной безопасности. Тем не менее, мы также обнаружили, что существуют методы защиты, способные существенно снизить эти риски.

Сейчас мы масштабируем эту работу, чтобы надежно выявлять риски и создавать механизмы защиты. Мы верим, что совершенствование тестирования на передовые угрозы принесет немедленную пользу и внесет вклад в долгосрочную безопасность ИИ. Мы делимся своими выводами с правительством, лабораториями и другими заинтересованными сторонами, и мы хотели бы видеть больше независимых групп, занимающихся этой деятельностью.

Проведение тестирования на передовые угрозы

Тестирование на передовые угрозы требует значительных усилий для выявления скрытых возможностей моделей. Важнейшей отправной точкой для нас стало сотрудничество с профильными экспертами, имеющими многолетний опыт. Совместно мы начали с определения моделей угроз: какая именно информация представляет опасность, как эта информация комбинируется для нанесения вреда, а также какой уровень точности и частоты требуется для того, чтобы это стало опасным. Например, для причинения вреда зачастую необходимо связать воедино множество фрагментов точной информации, а не просто сгенерировать один выглядящий опасным ответ.

Следуя четко определенному плану исследований, профильные эксперты и специалисты по большим языковым моделям (LLM) должны коллективно потратить значительное время (т. е. 100+ часов) на тесное взаимодействие с моделями, чтобы выявить и понять их истинные возможности в целевой области. Например, экспертам может потребоваться выяснить лучший способ взаимодействия с моделями или их «джейлбрейка» (обхода ограничений).

Важной задачей является создание новых автоматизированных оценок на основе экспертных знаний, а также инструментов для их запуска, чтобы сделать процесс воспроизводимым и масштабируемым. Однако сложность заключается в том, что эта информация, скорее всего, является конфиденциальной. Поэтому данный вид тестирования требует партнерства с надежными третьими сторонами и надежных мер защиты информации.

Результаты оценки биологических рисков

За последние шесть месяцев мы потратили более 150 часов совместно с ведущими экспертами по биобезопасности на тестирование и оценку способности нашей модели выдавать вредоносную биологическую информацию, такую как разработка и приобретение биологического оружия. Эти эксперты учились общаться с нашей моделью, взламывать ее защиту и оценивать ее поведение. Мы разработали количественные методы оценки возможностей модели. Эксперты использовали специальный защищенный интерфейс для работы с нашей моделью, в котором были отключены инструменты мониторинга и обеспечения безопасности, активные в наших публичных версиях.

Мы обнаружили несколько ключевых поводов для беспокойства. Во-первых, современные передовые модели иногда способны выдавать сложные, точные, полезные и детальные знания на экспертном уровне. В большинстве изученных нами областей это происходит нечасто. В других же — происходит. Тем не менее, мы обнаружили признаки того, что по мере увеличения размеров модели ее возможности возрастают. Мы также считаем, что предоставление моделям доступа к внешним инструментам может расширить их возможности в области биологии. В совокупности мы полагаем, что незащищенные LLM могут ускорить попытки злоумышленников использовать биологию в злонамеренных целях по сравнению с простым доступом в интернет, а также позволить им выполнять задачи, которые они не смогли бы решить без LLM. На сегодняшний день эти два эффекта, вероятно, невелики, но они относительно быстро растут. Если не принимать меры предосторожности, мы опасаемся, что подобные риски носят краткосрочный характер, то есть могут реализоваться в ближайшие два-три года, а не через пять и более лет.

Тем не менее, процесс исследования этих рисков также позволяет находить и внедрять средства защиты от них. Мы обнаружили, например, что простые изменения в процессе обучения значительно сокращают количество вредоносных ответов, позволяя модели лучше различать опасное и безопасное использование биологии (см., например, нашу работу по Конституциональному ИИ). Мы также выяснили, что фильтры на основе классификаторов могут усложнить для злоумышленника задачу получения множества связанных между собой фрагментов информации экспертного уровня, необходимых для нанесения вреда. В настоящее время эти меры внедрены в нашу общедоступную передовую модель, и мы составили список защитных мер на каждом этапе разработки и развертывания модели, с которым продолжим экспериментировать.

Будущие исследования

Завершив этот проект, мы получили еще больше идей для экспериментов и оценок, чем планировали изначально. Например, мы считаем, что крайне важно регулярно проводить эксперименты по измерению того, насколько ускорение в создании вредоносных материалов могут обеспечить LLM по сравнению, например, с поисковой системой. И делать это следует не только с сегодняшними передовыми моделями, но и с будущими — моделями следующего поколения, моделями, использующими инструменты, и мультимодальными моделями.

Учитывая наш вывод о том, что современные передовые модели служат предупреждением о рисках в ближайшем будущем, разработчики таких моделей должны совместно и безотлагательно проводить более глубокий анализ, разрабатывать новые, более мощные средства защиты, а также делиться этой информацией с ответственными участниками индустрии, чтобы те могли добавить системы безопасности в свои модели, и с избранными государственными ведомствами.

Нам также следует подготовиться к возможному появлению моделей, которые не проходили тестирование на передовые угрозы. Мы полагаем, что при отсутствии новых подходов к снижению рисков злоумышленники смогут извлекать опасные биологические возможности с помощью более мелких, дообученных или специализированных моделей, созданных на базе весов открытых моделей, если будут выпущены достаточно мощные базовые модели.

Мы масштабируем и поддерживаем эту работу

Эта эмпирическая работа подтверждает, что тестирование на передовые угрозы в сфере национальной безопасности является важной и своевременной задачей. Существующие модели демонстрируют лишь самые первые признаки подобных рисков, что делает текущий момент идеальным окном возможностей для оценки зарождающихся угроз и их нейтрализации до того, как они станут острыми. Крайне важно наращивать усилия до появления нового поколения моделей, использующих новые инструменты. К счастью, в сообществах специалистов по национальной безопасности уже имеется богатый опыт, на который можно опираться при создании моделей угроз, систем оценки и защитных механизмов.

Это также сфера, с которой государства хорошо знакомы. Это означает, что национальная безопасность — это та область, в которой правительства, лаборатории и другие заинтересованные стороны могут успешно сотрудничать. Для начала мы создаем процесс раскрытия информации, с помощью которого лаборатории и другие участники смогут сообщать об этих рисках и мерах по их минимизации другим соответствующим субъектам. В конечном итоге мы считаем очень важным создание новых независимых организаций для проведения проверок в сфере национальной безопасности между этими заинтересованными сторонами. Эти третьи стороны будут беспристрастными и должны будут обладать надлежащими средствами защиты для работы с конфиденциальной информацией.

Исследовательская повестка в области оценки передовых угроз, вероятнее всего, окажется полезной и для других типов рисков, которые могут проявиться в более отдаленной перспективе, таких как обман со стороны ИИ. Чтобы выявить и снизить эти риски, разработчики должны определить будущие возможности, которых у моделей быть не должно, измерить их и создать механизмы защиты или методы согласования (alignment). В результате мы получим ценные знания об alignment, мерах безопасности и «предупредительных выстрелах».

Anthropic формирует исследовательскую команду по оценке передовых угроз. Эта команда будет экспериментировать с будущими возможностями, чтобы понять грядущие риски и создать масштабируемые методы оценки и защиты. Вы можете узнать больше об этой работе и подать заявку на участие в команде здесь. Мы ищем целеустремленных технических исследователей, способных быстро создавать прототипы на базе нашей инфраструктуры.

Мы также проводим брифинги для представителей правительства и лабораторий, рассказывая о деталях наших открытий. Мы открыты для обмена нашими текущими и будущими результатами с соответствующей аудиторией и пилотируем процесс ответственного раскрытия информации между участниками сообщества для сообщения о рисках и мерах противодействия. Мы особенно заинтересованы в поддержке других групп — в особенности лабораторий или новых независимых оценочных организаций — в расширении этой работы. Если вы являетесь одной из таких заинтересованных сторон и хотите принять участие, пожалуйста, свяжитесь с нами.

Полный текст статьи читайте на Anthropic