Результаты работы нашей команды передового тестирования (Frontier Red Team)

Progress from our Frontier Red Team

В этой публикации мы делимся нашими выводами о траектории потенциальных рисков для национальной безопасности со стороны передовых ИИ-моделей, а также размышлениями о проблемах и передовых методах оценки этих рисков. Информация в этом посте основана на работе, которую мы проводили в течение последнего года для четырех выпусков моделей. Наша оценка заключается в том, что ИИ-модели демонстрируют «ранние предупреждающие» признаки быстрого прогресса в ключевых возможностях двойного назначения: модели приближаются, а в некоторых случаях и превосходят навыки уровня бакалавриата в области кибербезопасности и знания экспертного уровня в некоторых областях биологии. Тем не менее, современные модели не дотягивают до тех пороговых значений, при которых мы считаем, что они создают существенно повышенные риски для национальной безопасности.

ИИ стремительно совершенствуется в различных сферах

Хотя возможности ИИ быстро развиваются во многих областях, важно отметить, что реальные риски зависят от множества факторов, выходящих за рамки самого ИИ. Физические ограничения, специализированное оборудование, человеческий опыт и практические трудности внедрения остаются значительными барьерами, даже несмотря на то, что ИИ совершенствуется в задачах, требующих интеллекта и знаний. Учитывая этот контекст, вот что мы узнали о развитии возможностей ИИ в ключевых областях.

Кибербезопасность

В сфере кибернетики 2024 год стал моментом «от нуля до единицы». В соревнованиях CTF (Capture The Flag — состязания по кибербезопасности, которые заключаются в поиске и использовании уязвимостей программного обеспечения в контролируемой среде) модель Claude всего за один год улучшила свои показатели с уровня старшеклассника до уровня студента бакалавриата.

Figure 1: In less than a year, Claude went from solving less than a quarter to nearly all Intercode CTF challenges, publicly available CTFs that were designed for high school competitions.Рисунок 1: Меньше чем за год Claude прошла путь от решения менее чем четверти до практически всех задач Intercode CTF — общедоступных соревнований CTF, разработанных для школьных турниров.

Мы уверены, что это отражает реальное улучшение возможностей, поскольку мы самостоятельно разработали дополнительные задания, чтобы гарантировать их отсутствие в обучающих данных модели.

Это улучшение кибернетических возможностей продолжилось и в нашей новейшей модели Claude 3.7 Sonnet. На Cybench — публичном бенчмарке, использующем задачи CTF для оценки больших языковых моделей (LLM), — Claude 3.7 Sonnet решает примерно треть задач в течение пяти попыток, по сравнению примерно с пятью процентами у нашей передовой модели в это же время в прошлом году (см. Рисунок 2).

Figure 2: Claude 3.7 Sonnet shows clear improvement on the Cybench CTF benchmark compared to the previous two generations of models, even without using extended thinking.Рисунок 2: Claude 3.7 Sonnet демонстрирует явное улучшение в бенчмарке Cybench CTF по сравнению с предыдущими двумя поколениями моделей, даже без использования расширенного мышления.

Эти улучшения происходят в различных категориях задач по кибербезопасности. На Рисунок 3 показано улучшение показателей разных поколений моделей на различных типах задач CTF, которые требуют обнаружения и использования уязвимостей в небезопасном программном обеспечении на удаленном сервере («pwn»), веб-приложениях («web»), а также криптографических примитивах и протоколах («crypto»). Тем не менее, навыки Claude все еще отстают от экспертов-людей. Например, модель по-прежнему испытывает трудности с обратной разработкой (реверс-инжинирингом) бинарных исполняемых файлов для поиска скрытых уязвимостей, а также с проведением разведки и эксплуатации уязвимостей в сетевой среде — по крайней мере, без посторонней помощи.

Figure 3: Claude is improving in CTFs across multiple categories of challenges (Claude 3.7 Sonnet’s performance is reported without extended thinking).Рисунок 3: Claude совершенствуется в решении CTF-задач в нескольких категориях (производительность Claude 3.7 Sonnet указана без использования расширенного мышления).

Работая со сторонними экспертами из Университета Карнеги-Меллона, мы провели эксперименты на реалистичных крупных киберполигонах (около 50 хостов), которые проверяют способность модели обнаруживать и использовать уязвимости в небезопасном ПО, а также заражать сеть и распространяться внутри нее в латеральном направлении. По сравнению с традиционными упражнениями CTF, эти задачи имитируют сложность реальной кибероперации, требуя от модели способности проводить разведку и координировать многоэтапную кибератаку. На данный момент модели не способны автономно преуспеть в такой сетевой среде. Но будучи оснащенными набором программных инструментов, созданных исследователями в области кибербезопасности, Claude (и другие LLM) смогли с помощью простых инструкций успешно воспроизвести атаку, аналогичную известной масштабной краже персональных данных из бюро кредитных историй.

Figure 4: One of our researchers worked with academic partners to develop Incalmo, a set of tools that enable present-day LLMs to be successful cyber attackers in realistic network settings. Figure courtesy of Singer et al. (2025).Рисунок 4: Один из наших исследователей совместно с академическими партнерами разработал Incalmo — набор инструментов, позволяющих современным LLM успешно действовать в качестве киберпреступников в реалистичных сетевых условиях. Иллюстрация предоставлена Singer et al. (2025).

Эта инфраструктура оценки позволяет нам своевременно предупреждать об улучшении автономных возможностей модели, а также потенциально способствует повышению полезности ИИ для киберобороны — путь, по которому идут и другие лаборатории, добиваясь многообещающих результатов.

Биобезопасность

В нашей предыдущей публикации мы подробно останавливались на оценке биобезопасности, и мы продолжили эту работу. Мы наблюдаем быстрый прогресс в понимании биологии нашими моделями. Меньше чем за год Claude прошла путь от показателей ниже уровня экспертов мирового класса по вирусологии в тесте, разработанном для проверки типичных сценариев устранения неполадок в лабораторных условиях, до уверенного превосходства этого базового уровня (см. Рисунок 5).

Figure 5: Claude’s performance has improved on VCT, an evaluation of model capabilities in troubleshooting virology tasks designed by SecureBio. Claude 3.7 Sonnet used its extended thinking capability.Рисунок 5: Производительность Claude улучшилась в тесте VCT (оценка возможностей модели в устранении неполадок при решении вирусологических задач), разработанном организацией SecureBio. Claude 3.7 Sonnet использовала функцию расширенного мышления.

Тем не менее, возможности Claude в области биологии остаются неравномерными. Например, внутреннее тестирование вопросов, оценивающих навыки модели в исследованиях «мокрой лаборатории» (wet-lab), показывает, что наши модели приближаются к базовым уровням экспертов-людей в понимании биологических протоколов и манипуляциях с последовательностями ДНК и белков. Наша новейшая модель превосходит базовые показатели экспертов-людей в рабочих процессах клонирования. При этом модели по-прежнему уступают экспертам-людям в интерпретации научных графиков и иллюстраций.

Figure 6: Claude 3.7 Sonnet improved on LabBench tasks compared to Claude 3.5 (New), approaching and in some cases exceeding the human baseline. Claude 3.7 Sonnet used its extended thinking capability.Рисунок 6: Claude 3.7 Sonnet улучшила свои показатели в задачах LabBench по сравнению с Claude 3.5 (New), приблизившись к человеческому базовому уровню, а в некоторых случаях и превзойдя его. Claude 3.7 Sonnet использовала функцию расширенного мышления.

Чтобы оценить, как эти улучшающиеся, но неоднородные биологические знания соотносятся с рисками в сфере биобезопасности, мы провели небольшие контролируемые исследования задач, связанных с созданием оружия, и поработали с экспертами мирового уровня по биозащите. В ходе одного из экспериментальных исследований мы выяснили, что наша самая последняя модель предоставила новичкам определенный прирост эффективности по сравнению с другими участниками, у которых не было доступа к модели. Тем не менее, даже самый высоко оцененный план участника, имевшего доступ к модели, все равно содержал критические ошибки, которые привели бы к провалу в реальном мире.

Аналогичным образом, выводы независимых экспертов по red-teaming оказались неоднозначными. Некоторые эксперты отметили улучшение знаний модели в определенных аспектах создания оружия, в то время как другие указали, что количество критических ошибок в планировании модели было слишком велико для успешного завершения атаки от начала до конца. В целом, этот анализ предполагает, что наши модели не могут надежно провести начинающего злоумышленника через ключевые практические этапы приобретения биооружия. Учитывая быстрый прогресс, тем не менее, мы продолжаем инвестировать значительные средства в мониторинг рисков биобезопасности и разработку мер противодействия — таких как наша недавняя работа над конституционными классификаторами, — чтобы быть готовыми, если и когда модели достигнут более тревожных уровней производительности.

Figure 7: In small experiments with Anthropic employees and external participants from Sepal AI, groups with either of the two most recent Claude models seemed to outperform those with only the internet on text-based evaluations of a bioweapon acquisition and planning scenario. (Participants from Sepal had access to two preview versions of Claude 3.7 Sonnet, one of which, ‘H-only V2’ was designed to be helpful-only and less likely to refuse harmful requests. The Anthropic employees used either another preview version of Claude 3.7 Sonnet or the latest production version of Claude 3.5 Sonnet.)Рисунок 7: В небольших экспериментах с сотрудниками Anthropic и внешними участниками из Sepal AI группы, использовавшие любую из двух новейших моделей Claude, продемонстрировали лучшие результаты по сравнению с теми, кто пользовался только интернетом при оценке текстовых сценариев приобретения и планирования биооружия. (Участники из Sepal имели доступ к двум предварительным версиям Claude 3.7 Sonnet, одна из которых, «H-only V2», была разработана исключительно с целью помощи и с меньшей вероятностью отказа от вредоносных запросов. Сотрудники Anthropic использовали либо другую предварительную версию Claude 3.7 Sonnet, либо последнюю продакшн-версию Claude 3.5 Sonnet).

Преимущества партнерства для стратегического предупреждения: быстрое и ответственное развитие ИИ

Важным преимуществом этой работы является то, что она помогает нам двигаться быстрее, а не медленнее. Заблаговременно разрабатывая планы оценки и принимая обязательства по соблюдению пороговых значений возможностей, которые требуют повышения уровня безопасности, команда Frontier Red Team компании Anthropic расширяет наши возможности по ускоренному продвижению рубежей ИИ с уверенностью в том, что мы делаем это ответственно.

Эта работа — особенно в партнерстве с правительством — приводит к конкретным улучшениям в сфере безопасности и предоставляет полезную информацию для государственных чиновников. В рамках добровольных и взаимовыгодных соглашений наши модели прошли предпродажное тестирование как в Институте безопасности ИИ США, так и в Институте безопасности ИИ (AISI) Великобритании. Последнее тестирование, проведенное институтами AISI, помогло нам лучше понять возможности Claude 3.7 Sonnet, имеющие отношение к национальной безопасности, и мы использовали этот анализ для определения уровня безопасности ИИ (ASL) для данной модели.

Компания Anthropic также инициировала первое в своем роде партнерство с Национальным управлением по ядерной безопасности (NNSA), входящим в состав Министерства энергетики США (DOE), специалисты которого проводят оценку Claude в закрытой среде на предмет знаний, связанных с ядерными и радиологическими рисками. Этот проект включал непосредственное тестирование на проникновение (red-teaming) со стороны правительства из-за особой конфиденциальности информации, связанной с ядерным оружием. В рамках этого партнерства компания Anthropic поделилась опытом выявления рисков и методологий их снижения, примененными в других областях химического, биологического, радиологического и ядерного оружия (CBRN), которые NNSA адаптировала для ядерной сферы. Успех этого соглашения между государственными и частными структурами в жестко регулируемой ядерной отрасли доказывает, что аналогичное сотрудничество возможно и в других чувствительных сферах.

Взгляд в будущее

Наша работа по борьбе с передовыми угрозами подчеркнула важность внутренних механизмов защиты, таких как наша политика ответственного масштабирования (Responsible Scaling Policy), независимых экспертных организаций, включая Институты безопасности ИИ, и надлежащим образом сфокусированного внешнего надзора. В дальнейшем наша цель заключается в переходе к более частым тестированиям с использованием автоматизированной оценки, извлечения данных, анализа и отчетности. Это правда, что возможности ИИ стремительно развиваются, но точно так же растут и наши возможности по проведению таких оценок и более раннему и надежному обнаружению потенциальных рисков.

Мы действуем безотлагательно. По мере того как модели совершенствуют способность использовать расширенное мышление, некоторые абстракции и сценарии планирования, реализуемые с помощью такого киберинструментария, как Incalmo, могут устареть, и модели станут лучше справляться с задачами кибербезопасности «из коробки». Отчасти опираясь на описанные здесь исследования в области биологии, мы считаем, что наши модели приближаются к пересечению порога возможностей, который требует принятия мер безопасности уровня ASL-3, что стимулирует дополнительные инвестиции для своевременной готовности этих защитных мер. Мы убеждены, что более глубокое сотрудничество между передовыми ИИ-лабораториями и государствами имеет решающее значение для совершенствования наших оценок и снижения рисков во всех этих приоритетных областях.

Если вы хотите внести свой непосредственный вклад в нашу работу, мы нанимаем сотрудников.


Полный текст статьи читайте на Anthropic