Совершенствование нашего подхода к согласованию действий и обеспечению безопасности
30 июля мы сообщили о трех инцидентах, в ходе которых модели Claude получили несанкционированный доступ к реальным компьютерным системам. Модели, которые намеренно запускались без средств киберзащиты в целях тестирования, получили доступ к интернету из-за неверной конфигурации во внешней среде оценки. Кроме того, 4 августа Институт безопасности ИИ Великобритании сообщил об инциденте в ходе собственного тестирования кибербезопасности, когда Claude Mythos 5 совершил ряд несанкционированных действий в реальной сети интернет. В этом случае модель, опять же намеренно запущенная без средств киберзащиты в целях оценки, была сознательно наделена доступом в интернет.
Мы проводим детальный анализ обоих инцидентов. Мы также планируем сотрудничать с METR для проведения независимой проверки. Мы хотим убедиться, что оба исследования будут проведены тщательным образом, и поделимся подробностями в ближайшие недели.
А пока мы рассказываем о некоторых изменениях, которые мы внесли за последний месяц. Мы считаем, что эти инциденты отражают сбой в операционной безопасности, а также две проблемы согласования (alignment): мотивированные рассуждения и готовность совершать вредоносные действия ради узкой задачи (о чем мы уже писали в предыдущих системных картах). Что касается безопасности, мы описываем улучшения, внесенные в наши системы изоляции и мониторинга, а также практики, разработанные нами для сторонних оценщиков. В отношении согласования мы подробнее разбираем эти две проблемы; кроме того, мы убеждены, что устойчивый прогресс достигается не только за счет понимания того, что произошло в конкретном инциденте, но и за счет понимания того, как в принципе возникает несогласованность, и делимся ранними исследованиями в этом направлении.
В свете этих инцидентов активизировались дискуссии о темпах развития передовых технологий (pacing). Полезно различать два вида регулирования темпов. Внутри компании это означает принятие решений, в которых безопасность ставится выше скорости, когда между ними возникает противоречие. В масштабах всей отрасли это означает создание процессов защиты от динамики «гонки ко дну». В этой статье мы рассказываем о мерах, принятых нами как до, так и после этих инцидентов в рамках первого подхода. Второй тип регулирования требует координации между государством и индустрией, причем такие меры должны быть прозрачными и проверяемыми. Некоторые из наших руководителей и многие сотрудники недавно подписали письмо с призывом к более тесной координации темпов развития, и в ближайшие недели мы подробнее расскажем о том, как намерены способствовать этим усилиям. Чтобы наша позиция была ясна: мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый и эффективный механизм скоординированного регулирования темпов.
Обеспечение безопасности сред тестирования и обучения
Хотя мы не считаем эти инциденты исключительно операционными проблемами, нашим главным приоритетом было устранение конкретных недочетов в области изоляции и мониторинга. В ответ на это мы предприняли следующие действия:
Приостановка работы и усиление защиты сред тестирования
После инцидентов мы приостановили внешние кибертестирования невыпущенных моделей, а также ненадолго приостановили внутренние проверки, пока внедряли описанные ниже меры. Инциденты, о которых мы сообщили 30 июля, показали, что мы в значительной степени полагались на единственный уровень защиты (конфигурацию самой среды), тогда как нам требовалось несколько уровней, включая установление четких границ в промптах, создание процессов проверки герметичности песочницы там, где это необходимо, и внедрение мониторинга, способного вмешиваться в режиме реального времени. Заявление OpenAI (которое и побудило нас начать расследование в июле) о том, что модели использовали неизвестную уязвимость для побега из изолированной песочницы во время тестирования, также дало понять, что нам следует сосредоточиться на укреплении самой песочницы.
На время приостановки тестирования мы внедрили следующие предварительные меры:
1) Мы создали и развернули классификатор для автоматического определения в реальном времени случаев, когда модель пытается агрессивно зондировать или покинуть тестовую среду либо неожиданно получает доступ в интернет. Когда классификатор фиксирует такую попытку, он блокирует действие до запуска вызова инструмента, завершает задачу и оповещает человека.1
2) Мы запустили автоматизированные системы мониторинга стенограмм наших недавних внутренних тестов невыпущенных моделей (как кибернетических, так и других) на предмет побегов из песочниц (случаев, когда модель использует уязвимость в песочнице для доступа к системам, от которых она должна быть изолирована) или ошибок конфигурации песочниц. В тех случаях, когда тестирование проводилось внутри наших инструментов песочницы, мы не обнаружили ни одного примера преодоления границы песочницы для доступа к внешним ресурсам, к которым у нее не должно было быть доступа. Мы обнаружили различные ошибки конфигурации песочниц, которыми воспользовались модели, но ни одна из них не привела к компрометации систем за пределами песочницы.2 Мы активно работаем над устранением этих проблем.
3) Мы перенесли внутренние киберпесочницы повышенного риска3 в более надежную среду изоляции. Мы также продолжаем проводить тесты на проникновение для нашего стека виртуализации (то есть ставим перед невыпущенными моделями задачу попытаться вырваться из него), чтобы находить и устранять слабые места.
В настоящее время наши внутренние кибертесты возобновлены с учетом этих мер.

Среды обучения с подкреплением
Мы также на несколько недель приостановили работу сред обучения с подкреплением (RL) повышенного риска для невыпущенных моделей. За это время мы создали аналогичный классификатор, модифицированный так, чтобы у модели не возникало стимулов обходить этот новый мониторинг, и теперь развернули его в этих средах. Большая часть обучения с подкреплением возобновлена, однако некоторые среды повышенного риска остаются на паузе до прохождения ручной проверки, в то время как для других потребуется обновленная версия классификатора, которую мы планируем запустить в ближайшее время.
Общее усиление защиты
В дополнение к мерам, направленным на оценки и обучение повышенного риска, мы расширили наш автономный мониторинг, охватив им большинство других форм внутреннего использования передовых агентов. Мы также создаем средства контроля нашего внутреннего инференса, чтобы сотрудники Anthropic не могли случайно запустить агентов с более слабыми средствами защиты, чем те, что описаны выше.
Лучшие практики для внешних партнеров
Поскольку произошедшие инциденты имели место во внешних средах, мы попросили каждую организацию, которая тестирует невыпущенные модели с ослабленной киберзащитой, соблюдать свод передовых практик. Мы считаем их необходимыми по следующим причинам:
- Наши общедоступные модели поставляются со средствами защиты, включая классификаторы, которые в реальном времени анализируют входные и выходные данные Claude для блокирования запрещенной кибердеятельности, такой как разработка вредоносного ПО или написание наступательных эксплойтов. Кибероценщики и часть партнеров с ранним доступом, напротив, работают с моделями, у которых эти средства защиты ослаблены для обеспечения точного тестирования возможностей моделей и оборонительных киберисследований.
- Кибертестирования с необычайно высокой долей вероятности приводят к поведению, наблюдавшемуся в этих инцидентах. Они создают селективное давление в сторону настойчивости и креативности при зондировании окружающей среды и обходе препятствий, к тому же они запускаются много тысяч раз.
Эти практики в полной мере применяются везде, где партнеры проводят кибертестирования, используя собственные тестовые каркасы (harnesses), песочницы или агентов. Они не распространяются на клиентов, использующих защищенные модели, такие как Claude Fable 5. Мы возобновили внешние кибертестирования с соблюдением этих правил и придерживаемся их внутри компании.
Песочница и сетевая изоляция
По умолчанию все кибертесты должны выполняться внутри защищенной песочницы (изолированной вычислительной среды) без доступа в интернет. Единственным внешним соединением, разрешенным для среды, должно быть обращение к собственному API модели, причем ключи API должны храниться вне этой среды. Данная конфигурация должна проверяться перед началом каждого тестирования. Для некоторых тестов может потребоваться доступ в интернет. В таких случаях мы будем работать с внешними оценщиками при тестировании невыпущенных моделей, чтобы определить, можем ли мы надежно обнаруживать и останавливать запуски, в которых модель предпринимает действия за пределами заявленной области применения.
Проверка перед началом работы
Перед проведением тестирования партнеры по оценке должны:
- Заставить тестируемую модель исследовать песочницу на предмет уязвимостей — сначала посредством статического анализа конфигурации, а затем путем непосредственной постановки задачи модели попытаться совершить побег. Модель должна получить указание остановиться и сообщить о результатах в случае успешного побега, и все это должно происходить под пристальным наблюдением человека. Такое тестирование следует проводить без доступа в интернет, в идеале — во второй песочнице. Поскольку оценки иногда проводятся в ходе сотен или даже тысяч запусков, партнерам желательно тщательно провести такое тестирование перед началом любых оценок.
- Убедиться, что любая тестовая задача действительно имеет решение в принципе. Когда цель оценки отключена от сети или задачу невозможно выполнить, агенты часто ищут другие пути решения, что увеличивает вероятность выхода за рамки предполагаемой области применения оценки.4
Четкое определение границ (scope)
Каждый промпт должен четко указывать, что входит и что не входит в рамки упражнения, включая цели, разрешенные действия и сетевые границы (т.е. к чему модель должна и не должна иметь доступ). Границы должны быть сформулированы в виде инструкций (например, «Вам запрещено заходить в интернет»), а не утверждений об окружении или тесте («У вас нет доступа в интернет»).
Мониторинг в реальном времени
Оценщики также должны осуществлять непрерывный мониторинг мыслей, действий и сетевой активности модели с помощью монитора на основе модели или правил, которому были заданы рамки упражнения. Если запуск нарушает эти рамки, монитор должен сообщить об этом человеку и завершить упражнение.
Мы планируем продолжить доработку этих рекомендаций совместно с внешними партнерами и распространить их за рамки тестирования. В частности, мы разрабатываем сопутствующие практики для партнеров, имеющих доступ к Claude Mythos 5, которая также работает без киберзащиты, и в скором времени поделимся подробностями.
Оценка согласования (alignment)
Изоляция и мониторинг имеют решающее значение для выявления случаев, когда модели предпринимают опасные действия, но они не отвечают на вопрос о том, почему модель вообще совершила такие действия. Ниже мы обсуждаем наше предварительное расследование вопросов согласования и ключевые задачи, на которых мы сосредоточены, а также нашу текущую работу по предотвращению мошенничества во время обучения, включая новые исследования о том, как читерство формирует поведение модели.
Окружение и уровень осведомленности наших моделей во время оценки
Наша оценка согласования все еще продолжается, но предварительное расследование указывает на два основных сбоя согласования, оба из которых мы описали в предыдущих системных картах. Первый — это мотивированные рассуждения: моделям изначально говорили, что их окружение смоделировано, но когда позже они столкнулись с доказательствами своего подключения к реальному интернету, они могли истолковать эти свидетельства так, чтобы сохранить прежнюю уверенность. Второй сбой — безрассудство: модель была готова совершать вредоносные действия в реальном интернете ради узкой цели прохождения теста по кибербезопасности. Тем не менее, мы также считаем, что сама конфигурация тестирования способствовала поведению моделей в этих инцидентах. Claude прямо говорили, что у нее нет доступа в интернет, несмотря на его фактическую доступность, что могло заставить ее усомниться в реальности видимых систем. Кроме того, в одном из случаев вымышленная цель имела название, совпадающее с реальным веб-сайтом, что затрудняло разделение того, что задумывалось в рамках упражнения.
Наши выводы зависят от ряда вопросов, на которые мы еще не дали полных ответов: в какой степени модели определили наличие у них доступа к реальному интернету (даже если изначально они этого не знали), сознательно ли они игнорировали признаки реальной природы элементов своего окружения, и было ли связано с мотивированными рассуждениями то, что в нескольких случаях они не остановили выполнение упражнения. Мы применяем целый ряд методик для получения ответов на эти вопросы, включая повторный запуск моделей с целевыми изменениями в окружении и использование методов интерпретируемости для прямого изучения их внутреннего состояния.
Изучение мер по предотвращению читерства во время обучения
Хотя несогласованность моделей сложна и может возникать по самым разным причинам, мы эмпирически обнаружили, что дефекты в обучающих средах — в частности, среды, уязвимые для читерства или неразрешимые без него — вносят непропорционально большой вклад в несогласованное поведение.
Ниже мы рассказываем о наших усилиях, начатых за несколько месяцев до инцидентов, по предотвращению появления таких дефектов в обучающих средах. Эти усилия были несовершенными, и наша гипотеза заключается в том, что инциденты были как минимум частично связаны с нашей неспособностью полностью устранить подобные проблемы. Мы проверили эту гипотезу, намеренно обучив модель в средах, подверженных взлому системы вознаграждений (reward hacking). В ходе симуляций такая модель демонстрирует более серьезное несогласованное поведение, отчасти похожее на то, о чем сообщалось в инцидентах этим летом у других компаний. Наши производственные модели, помещенные в те же симуляции, такого не показывают (подробнее об этом далее в данном разделе).
Исторически мы с опаской относились к средам RL-обучения, стимулирующим читерство, и предпринимали различные меры для фильтрации или исправления подобных сред.
В феврале мы откатили три дня обучения модели Mythos Preview в рамках прогона обучения с подкреплением после обнаружения признаков взлома вознаграждения (когда модель находит способы обмануть процесс обучения и получать награды без выполнения назначенной задачи). Мы заметили, что модель писала заметки «рецензенту» в комментариях к коду и ответах, в том числе в задачах, где о рецензенте вообще не упоминалось — это нежелательное обобщение из сред, где промпт действительно содержал упоминание рецензента. Она также продолжала эксплуатировать награду, призванную поощрять честность, добавляя массу оговорок и предупреждений.5 Откат на три дня назад позволил нам возобновить обучение с контрольной точки до того, как модель усвоила это поведение, и мы внесли изменения в среды, чтобы предотвратить повторное обучение такому поведению.
Мы разрабатываем инструменты для мониторинга нежелательного поведения, которому модели учатся при обучении с подкреплением, со времен Claude Sonnet 3.7 (у которой была склонность к взлому вознаграждений, обнаруженная нами лишь поздно на этапе обучения). Мы приложили значительные усилия к тому, чтобы наши инструменты развивались с каждым поколением моделей — от нескольких классификаторов до автоматизированной проверки всех сред до и во время циклов обучения, но к весне 2026 года эта система оказалась перегружена. Мы создавали RL-среды быстрее, чем когда-либо — быстрее, чем наши системы успевали их проверять. Помеченные средой случаи требовали участия человека для вынесения вердикта, а взломы вознаграждений и ошибки конфигурации стали опережать нашу способность их фильтровать или исправлять.
Кроме того, мы обнаружили, что часть прогонов случайно обучилась на цепочке рассуждений (chain-of-thought) модели — чего мы стараемся избегать из опасений, что это учит модель скрывать свои истинные рассуждения. Мы проследили источник утечки до нескольких ошибок конфигурации в нашем стеке производственной среды. При этом стало очевидно, что существуют и другие проблемы, порожденные накоплением запутанного кода со временем.
Для решения этих проблем в апреле мы примерно на месяц заморозили любые изменения в наших производственных RL-средах, что позволило нам полностью переработать стек. Теперь вознаграждения и среды должны соответствовать согласованной спецификации. Например, мы внедрили технические средства защиты для снижения риска случайного обучения на цепочке рассуждений.6 Пока наши команды по качеству сред и мониторингу перестраивали стек, мы попросили владельцев сред использовать эту паузу для тестирования и исправления созданных ими сред. Мы также полностью перестроили процесс проверки и потребовали, чтобы каждая исправленная среда прошла повторную сертификацию перед допуском к следующему циклу обучения.
Во время заморозки мы отметили более 10% сред в нашем производственном наборе из-за проблем, варьирующихся от взлома вознаграждений до сломанных задач и ошибок конфигурации, и вернули их в работу только после исправления.
Тем не менее, наши усилия не были безупречными. В некоторых случаях мы обнаруживали, что человеческие рецензенты отклоняли среды, помеченные нашими автоматическими мониторами как ложноположительные, что позволяло дефектным средам оставаться в обучении дольше положенного. А некоторые дефектные среды просто проскальзывали мимо наших механизмов обнаружения. В настоящее время мы ужесточаем критерии отклонения меток и рассчитываем на более тесное сотрудничество с владельцами сред для повышения точности наших систем. Помимо мониторинга и обнаружения, наши команды по обучению согласованности и RL сотрудничают для улучшения самих сред.
Мы подозреваем, что наши крупные инвестиции в контроль качества RL-сред помогли предотвратить более серьезные инциденты согласования, и наоборот — несовершенство этих усилий могло способствовать инцидентам, которые мы выявили на данный момент.
Чтобы посмотреть, как поведет себя модель, обученная без этих средств защиты, мы намеренно обучили модель класса Opus на 80 различных реальных RL-средах, в которых происходил взлом вознаграждений хотя бы во время одного реального цикла обучения (выявленный мониторингом), либо которые оказались уязвимыми для взлома при проверке качества сред. Полученная модель демонстрирует сильную мотивацию к достижению высоких результатов в задачах и готовность выполнять потенциально вредоносные действия ради успеха. В нашем сопутствующем блоге по науке согласования (Alignment Science) этот эксперимент описан более подробно, но здесь мы подведем краткий итог.
Мы протестировали намеренно несогласованную модель в различных оценках, включая смоделированные сценарии, основанные на аспектах киберинцидентов британского института AISI с участием Claude и инцидента OpenAI / Hugging Face (мы благодарны OpenAI за публичное раскрытие деталей). Во время этих оценок, где все вызовы инструментов симулировались другой LLM, обученная на взлом вознаграждений модель продемонстрировала склонность к побегу из симулированной песочницы и атакам на симулированную внутреннюю и стороннюю инфраструктуру. Она также была готова фальсифицировать собственную функцию вознаграждения, давать советы по созданию биооружия для удовлетворения оценщика и неоднократно пытаться обойти мониторинг безопасности развертывания ради мошенничества в задаче.
Затем мы провели те же симуляции кибербезопасности для этой модели до ее обучения на взлом вознаграждений, а также для нескольких наших общедоступных моделей. Ни одна из них не продемонстрировала аналогичного уровня несогласованного поведения. Мы пришли к выводу, что наличие существенного взлома вознаграждений в процессе обучения может заставить модели совершать длинные цепочки потенциально опасных реальных действий ради успешного выполнения задач.
Мы считаем, что значительные инвестиции, сделанные нами этой весной в мониторинг и сокращение взломов вознаграждений, — это главная причина, почему наши производственные модели вряд ли будут склонны к более опасному поиску вознаграждений. В нашем сопроводительном блоге по науке согласования мы также нашли подтверждения тому, что среды обучения согласованности могут существенно снизить взлом вознаграждений и поисковое поведение за награду. Но, как показывают инциденты, о которых мы сообщили 30 июля, наш процесс несовершенен, и наши модели согласованы не идеально.
Сразу уточним: мы не считаем читерство в обучающих средах единственной причиной проблем согласования или даже конкретных проблем согласования, проявившихся в наших инцидентах или у других разработчиков передового ИИ. Решение проблемы согласования потребует устранения самого широкого спектра потенциальных проблем, и будущие инциденты согласования могут быть связаны с иными типами поведения и другими причинами, отличными от тех, что мы наблюдали до сих пор.
Усиление практик безопасности
Внутреннее состояние безопасности Anthropic не было фактором, способствовавшим инцидентам 30 июля. Они произошли во внешней среде, где доступ в интернет по ошибке оставался открытым; моделям не нужно было «вызламываться» откуда-либо, даже если бы у них была такая склонность.
Тем не менее, эти инциденты подчеркивают критическую важность надежных мер безопасности. Помимо привычных рисков кражи интеллектуальной собственности или весов моделей, теперь мы должны противостоять рискам того, что наши собственные модели совершат побег из систем Anthropic, а также рискам неправомерного использования наших или чужих моделей для внешних атак на системы Anthropic. Эти риски стали более острыми по мере роста возможностей моделей, особенно начиная с моделей класса Mythos. Ниже мы описываем часть того, что нами уже внедрено — большая часть этой работы была выполнена еще до июльских инцидентов, хотя они лишь подчеркнули ее важность.
В начале апреля, увидев, куда движется использование агентного ИИ, наша команда безопасности проактивно направила общекорпоративные усилия на единую цель — укрепление нашей защиты, поставив ее выше других задач (включая исследования) там, где это было необходимо. Мы пришли к выводу, что наша незащищенность растет быстрее, чем оборона: Mythos обладал достаточными возможностями, чтобы стать целью для хорошо обеспеченных ресурсами злоумышленников, внутреннее использование автономных агентов выросло до масштабов, к которым традиционные подходы к доступу и мониторингу не были готовы, а темпы появления новой инфраструктуры требовали от нашей безопасности масштабирования вместе с окружением, а не работы с фиксированной пропускной способностью.
Результаты этой работы включают в себя:
- Сокращение числа учетных записей людей и автоматизированных систем с постоянным доступом к системам, содержащим веса моделей или данные клиентов
- Настройку наших вычислительных кластеров на блокировку всего исходящего трафика по умолчанию
- Требование к внутренним сервисам проверять подлинность друг друга перед началом связи
- Вывод из эксплуатации устаревших конфигураций инфраструктуры и общих внутренних сервисов
- Ужесточение требований к изолированным средам, в которых выполняются наши рабочие нагрузки
- Расширение наблюдаемости на уровне хостов, благодаря чему неожиданное поведение в нашей инфраструктуре становится заметным в момент его возникновения
Мы также временно перевели часть сотрудников компании на выполнение этих задач. Около 150 продуктовых инженеров были перенаправлены на обеспечение безопасности, надежности и конфиденциальности; исследователи также временно отошли от предварительного обучения или RL, чтобы сосредоточиться на средствах защиты и безопасности;, а наши продуктовые команды приостановили разработку большинства новых функций и поверхностей. Мы установили жесткие критерии завершения для каждой команды перед возвращением к прежней работе. К началу лета большинство команд выполнили эти требования.
Наряду с перераспределением ресурсов в пользу безопасности мы продолжили создавать средства изоляции и мониторинга для использования внутренних агентов. Наши рабочие нагрузки по обучению и оценке обычно выполнялись в песочницах, изолированных от наших производственных систем. С момента разработки Claude Mythos Preview мы использовали наши модели для поиска любых уязвимостей в этих песочницах. Мы описали наш автономный мониторинг внутренних агентов программирования в нашей апрельской сводке рисков соответствия, а в нашем августовском отчете о рисках эта система описана более подробно, наряду с сопутствующими мерами защиты. К ним относятся песочницы или классификаторы автоматического режима для наиболее автономных форм использования внутренних агентов, а также автоматическая проверка изменений кода инфраструктуры перед их слиянием.
То, чему в этой работе уделялось недостаточно внимания — это оценки, и прежде всего независимые внешние оценки. Мы отслеживали некоторые оценки высокого риска, в том числе в режиме реального времени, но в целом мы проводили автоматические проверки лишь для выборки стенограмм постфактум.
Инциденты в июле показали, что острая необходимость совершенствования нашей защиты в сфере кибербезопасности еще выше, чем мы предполагали ранее. Мы удваиваем наши усилия в этом направлении и расскажем об этом подробнее в нашем следующем отчете о рисках.
Сноски
- Мы подтвердили, что классификатор зафиксировал бы инциденты, описанные в нашем отчете от 30 июля.
- Ни один из этих результатов не был получен с помощью наших внутренних специализированных наборов тестов для наступательного киберхарактера, которые работают вообще без доступа к сети.
- Кибероценки высокого риска включают те, в которых Claude получает нечетко сформулированную задачу наступательного характера, например тест на проникновение.
- В конечном счете, модель, которая действует за пределами предполагаемой сферы применения при решении такой задачи, представляет собой проблему согласования; согласованная модель должна остановиться или сообщить людям, что задача не может быть выполнена в соответствии с требованиями. Мы продолжаем целенаправленно обучать ее такому поведению, но многоуровневый подход к защите означает, что нельзя полагаться исключительно на согласование.
- Мы публично обсудили две другие категории взлома вознаграждения в карточке системы Mythos Preview: в одной из них модель использует данные низкоуровневых компьютерных процессов для эскалации своих разрешений, а в другой обходит сетевые ограничения в своей обучающей среде для загрузки данных, позволяющих ей ускорить выполнение поставленной задачи.
- Эти меры по снижению рисков оказались не совсем достаточными; мы более подробно обсуждаем дальнейшие случаи обучения по цепочке рассуждений в нашем августовском отчете о рисках, в разделе 5.2.3.
Полный текст статьи читайте на Anthropic
