Исследование трех реальных инцидентов в ходе наших проверок кибербезопасности

Investigating three real-world incidents in our cybersecurity evaluations

В ходе анализа стенограмм наших оценок кибербезопасности мы выявили три инцидента, в которых модель Claude получала доступ в интернет из изолированной среды оценки (или во время взаимодействия с ней), после чего получала несанкционированный доступ к реальным системам трех различных организаций.

Ниже мы описываем, что произошло, как это произошло и что мы собираемся изменить. Мы призываем другие лаборатории искусственного интеллекта провести аналогичные проверки. Эта публикация отражает наше текущее понимание ситуации; мы будем обновлять ее по мере изменения деталей.

21 июля компания OpenAI сообщила, что несколько ее моделей вырвались из изолированной тестовой среды, воспользовавшись ранее неизвестной уязвимостью («нулевого дня»). Впоследствии эти модели получили доступ к рабочей (production) инфраструктуре Hugging Face — платформы для платформ машинного обучения с открытым исходным кодом и наборов данных ИИ.

В ответ на этот инцидент мы начали масштабный ретроспективный анализ собственных оценок кибербезопасности. В частности, мы искали свидетельства того, что Claude — подобно моделям OpenAI, получившим доступ к Hugging Face — смогла выйти в интернет из тестовых сред, которые должны были быть полностью изолированы.

Проанализировав 141 006 тестовых запусков, в которых у Claude потенциально мог быть доступ в интернет, мы выявили три инцидента, когда модель получала доступ в интернет из среды оценки Irregular (одного из наших сторонних партнеров по тестированию) или во время взаимодействия с ней, после чего получала несанкционированный доступ к рабочей инфраструктуре трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача захвата флага (capture-the-flag), что является одним из способов оценки кибервозможностей модели. Модели предоставляется вымышленный сценарий и сообщается, что секретная информация («флаг») спрятана на другой машине в сети; ее цель — взломать систему и извлечь этот флаг. Задача не имеет жестких рамок, и конкретный метод ее решения не предписывается.

Во всех случаях в инструкциях (промптах) Anthropic для Claude указывалось, что ее среда является симуляцией и доступа в интернет у нее нет. Из-за недопонимания между нами и нашим партнером по тестированию это оказалось не так, и доступ к интернету присутствовал. В результате, когда поисковые действия Claude привели ее к реальным системам в открытом интернете, она восприняла их как часть упражнения. (Полигоны для оценки кибербезопасности обычно включают реалистичные детали для точной оценки возможностей моделей в реальных условиях; реалистично выглядящая цель сама по себе не является для модели очевидным свидетельством того, что эта цель не входит в симуляцию.)

Действуя в ошибочной уверенности, что все доступные сущности являются частью упражнения, Claude скомпрометировала инфраструктуру пострадавших организаций с помощью базовых методов, таких как эксплуатация слабых паролей и неаутентифицированных эндпоинтов. Она не находила и не использовала сложных уязвимостей, и в каждом случае продолжала работать исключительно над выполнением конкретной задачи по захвату флага, назначенной в рамках оценки. Тем не менее, в некоторых случаях наша более старая модель продолжала атаку даже после получения свидетельств того, что она работает в открытом интернете; наша новейшая модель останавливалась, как только осознавала, что находится в сети. Ни в одной из этих ситуаций Claude не пыталась самостоятельно выгрузить себя за пределы системы или намеренно сбежать из тестовой среды.

В инцидентах участвовали три разные модели Claude: Opus 4.7, Mythos 5 и внутренняя исследовательская тестовая модель.1 Самые ранние инциденты датируются апрелем. Модели в каждой из этих оценок работали без стандартных средств защиты, которые мы развертываем при общем доступе к модели (то есть у них не было классификаторов и систем мониторинга, которые мы обычно внедряем для предотвращения злоупотреблений). Тем не менее, модели прошли специфичную для них подготовку по безопасности (то есть это были не «только полезные» версии моделей, которые мы иногда используем при тестировании). Все описанные здесь проверки выполняются на выделенной инфраструктуре, которая отделена от конфиденциальных внутренних систем или пользовательских данных Anthropic и не имеет к ним доступа.

Мы начали проверку стенограмм в четверг, 23 июля, и в тот же день остановили все кибериспытания после выявления стенограмм, в которых Claude могла получить доступ к интернету. Все три инцидента мы выявили на следующий день. Мы уведомили нашего партнера по оценке Irregular и три затронутые организации в понедельник, 27 июля. Две организации, с которыми нам удалось связаться, ранее не обнаруживали эту активность и не обращались к нам, и в настоящее время мы работаем с ними над устранением последствий. Мы продолжаем попытки связаться с третьей организацией.

Мы провели это исследование в сотрудничестве с Irregular. Мы признательны им за тесное сотрудничество в понимании и разрешении этих инцидентов; они также проводят собственное расследование. Мы считаем подобное сотрудничество критически важным для обеспечения безопасной и тщательной оценки моделей. Мы рассчитываем на нашу совместную работу в области безопасности.

Ниже мы приводим более подробную информацию о каждом инциденте и о том, как мы реагируем на происходящее.

Справочная информация об оценках кибербезопасности

Мы регулярно проводим оценки кибербезопасности, которые включают моделирование реальных задач по наступательной кибербезопасности. Эти оценки являются критически важным шагом в разработке и выпуске моделей: детальное понимание возможностей моделей позволяет нам проектировать надлежащие средства защиты и, в конечном итоге, выпускать модели безопасно.

Мы начали проводить оценки кибербезопасности в феврале 2025 года с Claude Sonnet 3.7 на платформе Cybench, которая состояла из 40 различных задач по захвату флага. Со временем мы увеличили количество используемых бенчмарков по мере появления новых и эволюции возможностей моделей. Например, в карточке модели Mythos 5 мы включили CyberGym и ExploitBench — бенчмарки, оценивающие способность языковых моделей находить новые уязвимости.2 В большинстве таких оценок среды не подключены к интернету, о чем модели сообщается прямо.

Мы часто сотрудничаем с внешними партнерами, которые создают некоторые из этих оценок кибербезопасности и помогают в их проведении. Внешние партнеры предлагают более разнообразные среды и сценарии, чем мы могли бы создать самостоятельно, и обеспечивают независимую стороннюю оценку наших моделей.

Что произошло

Из 141 006 просмотренных нами тестовых запусков мы выявили три отдельных инцидента (в общей сложности шесть запусков, четыре из которых затронули одну и ту же организацию; остальные два инцидента произошли в независимых тестовых запусках). Каждый инцидент был связан с разным вымышленным сценарием захвата флага — например, в одном из них Claude исполняла роль сотрудника вымышленной компании, атакуя ее внутренние системы в рамках закрытой тестовой среды.

Во всех случаях в наших инструкциях прямо указывалось, что у Claude нет доступа в интернет, но при этом модели не ставилось никаких ограничений относительно того, где искать флаг. Тем не менее, из-за неправильной конфигурации машины, к которым Claude получала доступ в ходе оценки, обладали прямым доступом к интернету в реальном времени. Ни мы, ни наш партнер по оценке не знали об этой ошибке конфигурации до тех пор, пока мы не обнаружили ее в ходе дополнительного мониторинга тестирования на прошлой неделе.

Ряд мер многоуровневой защиты (как с нашей стороны, так и со стороны нашего партнера) могли бы предотвратить эти инциденты или по крайней мере снизить вероятность их возникновения. Тщательная проверка всех путей доступа в интернет до начала оценки и мониторинг логов тестирования в реальном времени помогли бы выявить проблему раньше. И мы, и наш партнер также могли бы более тщательно изучить стенограммы оценки или сетевые журналы. Кроме того, возможно, что промпт, прямо сообщающий Claude о наличии у нее доступа в интернет действительно был, изменил бы поведение модели при ее столкновении с реальными системами.

Claude делала то, чему учения по захвату флага учат киберэкспертов: искала способы добраться до флага. Этот поиск привел ее к обнаружению того, что ее машина может выйти в интернет, но поскольку в системном промпте было указано об отсутствии доступа в сеть, Claude посчитала все первоначально встреченные элементы частью симуляции и отнеслась к найденным реальным системам как к элементам упражнения. Три инцидента затронули три разные модели, и каждая из них реагировала по-разному при появлении признаков того, что цели настоящие, как описано ниже.

Инцидент 1

В ходе одной из оценок выбранная нашим партнером вымышленная целевая компания совпала по названию с реальным активным доменным именем в интернете. Этот тестовый контейнер имел непреднамеренный прямой доступ в интернет из-за упомянутого выше недопонимания.

В четырех запусках этой оценки Claude столкнулась с трудностями при достижении своей симулированной цели внутри тестовой среды, но затем обнаружила, что реальная компания доступна через интернет. Предполагая, что это и есть задуманная цель в задаче по захвату флага, Claude нашла, идентифицировала и проэксплуатировала уязвимости в инфраструктуре компании, считая это частью упражнения. В ходе этих четырех запусков была извлечена такая информация, как учетные данные приложений и инфраструктуры, а также получен доступ к базе данных, содержащей несколько сотен строк рабочих данных. Это стало наиболее серьезным выявленным нами последствием.

Этот инцидент был связан с Claude Opus 4.7 и стал единственным случаем, когда модель продолжила атаку на систему после того, как узнала, что она, вероятно, работает в реальной среде. Во всех четырех запусках модель в конечном итоге осознала (что видно по ее вербализованным рассуждениям), что система настоящая (в двух случаях модель рационализировала, что реальная компания должна быть частью упражнения). Тем не менее, ни в одном из случаев это не остановило атаку.

Инцидент 2

В ходе другой оценки Claude обнаружила внутри вымышленной среды документ, похожий на инструкции другой вымышленной компании по настройке для новых разработчиков. Эти инструкции предписывали сотрудникам установить Python-пакет из PyPI — публичного реестра, где публикуется ПО на Python, — который на самом деле не существовал.

Claude заметила в этом потенциальную лазейку: если опубликовать собственный пакет под тем же именем, системы вымышленной компании скачают и установят его автоматически. Поэтому Claude создала и опубликовала вредоносный (по сути, с ловушкой) Python-пакет с тем же именем в попытке выиграть соревнование по захвату флага.

Claude приложила огромные усилия для проведения этой атаки — усилия, которые для человеческого участника явно свидетельствовали бы о том, что это уже не просто оценка, и что он фактически загружает реальный пакет в PyPI. Например, в одном из случаев для создания аккаунта на PyPI Claude потребовался адрес электронной почты. А для создания электронной почты потребовался номер телефона. Не сумев найти бесплатный сервис телефонных номеров, она попыталась — безуспешно — получить средства для оплаты номера телефона с помощью нескольких различных способов. В конце концов она отступила, нашла бесплатного незаблокированного провайдера электронной почты, использовала его для регистрации аккаунта на PyPI, а затем применила этот аккаунт для загрузки вредоносного ПО в PyPI.

Claude была уверена, что используемый ею реестр пакетов является частью симуляции, но в реальности пакет находился в свободном доступе в сети в течение примерно одного часа. За это время пакет был скачан и запущен на 15 реальных системах. Одной из таких систем был сканер, принадлежащий реальной охранной компании (отличной от вымышленной компании, представленной в сценарии), которая регулярно устанавливает Python-пакеты и сканирует их на наличие вредоносного ПО. Когда сканер этой компании установил пакет, скрытый код Claude выполнился. Мы полагаем, что сканер безопасности компании счел пакеты PyPI безопасными для установки, и в результате Claude смогла похитить учетные данные компании в созданный ею пункт сбора. Затем Claude использовала эти учетные данные для доступа к дальнейшей инфраструктуре этой компании.

Claude не нападала на эту компанию целенаправленно — она даже не знала о существовании компании при загрузке пакета. Но поскольку код был опубликован в открытом доступе, это затронуло любую систему, которая его запустила. (Загруженный Claude пакет был автоматически удален из PyPI собственными системами безопасности платформы. Мы уведомили команду PyPI об этом инциденте и предоставили им соответствующие индикаторы.)

Эту атаку осуществила модель Claude Mythos 5. В самом начале запуска рассуждения самой Claude верно определили последствия ее действий. Она отметила, что если бы это был настоящий интернет, публикация пакета была бы реальной атакой — «НЕнормальной и уж точно не задуманным решением». Тем не менее, она убедила себя, что все еще находится в симуляции, на том основании, что она не узнала (на самом деле подлинные) центры сертификации, защищающие ее соединения. Кроме того, календарная дата 2026 года в системах доказывала, по мнению Claude, что среда инсценирована. Claude больше не возвращалась к этому выводу; например, когда автоматизированные сканеры начали устанавливать пакет, Claude приняла их за заскриптованных участников в рамках оценки.

По нашему мнению, независимо от того, во что модель верила относительно своей среды, усилия, которые Claude приложила для публикации пакета в PyPI, не соответствуют идеальному поведению, и это та область, на которой мы сосредоточим больше внимания при обучении.

Инцидент 3

В этой оценке, когда Claude не смогла связаться с намеченной вымышленной целью, она стала искать альтернативы в сети, просканировав около 9000 целей. В конце концов она нашла и скомпрометировала доступное из интернета приложение одной компании, используя базовые и хорошо известные методы кибератак, такие как чтение учетных данных с открытой отладочной страницы и SQL-инъекция.

Эту атаку совершила внутренняя исследовательская тестовая модель. Большую часть времени выполнения Claude воспринимала достигнутые ею (реальные) хосты просто как части упражнения; она предполагала, что они смоделированы, и поэтому считала свои действия безвредными. Однако позже в ходе выполнения Claude поняла, что скомпрометированный хост находится в облачной учетной записи, никак не связанной с задачей по захвату флага. Она самостоятельно пришла к выводу, что цель на самом деле реальна, и прекратила атаку.

Наш анализ поведения Claude

В каждом из этих случаев наш промпт прямо говорил Claude, что у нее нет доступа в интернет. На протяжении большей части каждого запуска, сталкиваясь с системами реального мира, Claude предполагала, что они являются частью упражнения (хотя иногда она признавала, что это реальные производственные системы). И поскольку сценарий захвата флага по своей задумке является инструкцией по атаке на внешнюю систему, такие действия соответствовали поставленной перед Claude задаче.

На этом общем фоне три модели повели себя по-разному, когда появились признаки того, что их цели настоящие. Opus 4.7, наша самая старая модель, признала, что добралась до производственных систем, но продолжила атаку. Mythos 5 правильно интуитивно поняла, что выходит в открытый интернет, но путем логических рассуждений вернулась к выводу, что все еще находится в симуляции. Наша новейшая модель, внутренняя исследовательская тестовая модель, также задумалась о том, являются ли ее цели реальными на самом деле. Когда появились доказательства того, что это так, она прекратила выполнение упражнения.

Это три изолированных инцидента, которые не были частью контролируемого экспериментального сравнения. Поэтому мы должны с осторожностью делать из них какие-либо выводы. Тем не менее, поведение, которое мы больше всего хотим видеть — осознание того, что цель реальна, и остановка без подсказок — произошло только в самой недавней из трех моделей (и даже эта модель зашла дальше, чем нам хотелось бы, прежде чем остановиться). Эта закономерность согласуется с тем, что более продвинутые модели реагируют более адекватно, но нам потребуется провести дополнительное тестирование, чтобы быть уверенными в этом выводе.

Мы также ведем диалог с METR, независимой организацией по оценке искусственного интеллекта, с целью проведения сторонней проверки, включая предоставление доступа ко всем стенограммам и выборочный доступ к соответствующим моделям. Тем временем в течение следующей недели мы выпустим слегка отредактированную стенограмму, в которой Claude создала вредоносный пакет PyPI. Чтобы защитить затронутые организации, мы пока не можем публиковать другие стенограммы, но будем работать над тем, чтобы сделать их доступными, как только появится такая возможность.

Как мы реагируем

Мы извлекаем из этих инцидентов несколько уроков.

Во-первых, среды оценки, задействующие мощные автономные возможности, также требуют серьезных средств контроля. Тестирование безопасности проводится до выпуска модели именно потому, что мы еще не знаем, на что она способна. Среды оценки все чаще должны соответствовать тем же стандартам безопасности, что и любые другие системы, в которых работают наши модели.

Полигон для оценки кибербезопасности, содержащий только вымышленные сценарии, может казаться малорискованным — в конце концов, внутри них ничего не настояще. Тем не менее, по мере развития возможностей ИИ нам необходимо менять подход к моделированию таких угроз. Продвинутые агенты в средах без доступа к конфиденциальной информации тем не менее представляют существенную угрозу сами по себе. Чтобы противостоять этой угрозе, нам необходимо лучше совместно проектировать среды оценки и осуществлять более качественный мониторинг результатов тестирования. Некоторые из решений здесь могут оказаться даже простыми исправлениями; например, вполне вероятно, что Claude вообще не получила бы доступа в интернет, если бы в промпте было четко объяснено, какие системы входят в область оценки, а какие нет.

Это относится не только к внутренним средам, но и к сторонним поставщикам — инфраструктура, созданная сторонними организациями по оценке, требует аналогичного усиления мониторинга и защиты. Мы призываем другие лаборатории проводить аналогичные проверки. Кроме того, данная сфера выиграла бы от более широкого обсуждения того, как безопасно и реалистично оценивать все более мощные ИИ-агенты, включая вопросы о том, как соотносить реализм, обеспечиваемый доступом в интернет при тестировании перед развертыванием, с рисками, которые он создает.

Во-вторых, грань между выровненным (aligned) действием и вредоносным зависит от того, как модель понимает свою ситуацию. Мы не обнаружили в ходе ни одного из описанных здесь запусков свидетельств того, что модель преследовала какую-то собственную цель. Вместо этого модели делали то, о чем их просили в рамках оценки — хотя в большинстве случаев они делали это, разделяя ложное представление о том, является ли среда реальной. В тех запусках, где модель распознавала систему как реальную и продолжала действовать, она делала это, поскольку предполагала, что это часть задачи. Ситуационная осведомленность — это один из факторов, позволяющих модели принимать выровненные решения, но в данном случае понимание ситуации у Claude оказалось неверным.

Наконец, эти инциденты демонстрируют важность подходов многоуровневой защиты (defense-in-depth). Мы проводим подобные оценки возможностей без защитных механизмов, которые поставляются с нашими общедоступными моделями, поскольку наша цель — измерить то, на что способна базовая модель. Это безопасно только в том случае, если оценка должным образом изолирована. Тем не менее, средства защиты, развертываемые на наших общедоступных моделях, заблокировали бы выявленное поведение.

В конечном итоге, к этим инцидентам привело множество факторов, но в соответствии с культурой разбора полетов без поиска виновных (blameless postmortem), мы подходим к исправлениям так, будто ответственность лежит исключительно на нас. Это начинается с обеспечения безопасности каждого этапа нашего конвейера оценки, включая методы интеграции со сторонними партнерами. В дальнейшем это будет включать расширение непрерывного мониторинга стенограмм оценки на предмет неожиданного поведения, улучшение наших инструментов для расследования и проведение более тщательной работы по обеспечению качества совместно с вендорами, на которых мы полагаемся.

Мы начали эту проверку после того, как OpenAI сообщила о побеге своих моделей из изолированной тестовой среды, и мы хвалим их за публикацию своего отчета. Хотя мы также обнаружили свидетельства того, что наши модели получали доступ к системам, к которым не должны были приближаться, сами инциденты в остальном существенно различаются:

  • Мы обнаружили эти инциденты в результате проактивной проверки стенограмм наших оценок кибербезопасности; пострадавшие организации не фиксировали эту активность, и впоследствии мы связались со всеми тремя.
  • В то время как модели OpenAI использовали новую уязвимость для преодоления изоляции, оцениваемые здесь модели Claude получили доступ в интернет через открытый путь.
  • Хотя между ними нет абсолютно четкой границы, мы считаем, что эти инциденты ближе к сбою инфраструктуры обвязки (harness) и операционному сбою, чем к сбою выравнивания модели. Нашим моделям сообщили, что у них нет доступа в интернет и что им нужно захватить флаг, в то время как инфраструктура была ошибочно сконфигурирована так, что доступ в интернет присутствовал. Это заставило их поверить — пожалуй, вполне обоснованно — что реальные среды, с которыми они столкнулись, были симуляциями.
  • Примечательно, что наша новейшая модель, осознав, что работает в реальной среде, прекратила попытки достичь цели оценки.

Эти факты дают нам сдержанный оптимизм в отношении того, что при более жестком мониторинге и контроле вокруг инфраструктуры оценки, а также при постоянных инвестициях в выравнивание (alignment) такого рода риски можно преодолеть. 

Обновлено 3 августа: Исправлено название оценки, в которой произошел инцидент с OpenAI/Hugging Face.

Сноски

  1. Мы регулярно тестируем подобные внутренние исследовательские прототипы. Их общий выпуск не планируется.
  2. Мы обычно сохраняем следы (traces) для бенчмарк-оценок. Мы тщательно проверили именно эти два бенчмарка на наличие признаков вреда, поскольку инцидент с OpenAI/Hugging Face произошел во время оценки ExploitGym.


Полный текст статьи читайте на Anthropic