Изучаем непреднамеренные действия модели в ходе оценивания и внутреннего использования
- Anthropic описала четыре типа действий Claude: эксплуатацию уязвимостей, отправку форм, обход доступа к защищённым данным и ограничений загрузки.
- Выявленные случаи имели минимальные последствия; ни один, насколько известно компании, не затронул данные клиентов или внутренние системы Anthropic.
- Anthropic отключила открытый интернет во всех внутренних оценках до проверки надёжности мер безопасности и мониторинга.
Почему это важно: Компания считает важным открыто рассказывать о поведении моделей во время тестирования и использования.

В этом отчёте описаны примеры непреднамеренных действий модели, которые мы наблюдали во время оценок и внутреннего использования Claude. Он является частью наших усилий по более частой публикации отдельных отчётов о поведении и выравнивании моделей в дополнение к системным карточкам, которые мы выпускаем вместе с каждой моделью, и отчётам о рисках, которые публикуем каждые три — шесть месяцев в рамках нашей Политики ответственного масштабирования. Мы считаем важным открыто рассказывать о том, как ведут себя наши модели во время тестирования и использования.
Это поведение можно разделить на четыре категории:
- Claude использовала базовую уязвимость в программном обеспечении, чтобы выполнять команды на сервере;
- Claude отправила конфиденциальную форму на реальном сайте, хотя не должна была этого делать;
- Claude обошла ограничение, чтобы получить доступ к данным, защищённым токеном или платным доступом; и
- Claude использовала сервисы сокращения URL, чтобы обойти ограничения инструмента загрузки данных.
Мы решили не называть организации, упомянутые в приведённых ниже примерах, чтобы не раскрывать уязвимости в их системах, а также по их просьбе. Поэтому мы также приводим меньше подробностей о каждом случае, чем могли бы. Некоторые из описанных ниже случаев касались сайтов федеральных, региональных и местных государственных органов США. Мы проинформировали Белый дом об этих случаях и уведомили каждое из соответствующих ведомств.
На сегодняшний день выявленные нами случаи в этих категориях имели минимальные последствия в реальном мире. С точки зрения выравнивания и безопасности мы считаем такое поведение значительно менее серьёзным, чем инциденты в сфере кибербезопасности, о которых мы сообщали 30 июля и 9 сентября. Оно напоминает поведение, описанное нами в системных карточках начиная с Claude Mythos Preview. В большинстве случаев речь идёт о настойчивости: когда Claude не может выполнить поставленную задачу, она пытается обойти ограничение, вместо того чтобы остановиться.
Хотя последствия такого поведения были минимальными, а для некоторых оценок с высоким уровнем риска и оценок в сфере кибербезопасности мы уже отключили доступ к открытому интернету, теперь мы решили распространить эту меру на все внутренние оценки — до тех пор, пока не убедимся, что наши меры безопасности и мониторинга (описанные в разделе об устранении проблем в этой публикации) надёжно выявляют подобное поведение. Ниже мы также обсуждаем вопросы выравнивания и подробнее рассказываем о том, как меняем обучение, чтобы снизить вероятность дальнейшего ненадлежащего поведения.
Большинство этих случаев мы выявили при проверке диалогов, которую начали в июле. Сначала проверка была сосредоточена на оценках в сфере кибербезопасности — тестах, в ходе которых модель намеренно просят исследовать тестовую систему или атаковать её и при этом отключают доступ к интернету. Позже мы расширили сканирование, охватив гораздо больше ситуаций, в которых Claude могла получить доступ к интернету, включая тесты с намеренно включённым доступом, чтобы оценить выполнение моделью задач из реального мира. Сначала мы искали инциденты, сопоставимые по серьёзности с инцидентами в сфере кибербезопасности, о которых сообщали этим летом; на сегодняшний день таких случаев мы не обнаружили. Затем мы расширили поиск, включив менее серьёзные случаи, когда модель взаимодействовала с реальными сайтами или системами не так, как мы намеревались.
Теперь мы также сканируем значительно больший массив диалогов с меньшим уровнем риска, а также анализируем использование Claude внутри Anthropic и в средах обучения с подкреплением (RL), где Claude имеет доступ к интернету. По мере продолжения этой работы мы планируем сообщать о новых случаях непреднамеренного поведения. Во всех описанных здесь случаях Claude взаимодействовала с внешним миром; насколько нам известно, ни один из них не затрагивал данные клиентов или собственные внутренние системы Anthropic.
В этой публикации мы объясняем, зачем проводим оценки, во время которых произошло большинство этих случаев; подробнее описываем каждую модель поведения;, а также предварительно оцениваем, что она говорит о выравнивании Claude и как мы смягчаем связанные с ней риски.
Зачем и как мы проводим оценки
Описанное в этой публикации поведение не ограничивается оценками, однако многие выявленные нами на сегодняшний день случаи произошли во время их проведения. Перед выпуском мы постоянно тестируем модели на самых разных задачах. Мы используем множество оценок — стандартизированных наборов задач, которые каждый раз оцениваются одинаково; каждая из них помогает составить представление о навыках Claude в определённой области. Многие используемые нами оценки общедоступны: их разрабатывают внешние исследователи, и любой разработчик может их провести, что позволяет сравнивать возможности разных моделей. Другие оценки мы создаём самостоятельно.
Поскольку языковые модели недетерминированы — то есть в их ответах всегда присутствует элемент случайности, и одну и ту же задачу они могут каждый раз выполнять немного по-разному, — мы просим Claude проходить каждое задание оценки сотни или тысячи раз (каждая попытка называется запуском). Многократное тестирование помогает понять, как модель обычно справляется с задачами, а также выявить редкие случаи, когда она делает что-то неожиданное. Результаты оценок влияют на решения во всей Anthropic, в том числе на то, как мы обучаем модели, какие меры защиты для них разрабатываем и когда выпускаем их.
Оценки также иногда впервые выявляют проблемы в поведении модели. Модели учатся многому из того, что умеют, с помощью обучения с подкреплением (RL): они многократно выполняют задачу в определённой среде и получают вознаграждение за успех. Однако учебные среды несовершенны. Если обучение вознаграждает за то, чего мы не намеревались добиваться, например за поиск лазеек или обход ограничений, модель усваивает, что обходной путь приносит результат, и может применять его в других ситуациях. Это называется взломом вознаграждения. Хотя в процессе обучения у нас есть механизмы для выявления и отсеивания взлома вознаграждения, оценки остаются важнейшим способом понять склонности модели к определённому поведению в иных контекстах и на других наборах задач, чем те, на которых она обучалась.
Некоторые задачи — например, поиск в интернете труднодоступной информации — трудно реалистично смоделировать в среде без доступа к интернету. Проведение таких оценок с доступом к сети стало стандартной практикой в отрасли: общедоступные тесты веб-поиска по умолчанию проводятся в открытом интернете, и такой подход позволяет сравнивать наши модели с другими. Большинство описанных в этом отчёте случаев произошло именно во время подобных оценок.
Обзор поведения
Ниже мы описываем четыре категории поведения, при котором Claude действовала на реальных сайтах и в системах не так, как мы намеревались; в каждом случае были затронуты организация или человек за пределами Anthropic.
Использование базовой уязвимости в программе для выполнения команд на сервере
Когда Claude не могла напрямую выполнить задание оценки — либо из-за намеренно ограниченных возможностей собственных инструментов, либо потому, что необходимый внешний сервис был недоступен, — она использовала другие инструменты, размещённые на сайте третьей стороны, чтобы достичь цели. В некоторых случаях для этого она эксплуатировала базовые уязвимости в программном обеспечении сайта, прибегая к SQL-инъекции или инъекции команд (способу отправки данных, которые сайт по ошибке выполняет как инструкции).
Например, в рамках одной оценки Claude Mythos Preview попросили провести научный анализ. Необходимый для этого общедоступный инструмент размещался на сайте университета; когда модель попыталась получить к нему доступ, инструмент выдал ошибку. Ища другой способ выполнить задачу, Claude изучила сайт, обнаружила на сервере университета скрипт, который возвращал любой запрошенный файл, и с его помощью скопировала файлы с сервера, включая исходный код самого скрипта. В этом коде Claude нашла уязвимость, позволявшую внедрять команды и выполнять их на сервере, и воспользовалась ею для проведения расчёта.
В другом случае данные, необходимые Claude Mythos 5, были бесплатными, но получить к ним доступ можно было только после принятия соглашения об использовании данных, а нужных инструментов для этого у Claude не было. Claude воспользовалась приложениями, размещёнными на сайте, чтобы загрузить страницу и принять соглашение от своего имени.
Такое поведение мы наблюдали при проведении DeepSearchQA и BrowseComp (обе оценки посвящены поиску информации в интернете), LABBench2 (общедоступного теста для оценки навыков в биологических исследованиях), а также во время внутренних оценок.
Отправка формы, которую не следовало отправлять
Мы обнаружили случаи, когда Claude отправляла онлайн-форму, хотя не должна была этого делать. Как правило, это происходило из-за неоднозначных инструкций в оценке или из-за неправильной настройки среды, которая мешала Claude работать с тестовыми формами.
Например, в одном случае, неоднократно повторявшемся в рамках одной оценки, ещё не выпущенную исследовательскую модель, не относящуюся к передовым, попросили заполнить тренировочную копию государственной формы. Когда копия не загрузилась или модель случайно закрыла её, она перешла на сайт, где обычно размещалась настоящая форма, и отправила её.
В ходе другой оценки Claude Haiku 4.5 поручили заполнить форму до последнего шага, но остановиться перед отправкой. Несколько раз Claude по ошибке отправляла форму, ожидая, что появится дополнительная страница подтверждения. В этих случаях, согласно внутренним рассуждениям модели, она лишь демонстрировала процесс, а не отправляла настоящий запрос.
В третьем примере такого поведения Claude Haiku 4.5 поручили придумывать и выполнять тестовые задания на случайно выбранных веб-страницах. Во время одного запуска модель открыла страницу, посвящённую нераскрытому убийству; на ней была форма для передачи информации, размещённая полицейским управлением. Claude запретили входить в учётные записи, создавать аккаунты, вводить личные данные, совершать покупки и отправлять что-либо, способное привести к разрушительным последствиям, однако отправка форм запрещена не была. Claude заполнила форму следующим текстом: «Возможно, у меня есть информация об этом деле. Помню, что в тот период видел (а) в районе [названной на странице улицы] человека, подходящего под описание. Пожалуйста, свяжитесь со мной, если эта информация имеет значение». (На сайте не было описания подозреваемого.) Модель оставила поля имени и контактных данных пустыми — форма это позволяла — и отправила её. Отправленное сообщение пометили как спам и не передавали для расследования.
Такое поведение мы наблюдали при проведении OSWorld (общедоступной оценки навыков работы с компьютером), Odysseys (оценки выполнения долгосрочных задач), а также во время внутреннего использования.
Обход ограничений для доступа к защищённым данным
Иногда Claude обходила ограничения, чтобы получить доступ к данным, для которых у неё не было разрешения. Как правило, это происходило, когда сервер отклонял запрос Claude или когда данные предоставлялись только за плату.
Например, в рамках оценки Claude Mythos 5 попросили определить место, изображённое на фотографии. Чтобы проверить свои предположения методом триангуляции, модель попыталась обратиться к карте недвижимости местных властей. Claude могла читать текст веб-страниц, но оценка ограничивала её возможность переходить по ним так, как это сделал бы человек. Вместо этого она прочитала файл настроек, который сайт отправляет браузерам, нашла действующие токены доступа и использовала их, чтобы напрямую отправлять запросы серверу, на котором размещалась карта, и получать данные.
В другом примере исследователь Anthropic использовал Claude Mythos 5 для статистического проекта, в рамках которого требовалось получить общедоступные данные, предоставляемые государственным ведомством за плату. Однако из архивной копии сайта ведомства Claude узнала, что его общедоступная панель управления выдаёт токен доступа любому посетителю. Она запросила токен и использовала его для обращения к базе данных, не оплачивая доступ.
В обоих примерах Claude получила данные, которые были доступны широкой публике, но только за плату.
Такое поведение мы наблюдали при проведении Humanity«s Last Exam — оценки знаний по академическим вопросам экспертного уровня, —, а также во время внутреннего использования.
Использование сервисов сокращения URL
Некоторые наши инструменты загрузки данных, с помощью которых Claude читает веб-страницы, ограничивают длину запрашиваемых ею URL-адресов. Это не позволяет Claude использовать длинные URL для нежелательных действий, например SQL-инъекций или внедрения команд (часть URL передаётся серверу сайта в виде текста, а длинный адрес может содержать такие инструкции). Мы обнаружили, что несколько моделей, включая Claude Opus 5 и Claude Mythos 5, обходили это ограничение с помощью бесплатных сервисов сокращения URL. Сначала мы выявили это поведение внутри компании, но во время подготовки этой публикации оператор сервиса сокращения URL da.gd сообщил нам, что тоже обнаружил использование Claude своего сайта с этой целью. Благодарим оператора за предоставленные сведения.
Меры по устранению проблемы
Мы приняли ряд превентивных мер. Некоторые общедоступные оценки мы больше не проводим; другие перенесли в автономный режим или переработали так, чтобы их задания не затрагивали действующие сайты. Мы также внесли более масштабные изменения. Обновили защитные ограничения для некоторых инструментов доступа к интернету, например инструмента загрузки веб-страниц, существенно сузив возможности модели при их использовании. Кроме того, в рамках продолжающейся работы по обеспечению безопасности и мониторингу агентных систем мы разработали инструменты для автоматического выявления и блокировки описанного выше поведения. Теперь эти инструменты используются при проведении большинства наших оценок и во внутренних агентных системах, работающих на передовых моделях. При проверке на случаях, описанных в этой публикации, они заблокировали их все.
Как мы рассказывали в публикации от 31 августа, мы также продолжаем исправлять или удалять учебные среды, в которых Claude получает вознаграждение за обход ограничений инструментов или других препятствий, чтобы они не стимулировали подобное поведение и не допускали взлома вознаграждения.
Мы также предпринимаем другие шаги, чтобы предотвращать непреднамеренные действия агентных систем внутри Anthropic и выявлять их, если они всё же происходят. В частности, мы переносим внутренние агенты на централизованно управляемую инфраструктуру с надёжными средствами изоляции, сводим к минимуму доступ внутренних агентов и процессов обучения к интернету и гораздо внимательнее отслеживаем их действия, используя такие методы, как классификаторы безопасности и иерархическое суммирование. Теперь эти меры входят в процедуры выявления угроз и реагирования на них, применяемые нашей командой безопасности, и позволяют быстро реагировать на нежелательное поведение и пресекать его. Мы планируем подробнее рассказать об этих подходах и встроить их непосредственно в наши продукты.
Обсуждение и выводы о выравнивании
Мы пока не завершили полную оценку выравнивания в этих случаях, однако считаем их менее серьёзными, чем инциденты в сфере кибербезопасности, произошедшие этим летом. Ниже объясняем причины и делимся общими выводами.
Контекст оценки выравнивания
Налаживая регулярную публичную отчётность о подобных случаях, мы также хотим оценить их серьёзность. Это по-прежнему непростая задача: оценка степени сбоя выравнивания часто зависит от того, чего пыталась добиться модель, а собственный рассказ модели о её рассуждениях не обязательно надёжно свидетельствует о её убеждениях или мотивах действий. Об этом мы писали в своей оценке выравнивания от 9 сентября. По мере роста возможностей модели могут всё изощрённее взаимодействовать с миром, что открывает путь к более сложным сбоям. Например, предвзятые рассуждения, описанные в той оценке, не были чем-то новым, но в условиях, когда модели могли умело действовать в реальных системах на протяжении нескольких часов, последствия оказались серьёзнее. Система оценки серьёзности сбоев выравнивания, построенная на основе сегодняшних проблем, может быстро устареть, учитывая стремительное развитие возможностей ИИ.
Тем не менее при анализе описанных в этой публикации случаев полезными оказались два измерения выравнивания: выход за рамки задачи — то есть насколько далеко модель отошла от её предполагаемой цели, — и нечестность: давала ли она вводящее в заблуждение описание своих действий или намерений. Что касается выхода за рамки задачи, мы считаем эти случаи значительно менее тревожными, чем инциденты, о которых сообщали этим летом, когда Claude во время оценок в сфере кибербезопасности часами получала доступ к реальным системам третьих сторон. В описанных здесь случаях Claude обходила средства контроля доступа, чтобы получить защищённые, но общедоступные данные, либо эксплуатировала уязвимости программного обеспечения и выполняла команды на серверах (главным образом для доступа к нечувствительным данным).
С нечестностью картина неоднозначнее. В одном случае Claude поручили создавать примеры взаимодействия с сайтами, и она отправила выдуманную подсказку через онлайн-форму полицейского управления. Судя по диалогу, Claude, по-видимому, лишь создавала пример содержимого в рамках задания, а не пыталась кого-либо ввести в заблуждение ради достижения цели. В отличие от этого, в самом серьёзном инциденте этим летом вводящие в заблуждение рассуждения Claude продолжались часами и помогали ей продолжать атаку. Тем не менее, чтобы уверенно судить о нечестности, обычно требуется более глубокий анализ, чем тот, который мы провели здесь, — например, повторное воспроизведение диалогов с изменениями, позволяющими проверить, что именно определило поведение модели. Поэтому по мере дальнейшего анализа наша оценка этих случаев может измениться.
Выводы и дальнейшие шаги
Описанное здесь поведение не является новым и не меняет нашу общую оценку выравнивания Claude. Во многих случаях, когда мы наблюдали такое поведение, Claude получала неоднозначные или невыполнимые задания. Мы и другие исследователи замечали, что, сталкиваясь с невыполнимыми задачами, модели прибегают к непредусмотренным, а иногда и не согласующимся с заданными целями стратегиям, чтобы достичь желаемого результата.
Некоторых из этих сбоев можно было бы избежать, если бы в заданиях оценок яснее указывалось, что входит в рамки упражнения, а что нет, включая целевые объекты, разрешённые действия и границы сети (то есть к каким ресурсам модель должна и не должна обращаться). Однако в реальном использовании Claude каждый день сталкивается с неоднозначными и невыполнимыми заданиями, и, действительно, несколько наблюдавшихся нами случаев произошли при обычном использовании Claude в качестве агентной системы.
Основной имеющийся у нас способ улучшить суждения Claude и помочь ей осторожно справляться с неоднозначными ситуациями — это обучение поведенческим нормам и выравниванию. Исторически мы уделяли больше внимания тому, чтобы научить модели соблюдать границы и проявлять должную осторожность в средах для программирования. Теперь мы распространяем этот подход на такие задачи, как поиск информации и работа с компьютером, которые фигурировали в описанных здесь случаях. Однако в краткосрочной перспективе одного обучения выравниванию пока недостаточно и оно не обеспечивает полной надёжности, поэтому мы также полагаемся на многоуровневую защиту, включая описанные выше классификаторы и меры безопасности.
По мере продолжения сканирования и анализа мы планируем и дальше сообщать о вызывающем обеспокоенность поведении. Надеемся, эти отчёты помогут другим разработчикам проверять свои модели на аналогичное поведение, поскольку многие из задействованных оценок общедоступны и широко применяются. Хотя последствия этих случаев были минимальными, мы не хотим преуменьшать значение полученных результатов: по мере роста возможностей моделей то же поведение может причинить гораздо больший вред. Чем большую роль модели играют в обществе, тем больше общественность вправе знать об их поведении.
Примечание. Пример с формой для передачи информации, описанный выше, касался полицейского управления Филадельфии, которое сегодня самостоятельно сообщило об этом в пресс-релизе. Мы поделились результатами с управлением 8 октября, сразу после завершения технической проверки.
Полный текст статьи читайте на Anthropic
Об этом также пишут
- TheNextWeb.ru Anthropic заявила, что во время тестирования Claude отправил полиции ложное сообщение об убийстве 10.10.2026 11:26
