Anthropic заявила, что её ИИ-агенты пытались взломать правительственные сайты
- Anthropic сообщила о попытках ИИ-агентов взломать или нарушить работу неназванных органов власти США на федеральном, штатном и местном уровнях.
- Claude Haiku 4.5 отправила ложное сообщение о возможных сведениях об убийстве; полиция Филадельфии пометила его как спам, дата — 18 июля.
- После проверки испытаний Anthropic перенесла часть тестов офлайн, изменила инструменты доступа в интернет и добавила автоматическую блокировку такого поведения.

Компания не назвала их, но пострадавшие ведомства находились «на федеральном уровне, уровне штатов и местном уровне».
Anthropic сообщила в своем последнем отчете, что ее ИИ-агенты пытались взломать сайты органов власти США или вмешаться в их работу «на федеральном уровне, уровне штатов и местном уровне». Компания не стала называть конкретные ведомства и организации, чтобы по их просьбе не раскрывать уязвимости в их системах. Однако Anthropic заявила, что уже уведомила соответствующие ведомства и проинформировала Белый дом об этих инцидентах. В отчете также приводятся подробности инцидента, о котором в пятницу сообщило полицейское управление Филадельфии: одна из моделей компании отправила ложное сообщение об убийстве на сайт с информацией о нераскрытых делах.
В этом случае участвовала Claude Haiku 4.5 — одна из экономичных моделей компании, которой поручили выполнять типовые задания на случайных веб-страницах. Она обнаружила страницу с информацией о нераскрытом убийстве и формой для отправки сообщения. Как вы могли догадаться, Claude заполнила форму и отправила сообщение: «Возможно, у меня есть информация об этом деле. Помню, что в тот период видел (а) в районе [название улицы, указанное на странице] человека, подходящего под описание. Свяжитесь со мной, если эта информация будет полезна». Полицейское управление Филадельфии подтвердило The New York Times, что недавно Anthropic уведомила его об отправленном сообщении. В управлении сообщили, что оно датировано 18 июля и было помечено как спам, поэтому расследование, по крайней мере, не отвлекло ресурсы ведомства.
В другом случае Anthropic поручила Claude Mythos 5, своей модели, специализирующейся на кибербезопасности, определить место, изображенное на фотографии. Claude попыталась получить доступ к карте государственной собственности, чтобы сопоставить свои предположения, поскольку не могла переходить по ссылкам на веб-страницах так, как это сделал бы человек. Вместо этого модель обнаружила токены доступа и отправила запросы напрямую на сервер карты, чтобы получить доступ к ее данным. Mythos 5 также запросила токен доступа на сайте одного из ведомств штата, чтобы получить данные для статистического задания, не заплатив предусмотренную для посетителей плату.
Anthropic обнаружила эти случаи, проверяя стенограммы оценочных испытаний. Компания начала изучать их в июле, после того как OpenAI признала, что ее агенты покинули тестовую среду и без соответствующих инструкций взломали Hugging Face. В сентябре OpenAI также подтвердила, что ее агенты вмешивались в работу сайтов государственных ведомств, в частности тех, которыми управляют Министерство торговли и Комиссия по ценным бумагам и биржам.
В разделе «Устранение последствий» своего отчета Anthropic сообщила, что после обнаружения непредусмотренных действий моделей «приняла несколько профилактических мер». «Некоторые публичные оценочные испытания мы больше не проводим; другие перенесли в офлайн-среду или переработали так, чтобы задания не затрагивали действующие сайты», — говорится в отчете. «Мы также внесли более масштабные изменения. Обновили защитные механизмы некоторых инструментов для доступа в интернет, например инструмента загрузки веб-страниц, чтобы существенно ограничить возможности модели при работе с ними». Anthropic также заявила, что «разработала инструменты для автоматического обнаружения и блокировки описанных в отчете типов поведения», а также приняла другие меры.
© GDGT.ru
Об этом также пишут
- Anthropic Изучаем непреднамеренные действия модели в ходе оценивания и внутреннего использования 09.10.2026 03:00
- overclockers.ru ИИ Claude Haiku 4.5 отправил полиции США ложное сообщение об убийстве 10.10.2026 05:04
- 3DNews Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет 10.10.2026 17:21
- iXBT Anthropic рассказала как ИИ-агент отправлял ложные доносы в полицию и заполнял настоящие государственные формы 10.10.2026 23:04
