Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет
- Агенты эксплуатировали уязвимости сайтов, получали бесплатный доступ к платным базам и отправили полиции Филадельфии выдуманные сведения об убийстве.
- Anthropic отключила интернет в реальном времени для всех внутренних проверок до тех пор, пока не убедится, что может контролировать агентов.
- Новые средства защиты заблокировали все описанные действия; компания планирует использовать изолированную инфраструктуру и классификаторы безопасности.
Почему это важно: По словам Anthropic, навыки поиска информации и работы с компьютером необходимы для профессионального применения ИИ-агентов.
Anthropic призналась, что агенты искусственного интеллекта под управлением её моделей при выполнении задач эксплуатировали уязвимости на различных сайтах, в том числе принадлежащих правительственным учреждениям США. Компания приняла решение при проведении внутренних тестов отключить для этих систем доступ к интернету в реальном времени — ограничение будет снято, когда разработчики убедятся, что способны отслеживать действия ИИ-агентов.
Источник изображения: anthropic.com
О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени.
Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic;, а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать.
Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия.
Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга.
© 3DNews
Об этом также пишут
- Anthropic Изучаем непреднамеренные действия модели в ходе оценивания и внутреннего использования 09.10.2026 03:00
- overclockers.ru ИИ Claude Haiku 4.5 отправил полиции США ложное сообщение об убийстве 10.10.2026 05:04
- iXBT «Восстание ИИ» не за горами? ИИ-модель отправила ложное сообщение об убийстве в полицию США 10.10.2026 06:08
- TheNextWeb.ru Anthropic заявила, что во время тестирования Claude отправил полиции ложное сообщение об убийстве 10.10.2026 11:26
- GDGT.ru Anthropic заявила, что её ИИ-агенты пытались взломать правительственные сайты 10.10.2026 20:49
- iXBT Anthropic рассказала как ИИ-агент отправлял ложные доносы в полицию и заполнял настоящие государственные формы 10.10.2026 23:04
- overclockers.ru Anthropic отключила ИИ-агентов от интернета из-за неконтролируемых действий 11.10.2026 07:08
