Наша концепция разработки безопасных и надежных агентов
Самые популярные ИИ-инструменты сегодня — это ассистенты, которые отвечают на конкретные вопросы или запросы. Но сейчас мы наблюдаем появление ИИ-агентов, которые автономно выполняют задачи при постановке определенной цели. Представьте себе агента как виртуального помощника, способного самостоятельно вести сложные проекты от начала и до конца, пока вы сосредоточены на других приоритетах.
Агенты самостоятельно управляют своими процессами и использованием инструментов, сохраняя контроль над выполнением задач при минимальном участии человека. Если попросить агента «помочь организовать мою свадьбу», он может самостоятельно заняться поиском площадок и подрядчиков, сравнить цены и доступность, а также составить подробные графики и бюджеты. Или, если попросить его «подготовить презентацию для совета директоров моей компании», он может найти в вашем подключенном Google Диске релевантные отчеты о продажах и финансовые документы, извлечь ключевые показатели из нескольких электронных таблиц и подготовить отчет.
В прошлом году мы представили Claude Code — агента, способного автономно писать, отлаживать и редактировать код, который широко используется разработчиками программного обеспечения. Многие компании также создают собственных агентов на базе наших моделей. Компания по кибербезопасности Trellix использует Claude для триажа и расследования инцидентов безопасности. А компания финансовых услуг Block создала агента, который позволяет сотрудникам, не имеющим технической подготовки, получать доступ к своим системам данных с помощью естественного языка, экономя время разработчиков.
Принципы создания надежных агентов
Стремительное внедрение агентов делает критически важным, чтобы такие разработчики, как Anthropic, создавали безопасные, надежные и заслуживающие доверия системы. Сегодня мы представляем предварительную концепцию ответственной разработки агентов. Мы надеемся, что эта концепция поможет сформировать зарождающиеся стандарты, предложит гибкие рекомендации для различных контекстов и внесет свой вклад в создание экосистемы, в которой агенты соответствуют общечеловеческим ценностям.
При разработке агентов мы стремимся придерживаться следующих принципов:

Сохранение контроля за человеком при обеспечении автономности агента
Центральное противоречие в проектировании агентов заключается в балансе между их автономностью и надзором со стороны человека. Агенты должны уметь работать самостоятельно — именно их независимая работа делает их ценными. Но люди должны сохранять контроль над тем, как достигаются их цели, особенно перед принятием важных решений. Например, агент, помогающий управлять расходами, может обнаружить, что компания тратит слишком много на подписки на программное обеспечение. Прежде чем он начнет отменять подписки или понижать уровень обслуживания, компании, скорее всего, потребуется одобрение человека.
В Claude Code люди могут в любой момент остановить Claude и перенаправить его действия. По умолчанию у него есть только права на чтение, что означает возможность анализировать и просматривать информацию в каталоге, где он запущен, без запроса одобрения у человека, но он обязан запросить одобрение перед выполнением любых действий, изменяющих код или системы. Пользователи могут предоставить постоянные разрешения для рутинных задач, которые они доверяют выполнять Claude.
По мере того как агенты будут становиться все более мощными и распространенными, нам понадобятся еще более надежные технические решения и интуитивно понятные элементы управления для пользователей. Правильный баланс между автономностью и надзором существенно различается в разных сценариях и, вероятно, включает в себя комбинацию встроенных и настраиваемых функций контроля.
Прозрачность поведения агента
Людям необходима видимость процессов решения проблем агентами. Без прозрачности человек, попросивший агента «снизить отток клиентов», может быть озадачен, когда агент начнет связываться с хозяйственным отделом по поводу планировки офиса. Но при хорошем дизайне прозрачности агент может объяснить свою логику: «Я обнаружил, что у клиентов, закрепленных за менеджерами по продажам в шумной зоне открытого офиса, показатель оттока на 40% выше, поэтому я запрашиваю оценку шума на рабочем месте и предлагаю перестановку столов для улучшения качества звонков». Это также дает возможность направить агентов в правильное русло, проверив их данные или убедившись, что они используют наиболее релевантные источники.
В Claude Code запланированные действия отображаются в чек-листе задач в реальном времени, и пользователи могут в любой момент вмешаться, чтобы задать вопросы или скорректировать рабочий план Claude. Задача заключается в том, чтобы найти правильный уровень детализации. Слишком мало информации не позволяет людям оценить, движется ли агент к своей цели. Слишком много — может перегрузить их нерелевантными деталями. Мы стараемся найти золотую середину, но нам потребуется и дальше дорабатывать этот аспект.
Чек-лист задач Claude Code, который пользователи могут видеть в режиме реального времени
Согласование агентов с человеческими ценностями и ожиданиями
Агенты не всегда действуют так, как задумывали люди. Наше исследование показало, что когда системы искусственного интеллекта преследуют цели автономно, они иногда могут предпринимать действия, которые кажутся разумными самой системе, но не соответствуют тому, чего на самом деле хотели люди. Если человек просит агента «упорядочить мои файлы», агент может автоматически удалить то, что он считает дубликатами, и переместить файлы в новую структуру папок — выйдя далеко за рамки простой организации и полностью перестроив систему пользователя. Хотя это проистекает из стремления агента быть полезным, это демонстрирует, что агентам может не хватать контекста для правильных действий, даже когда их цели совпадают.
Еще большую тревогу вызывают случаи, когда агенты преследуют цели способами, которые активно противоречат интересам пользователей. Наше тестирование экстремальных сценариев показало, что когда системы ИИ преследуют цели автономно, они иногда могут предпринимать действия, которые кажутся разумными самой системе, но нарушают то, чего на самом деле хотели люди. Пользователи также могут непреднамеренно формулировать запросы к агентам так, что это приводит к непредвиденным результатам.
Создание надежных метрик соответствия ценностей агентов представляет собой сложную задачу. Трудно одновременно оценивать как вредоносные, так и доброкачественные причины проблемы. Но мы активно ищем пути решения этой проблемы. До тех пор пока мы их не найдем, упомянутые выше принципы прозрачности и контроля будут иметь особое значение.
Защита конфиденциальности при длительных взаимодействиях
Агенты могут сохранять информацию между различными задачами и взаимодействиями. Это создает ряд потенциальных проблем с конфиденциальностью. Агенты могут ненадлежащим образом переносить конфиденциальную информацию из одного контекста в другой. Например, агент может узнать о секретных внутренних решениях одного отдела, помогая с организационным планированием, а затем непреднамеренно упомянуть эту информацию при оказании помощи другому отделу, раскрыв конфиденциальные вопросы, которые должны оставаться изолированными.
Инструменты и процессы, используемые агентами, также должны быть разработаны с учетом надлежащих средств защиты конфиденциальности и контроля. Созданный нами с открытым исходным кодом протокол контекста модели (Model Context Protocol, MCP), который позволяет Claude подключаться к другим сервисам, включает элементы управления, позволяющие пользователям разрешать или запрещать Claude доступ к определенным инструментам и процессам (или тому, что мы называем «коннекторами») в рамках конкретной задачи. При внедрении MCP мы добавили дополнительные средства контроля, такие как возможность предоставления однократного или постоянного доступа к информации. Администраторы предприятий также могут настраивать, к каким коннекторам могут подключаться пользователи в их организациях. Мы продолжаем изучать возможности совершенствования наших инструментов защиты конфиденциальности.
Мы также описали шаги, которые должны предпринять наши клиенты для защиты своих данных с помощью таких мер, как права доступа, аутентификация и сегментация данных.
Обеспечение безопасности взаимодействия агентов
Системы агентов должны быть спроектированы так, чтобы защищать конфиденциальные данные и предотвращать злоупотребления при взаимодействии с другими системами или агентами. Поскольку перед агентами поставлены задачи по достижению конкретных целей, злоумышленники могут обмануть агента, заставив его игнорировать исходные инструкции, раскрывать несанкционированную информацию или выполнять непреднамеренные действия, представив это как необходимое для достижения целей агента (также известное как «инъекция промптов» / prompt injection). Либо злоумышленники могут воспользоваться уязвимостями в инструментах или субагентах, используемых агентами.
Claude уже использует систему классификаторов для обнаружения злоумышленников и защиты от них, таких как инъекции промптов, в дополнение к нескольким другим уровням безопасности. Наша команда аналитики угроз проводит постоянный мониторинг для оценки и смягчения последствий новых или возникающих форм вредоносного поведения. Кроме того, мы предоставляем рекомендации о том, как организации, использующие Claude, могут еще больше снизить эти риски. Инструменты, добавляемые в наш каталог MCP, проверенный Anthropic, должны соответствовать нашим стандартам безопасности, надежности и совместимости.
Когда мы обнаруживаем новое вредоносное поведение или уязвимости с помощью нашего мониторинга и исследований, мы стремимся оперативно устранять их и постоянно совершенствовать наши меры безопасности, чтобы опережать эволюционирующие угрозы.
Дальнейшие шаги
Поскольку мы продолжаем разрабатывать и совершенствовать наших агентов, мы ожидаем, что наше понимание их рисков и компромиссов также будет развиваться. Со временем мы планируем пересматривать и обновлять эту концепцию, чтобы отразить наше видение лучших практик.
Эти принципы будут определять нашу текущую и будущую работу по разработке агентов, и мы с нетерпением ждем возможности сотрудничать с другими компаниями и организациями в этой области. Агенты обладают огромным потенциалом для оказания позитивного влияния на работу, образование, здравоохранение и научные открытия. Вот почему так важно гарантировать их создание в соответствии с самыми высокими стандартами.
Полный текст статьи читайте на Anthropic
