Обнаружение и пресечение злонамеренного использования Claude: март 2025 г.

Мы стремимся предотвращать неправомерное использование наших моделей Claude злоумышленниками, сохраняя при этом их полезность для легитимных пользователей. Хотя наши меры безопасности успешно предотвращают множество вредоносных результатов работы, субъекты угроз продолжают искать способы обхода этой защиты. Мы постоянно используем полученный опыт для модернизации наших защитных механизмов.
В этом отчете описывается несколько тематических исследований, посвященных тому, как злоумышленники использовали наши модели в неблаговидных целях, а также шагам, которые мы предприняли для обнаружения и пресечения такого использования. Делясь этими выводами, мы надеемся обеспечить безопасность наших пользователей, предотвратить злоупотребления или неправомерное использование наших сервисов, обеспечить соблюдение нашей Политики использования и других условий, а также поделиться опытом на благо более широкой онлайн-экосистемы. Представленные в этом отчете тематические исследования, несмотря на свою специфичность, отражают более широкие тенденции, наблюдаемые в наших системах мониторинга. Эти примеры были выбраны потому, что они наглядно иллюстрируют возникающие тенденции в том, как злоумышленники адаптируют и используют передовые модели ИИ. Мы надеемся внести свой вклад в более глубокое понимание меняющегося ландшафта угроз и помочь более широкой экосистеме искусственного интеллекта разработать более надежные средства защиты.
Самым новаторским случаем неправомерного использования была профессиональная операция «влияние как услуга», демонстрирующая явную эволюцию того, как определенные субъекты используют языковые модели (LLM) для кампаний по оказанию влияния. Особенно ново то, что в этой операции Claude использовался не только для генерации контента, но и для принятия решений о том, когда бот-аккаунты в социальных сетях будут комментировать, ставить лайки или репостить публикации реальных пользователей соцсетей. Как описано в полном отчете, Claude использовался в качестве оркестратора, принимающего решения о том, какие действия должны предпринять бот-аккаунты в социальных сетях на основе политически мотивированных персон. Прочитать полный отчет можно здесь.
Мы также зафиксировали случаи атак методом подбора учетных данных (credential stuffing), кампаний по мошенничеству при найме на работу, а также использование неопытным злоумышленником искусственного интеллекта для расширения своих технических возможностей по генерации вредоносного ПО сверх своего уровня навыков, помимо прочей деятельности, не упомянутой в этом блоге. Последствия этой деятельности различны:
- Операция «влияние как услуга» использовала Claude для автоматизации операций и задействовала десятки тысяч подлинных аккаунтов в социальных сетях в разных странах и на разных языках.
- Один из злоумышленников задействовал Claude для улучшения систем идентификации и обработки раскрытых имен пользователей и паролей, связанных с камерами видеонаблюдения, одновременно собирая информацию об уязвимых для интернета целях для проверки этих учетных данных. Мы не подтвердили успешное развертывание этих усилий.
- В рамках кампании по мошенничеству при найме на работу Claude использовался для улучшения содержания мошеннических рассылок, нацеленных на соискателей в странах Восточной Европы. Мы не подтвердили успешное развертывание этих усилий.
- Отдельный злоумышленник с ограниченными техническими навыками разработал вредоносное ПО, для создания которого обычно требуется более высокий уровень квалификации. Мы не подтвердили успешное развертывание этих усилий.
Ключевые выводы, сделанные нами:
- Пользователи начинают использовать передовые модели для полуавтономной оркестровки сложных систем злоупотреблений, включающих множество ботов в социальных сетях. По мере совершенствования агентных систем ИИ мы ожидаем продолжения этой тенденции.
- Генеративный ИИ может ускорить развитие возможностей менее изощренных злоумышленников, потенциально позволяя им действовать на уровне, ранее доступном только более технически подкованным лицам.
Наша программа аналитики призвана служить защитной сеткой: она как находит вредоносные действия, пропущенные нашей стандартной системой обнаружения масштабируемых угроз, так и добавляет контекст в отношении того, как злоумышленники используют наши модели в злонамеренных целях. При расследовании этих случаев наша команда применяла методы, описанные в наших недавно опубликованных исследовательских работах, включая Clio и иерархическую суммаризацию. Эти подходы позволили нам эффективно анализировать большие объемы данных разговоров для выявления паттернов неправомерного использования. Эти методы в сочетании с классификаторами (которые анализируют пользовательские вводы на предмет потенциально вредоносных запросов и оценивают ответы Claude до или после их отправки) позволили нам обнаруживать, расследовать и блокировать учетные записи, связанные с этими инцидентами.
Приведенные ниже тематические исследования подчеркивают типы угроз, которые мы обнаружили, и дают представление о том, как субъекты угроз адаптируют свои операции для использования генеративного ИИ.
Тематическое исследование: Управление сетями влияния для нескольких клиентов на разных платформах [полный отчет доступен здесь]
Мы выявили и заблокировали злоумышленника, использующего Claude для финансово мотивированной операции «влияние как услуга». Инфраструктура этого субъекта использовала Claude для оркестровки более чем сотни бот-аккаунтов в социальных сетях с целью продвижения политических нарративов своих клиентов. Эти политические нарративы согласуются с тем, чего мы ожидали от аффилированных с государствами кампаний, однако мы не подтвердили эту атрибуцию. Самое главное, что операция использовала Claude для принятия тактических решений о вовлечении, таких как определение того, должны ли бот-аккаунты в социальных сетях ставить лайки, делиться, комментировать или игнорировать определенные сообщения, созданные другими аккаунтами, на основе политических целей, соответствующих интересам их клиентов.
Профиль злоумышленника: Эта операция управляла более чем 100 бот-аккаунтами в социальных сетях в Twitter/X и Facebook. Оператор создал для каждого аккаунта персоны с четкой политической ориентацией и взаимодействовал с десятками тысяч подлинных учетных записей в социальных сетях. Активность этой операции указывает на коммерческий сервис, который обслуживал клиентов из нескольких стран с различными политическими целями.
Тактика и методы: Операция использовала Claude для различных целей:
- Создание и поддержание последовательных персон на разных платформах с определенной политической ориентацией.
- Определение того, когда персонам следует ставить лайки, делиться, комментировать или игнорировать определенный контент.
- Генерация ответов в соответствии с политической линией на подходящих языках.
- Создание подсказок (промптов) для инструментов генерации изображений и оценка их результатов.
Злоумышленник поддерживал отдельные портфели нарративов для разных клиентов, все они находились за пределами США и преследовали различные политические цели, которые они стремились продвигать.
Воздействие: Операция затронула десятки тысяч подлинных аккаунтов в социальных сетях. Никакой контент не приобрел вирусный статус, однако злоумышленник стратегически сосредоточился на долгосрочном вовлечении, пропагандирующем умеренные политические взгляды, а не на достижении вирусности.
Тематическое исследование: Сбор утечек учетных данных, связанных с камерами видеонаблюдения Интернета вещей.
Мы выявили и заблокировали изощренного злоумышленника, использовавшего наши модели при попытке разработать возможности для сбора утечек паролей и имен пользователей, связанных с камерами видеонаблюдения, а также создания инструментов для принудительного получения доступа к этим камерам. Выявив такое использование, мы заблокировали учетную запись, связанную с созданием этих возможностей. Хотя это и было целью злоумышленника, мы не знаем, удалось ли им в конечном итоге успешно развернуть эту способность.
Профиль злоумышленника: Этот злоумышленник продемонстрировал развитые навыки разработки и поддерживал инфраструктуру, объединяющую несколько источников разведывательных данных, включая коммерческие платформы данных об утечках и интеграцию с частными сообществами логов стиллеров.
Тактика и методы: Злоумышленник в основном использовал Claude для расширения своих технических возможностей:
- Переписывание своего инструментария для скрапинга с открытым исходным кодом для упрощения обслуживания.
- Создание скриптов для сбора целевых URL-адресов с веб-сайтов.
- Разработка систем для обработки сообщений из Telegram-сообществ, публикующих логи стиллеров.
- Улучшение пользовательского интерфейса (UI) и бэкенд-систем для расширения возможностей поиска.
Некоторые из этих методов имеют двойное назначение. Фактически, добросовестный пользователь может применять их в законных целях, однако важно рассматривать полный контекст активности, который в данном случае заключался в обеспечении несанкционированного доступа к устройствам.
Воздействие: Потенциальные последствия деятельности этой группы включают компрометацию учетных данных, несанкционированный доступ к устройствам IoT (особенно камерам безопасности) и проникновение в сеть. Мы не подтвердили успешное практическое развертывание этой возможности в реальных условиях.
Тематическое исследование: Кампания по мошенничеству при найме: очистка текста на лету для обмана
Мы выявили и заблокировали злоумышленника, занимавшегося мошенничеством при найме на работу, нацеленным на соискателей преимущественно в странах Восточной Европы. Эта кампания демонстрирует, как субъекты угроз используют ИИ для очистки и улучшения языка в реальном времени, чтобы сделать свои мошеннические схемы более убедительными.
Профиль злоумышленника: Эта операция продемонстрировала умеренно изощренные методы социальной инженерии, имитируя менеджеров по найму из легитимных компаний для создания видимости надежности.
Тактика и методы: Злоумышленник использовал Claude в основном для совершенствования своих мошеннических коммуникаций:
- Запросы на улучшение языка для повышения профессионализма общения.
- Разработка более убедительных нарративов о найме.
- Создание вопросов и сценариев для собеседований.
- Форматирование сообщений так, чтобы они выглядели более легитимными.
В одном из примечательных паттернов операторы отправляли плохо написанный текст на неродном английском языке и просили Claude отредактировать его так, будто он написан носителем английского языка — фактически «отмывая» свои сообщения, чтобы они выглядели более гладкими. Такая очистка языка в реальном времени повышает воспринимаемую легитимность их коммуникаций.
Воздействие: Хотя операция пыталась заполучить личную информацию соискателей работы, мы не подтвердили успешных случаев мошенничества в результате этой деятельности.
Тематическое исследование: Начинающий злоумышленник получил возможность создавать вредоносное ПО
Мы выявили и заблокировали начинающего злоумышленника, который использовал Claude для улучшения своих технических навыков и разработки вредоносных инструментов за пределами своего реального уровня квалификации.
Профиль злоумышленника: Этот злоумышленник продемонстрировал ограниченные формальные навыки кодирования, но использовал ИИ для быстрого расширения своих возможностей, разрабатывая инструменты для доксинга и удаленного доступа.
Техническая эволюция: Мы наблюдали, как этот злоумышленник с помощью Claude эволюционировал от простых скриптов до сложных систем.
- Его инструментарий с открытым исходным кодом превратился из базового функционала (вероятно, полученного в готовом виде) в продвинутый комплект, включающий распознавание лиц и сканирование даркнета.
- Его конструктор вредоносного ПО эволюционировал от простого генератора пакетных скриптов до комплексного графического интерфейса пользователя для генерации необнаруживаемых вредоносных полезных нагрузок с особым акцентом на обход средств защиты и поддержание постоянного доступа к скомпрометированным системам.
Воздействие: Этот случай иллюстрирует, как ИИ может потенциально сгладить кривую обучения для злоумышленников, позволяя людям с ограниченными техническими знаниями разрабатывать сложные инструменты и потенциально ускорять их переход от низкоуровневой активности к более серьезным киберпреступным деяниям. Мы не подтвердили реальное развертывание этого вредоносного ПО в реальном мире.
Следующие шаги
По мере того как мы продолжаем разрабатывать и внедрять мощные системы искусственного интеллекта, мы по-прежнему привержены предотвращению их неправомерного использования при сохранении их огромного потенциала для полезных приложений. Это требует постоянных инноваций в наших подходах к безопасности и тесного сотрудничества с более широким сообществом специалистов по безопасности и защите.
Во всех вышеупомянутых случаях мы заблокировали учетные записи, связанные с нарушающей правила деятельностью. Кроме того, мы постоянно совершенствуем методы обнаружения противников, использующих наши модели: каждый описанный случай злоупотребления вносит свой вклад в наш более широкий набор средств контроля для предотвращения и более быстрого обнаружения и пресечения противоправного применения наших моделей.
Мы надеемся, что этот отчет предоставит аналитические данные, которые наша индустрия, правительства и широкое исследовательское сообщество смогут использовать для укрепления коллективной защиты индустрии ИИ от злоупотреблений в Интернете.
Полный текст статьи читайте на Anthropic
