Обнаружение и предотвращение атак дистилляции
Мы выявили масштабные кампании трех лабораторий искусственного интеллекта — DeepSeek, Moonshot и MiniMax — направленные на незаконное извлечение возможностей Claude для улучшения их собственных моделей. Эти лаборатории сгенерировали более 16 миллионов запросов к Claude примерно через 24 000 мошеннических учетных записей, что является нарушением наших условий обслуживания и региональных ограничений на доступ.
Эти лаборатории использовали метод, называемый «дистилляцией», который заключается в обучении менее мощной модели на результатах работы более сильной. Дистилляция — это широко используемый и легитимный метод обучения. Например, ведущие лаборатории ИИ регулярно дистиллируют собственные модели, чтобы создавать для своих клиентов более мелкие и дешевые версии. Но дистилляция также может использоваться в незаконных целях: конкуренты могут применять ее для получения мощных возможностей от других лабораторий за малую долю времени и затрат, которые потребовались бы для их самостоятельной разработки.
Интенсивность и изощренность этих кампаний растут. Время на принятие мер ограничено, и угроза выходит за рамки какой-либо одной компании или региона. Борьба с ней потребует быстрых и скоординированных действий между игроками отрасли, политиками и мировым ИИ-сообществом.
Почему дистилляция имеет значение
Незаконно дистиллированные модели лишены необходимых средств защиты, что создает серьезные риски для национальной безопасности. Anthropic и другие американские компании создают системы, которые препятствуют использованию ИИ государственными и негосударственными акторами для, например, разработки биологического оружия или проведения вредоносных киберопераций. Модели, созданные путем незаконной дистилляции, вряд ли сохранят эти защитные механизмы, а это значит, что опасные возможности могут распространяться при полном удалении многих средств защиты.
Иностранные лаборатории, дистиллирующие американские модели, могут затем внедрять эти незащищенные возможности в военные, разведывательные и надзорные системы, позволяя авторитарным правительствам развертывать передовой ИИ для наступательных киберопераций, дезинформационных кампаний и массовой слежки. Если дистиллированные модели публикуются в открытом доступе, этот риск многократно возрастает, поскольку такие возможности свободно распространяются вне контроля какого-либо отдельного правительства.
Атаки дистилляции и экспортный контроль
Anthropic последовательно поддерживает меры экспортного контроля, помогающие сохранять лидерство Америки в сфере ИИ. Атаки дистилляции подрывают эти меры контроля, позволяя иностранным лабораториям, в том числе находящимся под контролем Коммунистической партии Китая, другими способами сокращать конкурентное преимущество, для сохранения которого и предназначен экспортный контроль.
Из-за отсутствия прозрачности в отношении этих атак, кажущиеся быстрые успехи этих лабораторий ошибочно воспринимаются как доказательство неэффективности экспортного контроля и того, что его можно обойти за счет инноваций. На самом деле эти достижения в значительной степени зависят от возможностей, извлеченных из американских моделей, а проведение такого извлечения в больших масштабах требует доступа к современным чипам. Таким образом, атаки дистилляции подтверждают обоснованность экспортного контроля: ограниченный доступ к чипам ограничивает как прямое обучение моделей, так и масштабы незаконной дистилляции.
Что мы обнаружили
Три описанные ниже кампании дистилляции следовали схожему сценарию, используя мошеннические учетные записи и прокси-сервисы для массового доступа к Claude с обходом обнаружения. Объем, структура и направленность промптов отличались от нормальных паттернов использования, отражая целенаправленное извлечение возможностей, а не легитимное применение.
Мы со средней уверенностью связали каждую кампанию с конкретной лабораторией благодаря корреляции IP-адресов, метаданным запросов, инфраструктурным индикаторам, а в некоторых случаях — подтверждениям от партнеров по отрасли, которые наблюдали те же действия и поведение на своих платформах. Каждая кампания была нацелена на наиболее уникальные возможности Claude: агентное рассуждение, использование инструментов и написание кода.
DeepSeek
Масштаб: более 150 000 запросов
Целями операции были:
- Возможности рассуждения для решения различных задач
- Задачи оценивания на основе критериев, в рамках которых Claude выполнял роль модели вознаграждения для обучения с подкреплением
- Создание устойчивых к цензуре альтернатив для политически чувствительных запросов
DeepSeek генерировала синхронизированный трафик с разных аккаунтов. Идентичные паттерны, общие способы оплаты и скоординированные тайминги указывали на «балансировку нагрузки» с целью увеличения пропускной способности, повышения надежности и избежания обнаружения.
В рамках одного из примечательных методов их промпты просили Claude представить и сформулировать внутренние рассуждения, лежащие в основе уже готового ответа, и описать их шаг за шагом — фактически генерируя обучающие данные цепочки рассуждений в больших масштабах. Мы также зафиксировали задачи, в которых Claude использовался для генерации защищенных от цензуры альтернатив для политически чувствительных тем, таких как вопросы о диссидентах, партийных лидерах или авторитаризме, вероятно, для обучения собственных моделей DeepSeek уводить разговоры от цензурируемых тем. Изучив метаданные запросов, мы смогли отследить эти учетные записи до конкретных исследователей в лаборатории.
Moonshot AI
Масштаб: более 3,4 миллиона запросов
Целями операции были:
- Агентное рассуждение и использование инструментов
- Написание кода и анализ данных
- Разработка агентов для работы с компьютером
- Компьютерное зрение
Moonshot (модели Kimi) задействовала сотни мошеннических аккаунтов, охватывающих множество путей доступа. Разнообразие типов учетных записей затрудняло обнаружение кампании как скоординированной операции. Мы атрибутировали кампанию по метаданным запросов, которые совпадали с публичными профилями руководства Moonshot. На более позднем этапе Moonshot использовала более целенаправленный подход, пытаясь извлечь и реконструировать цепочки рассуждений Claude.
MiniMax
Масштаб: более 13 миллионов запросов
Целями операции были:
- Агентное программирование
- Использование инструментов и оркестрация
Мы связали кампанию с MiniMax на основе метаданных запросов и инфраструктурных индикаторов, а также подтвердили временные рамки, сопоставив их с их публичной дорожной картой продуктов. Мы обнаружили эту кампанию, пока она еще была активна — до того, как MiniMax выпустила обучаемую ей модель, — что дало нам беспрецедентную видимость жизненного цикла атак дистилляции: от генерации данных до запуска модели. Когда мы выпустили новую модель во время активной кампании MiniMax, они перестроились в течение 24 часов, перенаправив почти половину своего трафика на перехват возможностей нашей новейшей системы.
Как «дистилляторы» получают доступ к передовым моделям
Из соображений национальной безопасности Anthropic в настоящее время не предоставляет коммерческий доступ к Claude в Китае или дочерним компаниям предприятий из не поддерживаемых регионов, находящимся за пределами этой страны.
Чтобы обойти это, лаборатории используют коммерческие прокси-сервисы, которые перепродают в больших масштабах доступ к Claude и другим передовым моделям ИИ. Эти сервисы используют архитектуры, которые мы называем «кластерами гидры»: разветвленные сети мошеннических аккаунтов, распределяющие трафик как по нашему API, так и по сторонним облачным платформам. Широта таких сетей означает отсутствие единых точек отказа. Когда один аккаунт блокируется, на его место приходит новый. В одном случае единая прокси-сеть одновременно управляла более чем 20 000 мошеннических аккаунтов, смешивая трафик дистилляции с запросами обычных клиентов, чтобы затруднить обнаружение.
Получив доступ, лаборатории генерируют большие объемы тщательно составленных промптов, предназначенных для извлечения конкретных возможностей модели. Цель состоит либо в сборе высококачественных ответов для прямого обучения модели, либо в генерации десятков тысяч уникальных задач, необходимых для запуска обучения с подкреплением. То, что отличает атаку дистилляции от обычного использования, — это паттерн. Промпт вроде следующего (который приближен к аналогичным запросам, использовавшимся повторяемо и в больших масштабах) сам по себе может показаться безобидным:
Вы — эксперт по анализу данных, сочетающий статистическую строгость с глубокими предметными знаниями. Ваша цель — предоставлять основанные на данных инсайты —, а не резюме или визуализации, — опирающиеся на реальные данные и подкрепленные полными и прозрачными рассуждениями.
Но когда вариации этого промпта поступают десятками тысяч с сотен скоординированных учетных записей, и все они нацелены на одну и ту же узкую способность, паттерн становится очевидным. Огромный объем, сконцентрированный в нескольких областях, высоко повторяющиеся структуры и контент, напрямую отражающий то, что наиболее ценно для обучения ИИ-модели, являются отличительными признаками атаки дистилляции.
Как мы реагируем
Мы продолжаем активно инвестировать в средства защиты, которые делают подобные атаки дистилляции более сложными для реализации и более простыми для обнаружения. К ним относятся:
- Обнаружение. Мы создали несколько классификаторов и систем поведенческого фингерпринтинга, предназначенных для выявления паттернов атак дистилляции в API-трафике. Сюда входит обнаружение извлечения цепочки рассуждений, используемой для создания обучающих данных для логического выводов. Мы также разработали инструменты обнаружения для выявления скоординированной активности в большом количестве аккаунтов.
- Обмен разведывательными данными. Мы делимся техническими индикаторами с другими ИИ-лабораториями, облачными провайдерами и соответствующими ведомствами. Это обеспечивает более целостное представление о ландшафте дистилляции.
- Контроль доступа. Мы усилили верификацию для образовательных аккаунтов, программ исследований в области безопасности и стартапов — путей, которые наиболее часто используются для создания мошеннических учетных записей.
- Контрмеры. Мы разрабатываем средства защиты на уровне продуктов, API и моделей, призванные снизить эффективность результатов работы моделей для незаконной дистилляции без ущерба для опыта легитимных клиентов.
Но ни одна компания не может справиться с этим в одиночку. Как отмечалось выше, атаки дистилляции такого масштаба требуют скоординированного ответа всей индустрии ИИ, облачных провайдеров и регуляторов. Мы публикуем эту информацию, чтобы сделать доказательства доступными для всех заинтересованных сторон.
Полный текст статьи читайте на Anthropic
