Повторный запуск Fable 5

  • Обновление

    Claude Fable 5 и Mythos 5 снова доступны

    1 июля 2026 г.

    Доступ к Claude Fable 5 и Mythos 5 восстановлен.

В пятницу, 12 июня, правительство США ввело экспортный контроль в отношении наших новейших моделей — Claude Fable 5 и Claude Mythos 5. Из-за этого мы были обязаны ограничить доступ для иностранных граждан как внутри США, так и за их пределами. Поскольку указ вступил в силу немедленно, а у нас не было надежного способа проверки гражданства в режиме реального времени, мы приостановили доступ к обеим моделям для всех пользователей.

По состоянию на сегодняшний день, 30 июня, экспортный контроль в отношении Fable 5 и Mythos 5 был снят.

Модель Fable 5 станет доступна начиная со завтрашнего дня, среды, 1 июля, для пользователей по всему миру на платформе Claude, в Claude.ai, Claude Code и Claude Cowork. Для планов Pro, Max, Team и отдельных тарифных планов Enterprise1 использование Fable 5 будет включено в объеме до 50% от недельных лимитов использования по 7 июля включительно, после чего модель станет доступна через кредиты использования. Мы вернем доступ на AWS, Google Cloud и Microsoft Foundry как можно быстрее.

Мы также восстановили доступ к Mythos 5 для определенного круга американских организаций после того, как правительство США одобрило это 26 июня. Мы продолжаем координировать свои действия с правительством с целью расширения доступа для более широкого круга отечественных и международных партнеров в рамках программы Glasswing.

В оставшейся части этой публикации мы приводим более подробную информацию и обновления по четырем направлениям:

  1. Хронология событий, включая изменения, внесенные в наши средства защиты. Мы обсуждаем события, приведшие к введению экспортного контроля, и то, как мы отреагировали на них с помощью новых мер безопасности.
  2. Наш общий подход к мерам безопасности. Мы предоставляем более подробный контекст о том, как мы используем классификаторы безопасности для обнаружения потенциально опасных сценариев использования наших моделей в сфере кибербезопасности.
  3. Единая отраслевая концепция. Хотя нам удалось достичь конструктивного решения, эти события со всей очевидностью показали, что отрасли необходим единый способ оценки и устранения потенциальных «взломов» («джейлбрейков») ИИ-моделей (методов, обходящих защитные механизмы модели).2 Общий стандарт оценки серьезности конкретного взлома помог бы разработчикам ИИ быстрее реагировать на новые угрозы по мере их возникновения, выпускать высокопроизводительные модели с повышенным уровнем безопасности, а также последовательно доносить информацию об уровне рисков до государственных и отраслевых партнеров. Совместно с Amazon, Microsoft, Google и другими партнерами по программе Glasswing мы начали разработку такой концепции и излагаем ее ниже.
  4. Более глубокое сотрудничество с правительством. Мы также укрепляем сотрудничество с правительством США в сфере предрелизного тестирования, обмена информацией и совместных исследований. О более тесном взаимодействии мы расскажем в финальном разделе.

Хронология и обновления средств защиты

Мы выпустили Fable 5 и Mythos 5 во вторник, 9 июня. Обе модели базируются на одной и той же базовой модели, однако Fable 5 была выпущена с мощными защитными механизмами для безопасного общего использования. Mythos 5, имеющая меньше ограничений, была передана лишь небольшому количеству доверенных партнеров в рамках проекта Project Glasswing для применения в сфере оборонной кибербезопасности.

Директива об экспортном контроле от 12 июня появилась после того, как правительству стало известно о докладе, в котором исследователи из Amazon обнаружили метод обхода защиты Fable 5: с помощью специальных промптов модель заставили выявить ряд уязвимостей в программном обеспечении. В одном из случаев модель сгенерировала код, демонстрирующий возможность эксплуатации соответствующей уязвимости. В течение последних двух недель мы тесно сотрудничали с правительством и другими партнерами, включая Amazon, для анализа этого отчета и собранных доказательств.

Наше тестирование подтвердило, что многие менее мощные модели — включая Claude Opus 4.8, GPT-5.5 и Kimi K2.7 — способны находить те же уязвимости, что и Fable 5 в упомянутом отчете. Что касается демонстрации эксплуатации конкретной уязвимости, то абсолютно каждая протестированная нами модель смогла воспроизвести тот же пример, что и Fable 5 (включая Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5 и Kimi K2.7).

Важно отметить, что описанная техника не раскрывала никаких уникальных кибервозможностей уровня Mythos. Данное поведение являлось пограничным случаем для системы защиты Fable 5: как мы поясним ниже, существуют задачи, которые вряд ли представляют опасность, но тем не менее блокируются средствами защиты из соображений перестраховки. Описанный метод позволил получить доступ к одному из таких типов поведения, однако он затрагивал лишь рутинную работу по обеспечению защитной кибербезопасности.

Тем не менее мы оперативно отреагировали на выявленный обход защиты. Тесно сотрудничая с правительством, мы обучили улучшенный классификатор безопасности, который нацелен на блокировку поведения, описанного в докладе. Пользователи будут получать уведомления в случае блокировки запроса к Fable 5, а сам запрос будет перенаправлен модели Opus 4.8.

Новый классификатор позволяет блокировать конкретный метод, описанный в отчете Amazon, более чем в 99% случаев. В крайне редких случаях модель может предоставить информацию, которая окажется недостаточно детальной для помощи злоумышленнику. Как мы отмечаем ниже, средства защиты модели не должны блокировать абсолютно все рутинные операции по обеспечению кибербезопасности с низким уровнем риска, а лишь те из них, которые потенциально вредны. Исследователи из Центра стандартов и инноваций в области искусственного интеллекта (CAISI) при Министерстве торговли США протестировали как наши прежние, так и новые средства защиты и подтвердили их чрезвычайную надежность.

С другой стороны, внедрение нового классификатора привело к тому, что доброжелательные запросы при выполнении рутинных задач по написанию кода и отладке стали чаще ошибочно классифицироваться как угроза. Как и в случае со всеми нашими средствами защиты, мы продолжим совершенствовать систему, чтобы лучше отличать реальные злонамеренные действия от легитимных запросов и снижать количество ложноположительных срабатываний.


Наш подход к средствам защиты в сфере кибербезопасности

Claude Mythos 5 способна находить и эксплуатировать уязвимости в программном обеспечении эффективнее любой другой модели, уступая лишь самым квалифицированным экспертам-людям в области безопасности. Столь выдающиеся возможности в кибернетической сфере делают ее исключительно привлекательной для злоумышленников, желающих использовать ее в кибератаках.

Однако Claude Fable 5 не обладает подобными уникальными наступательными возможностями.Это связано с тем, что мы выпустили ее с самыми мощными мерами предосторожности из всех, что мы когда-либо применяли к моделям. За месяц до релиза мы перевели сотрудников из различных подразделений Anthropic, чтобы вдвое увеличить число исследователей и инженеров, работающих над этой задачей.

Fable 5 была запущена с целым набором механизмов безопасности; каждый из них по отдельности не обеспечивает идеальной защиты, но в совокупности они делают злонамеренное использование модели крайне затруднительным (этот подход известен как «эшелонированная защита»). Некоторые защитные меры предполагают обучение модели отказу от помощи в опасных запросах, другие — ретроспективный анализ паттернов неправомерного использования.

Один из важнейших механизмов безопасности связан с классификаторами — небольшими автоматизированными ИИ-системами, которые во время диалога распознают, когда модель просят выполнить потенциально опасную задачу в области кибербезопасности (или когда она генерирует потенциально опасные результаты). В таких случаях классификаторы блокируют ответы модели на запросы. Конечная цель этих классификаторов — не допустить проявления моделью уникально опасных паттернов поведения.

Как и любые механизмы безопасности, классификаторы могут ошибаться. Иногда они не замечают потенциально опасный контент, а в некоторых случаях их удается намеренно «взломать»: пользователи могут сформулировать промпт необычным образом, чтобы обмануть классификаторы и заставить модель выдать опасный контент, который система должна была заблокировать.

Поэтому мы намеренно настраиваем классификаторы безопасности так, чтобы они срабатывали на ряд запросов, которые, как мы знаем, скорее всего, являются безвредными. Такой подход с использованием «запасного буфера безопасности» означает, что запрос должен выглядеть совершенно очевидно безопасным, чтобы не активировать классификатор (см. строку А на схеме ниже). Для пользователей этот буфер ощущается как отказ модели отвечать на некоторые вполне разумные и безвредные запросы.

Для Fable 5 мы сделали этот буфер безопасности значительно шире, чем при любом предыдущем запуске (строка Б), что означает блокировку гораздо большего числа доброжелательных запросов. Мы понимали, что подобные ложноположительные срабатывания будут расстраивать пользователей, но пошли на этот компромисс ради того, чтобы сделать остальные возможности модели широко доступными.

Иллюстрация работы наших классификаторов кибербезопасности.
Когда пользователь отправляет запрос к модели, классификаторы определяют, является ли он доброжелательным (и разрешенным) или потенциально опасным (и заблокированным). Классификаторы блокируют неоднозначные запросы (те, которые явно связаны с кибербезопасностью, но потенциально могут использоваться в защитных целях, например для поиска уязвимостей) и вредоносные запросы (очевидно опасные, такие как запрос на создание цепочки эксплойтов ПО). Как показано в строке А, мы также закладываем «буфер безопасности», в рамках которого классификатор блокирует запросы, вероятно, безвредные, но имеющие небольшой шанс оказаться опасными. Это повышает нашу уверенность в том, что все вредоносные запросы будут заблокированы. В случае с Fable 5 (строка Б) мы сделали этот буфер еще шире: это привело к блокировке большего числа безвредных запросов, но позволило не пропустить по-настоящему вредоносные. «Vulns» — уязвимости.

Запасной буфер также помогает смягчить последствия джейлбрейков. Многие взломы носят узкий характер: они разблокируют строго определенное поведение модели и ничего более. В некоторых случаях гипотетический пользователь может осуществить незначительный взлом модели и зайти в зону буфера безопасности (или иногда в область неоднозначно вредного поведения), но не дойти до базовых опасных паттернов поведения, которые мы стремимся пресекать (строка В ниже). По нашей оценке, описанные на данный момент взломы Fable 5 относятся именно к этой незначительной категории.

Более серьезные джейлбрейки открывают доступ к более опасным типам поведения. Узкие вредоносные взломы (строка Г) могут провоцировать определенные опасные действия. Подобные инциденты обычно имеют низкую или умеренную степень тяжести, поскольку их узкая направленность ограничивает злоумышленника. Наибольшую тревогу вызывает универсальный взлом (строка Д), который снимает ограничения с целого спектра опасных форм поведения.

Как взломы взаимодействуют с нашими классификаторами безопасности.
В случае незначительного джейлбрейка (строка В) классификаторы не блокируют запрос, однако он все еще находится в пределах нашего буфера безопасности (и, следовательно, крайне маловероятно, что он является вредоносным). При узком вредоносном взломе (строка Г) промпт преодолевает классификаторы и разблокирует конкретное опасное поведение модели. При универсальном взломе (строка Д) промпт открывает доступ к целому классу опасных форм поведения.

Как мы отмечали при запуске Fable 5, сделать любую ИИ-модель полностью неуязвимой (то есть невосприимчивой) к джейлбрейкам, по всей видимости, невозможно.3 Мы ожидаем, что для наших моделей будут находить те или иные взломы, и они будут различаться по степени серьезности: будет много незначительных взломов, несколько узких вредоносных, и хотя на момент написания статьи универсальных джейлбрейков для Fable 5 обнаружено не было, эксперты по безопасности продолжают проводить ее тестирование на проникновение (red-teaming). Наша цель заключается в том, чтобы мы и наши партнеры по безопасности первыми обнаруживали крупные взломы и устраняли их до того, как злоумышленники смогут использовать их во вред.

Описанный выше осмотрительный подход означает, что подавляющее большинство взломов не приведет к успешной разблокировке опасных функций. Наши классификаторы делают успешные джейлбрейки крайне затратными и трудоемкими в реализации, а даже если взлом удается, наши дополнительные уровни защиты обеспечивают дополнительное смягчение рисков. Мы продолжим обновлять наши классификаторы по мере получения информации о новых техниках обхода защиты.

Согласованная отраслевая концепция для оценки джейлбрейков

В настоящее время в индустрии искусственного интеллекта нет единого мнения о том, как описывать в объективных терминах степень серьезности взлома ИИ. Это порождает огромную неопределенность при обнаружении каждой новой техники джейлбрейка: у разработчиков нет общепринятого стандарта относительно того, на каких находках следует сосредоточиться в первую очередь, а у правительств — единого стандарта принятия мер.4

Эта проблема станет еще более острой в ближайшие месяцы, по мере того как будет проходить обучение, оценка и выпуск новых моделей с мощными возможностями в области кибербезопасности (и не только). Общий стандарт оценки джейлбрейков ИИ помог бы нам и другим компаниям безопасно запускать новые модели, а нашим пользователям — в полной мере использовать их продвинутые возможности.

Именно поэтому мы объединяемся с Amazon, Microsoft, Google и другими партнерами по Glasswing для разработки единой концепции оценки степени тяжести джейлбрейков ИИ и методов реагирования на них со стороны разработчиков. Мы приглашаем другие компании отрасли и поставщиков моделей присоединиться к нам в этой работе.

Наше текущее предложение заключается в оценке конкретного джейлбрейка по четырем различным критериям, приведенным ниже. Первые два описывают, что именно взлом дает злоумышленнику; последние два — то, как быстро этот взлом может превратиться в реальную проблему:

  1. Прирост возможностей. Насколько далеко за пределы существующих инструментов джейлбрейк продвигает пользователя? Если уже широко доступные инструменты (включая другие, более слабые модели ИИ) позволяют достичь тех же результатов, что и взломанная модель, оценка здесь будет низкой; если же взлом открывает возможности модели, способные значительно ускорить работу даже профильных экспертов, оценка будет высокой.
  2. Широта прироста возможностей. Для какого количества различных атакующих задач работает данный метод взлома? Случаи, когда джейлбрейк позволяет модели решать лишь узкие задачи, получат низкую оценку; случаи, когда один и тот же метод взлома эффективен для нескольких различных целей или атак, будут оценены высоко.
  3. Простота превращения в оружие. Сколько человеческих усилий требуется для превращения взлома в полноценную атаку? Если для этого требуется огромное количество специализированных подсказок (промптов) и множество попыток, оценка будет низкой; если взлом срабатывает по одной подсказке или с первой-второй попытки, оценка будет высокой.
  4. Доступность (обнаруживаемость). Насколько легко кому-либо получить эту технику? Если для этого требуются специальные знания, оценка будет низкой; если метод уже широко известен и доступен в сети интернет, оценка будет высокой.

Мы предлагаем использовать эту систему оценки степени серьезности для калибровки нашей реакции на вновь обнаруженные джейлбрейки. Для наиболее опасного класса взломов (например, таких, которые, помимо прочих характеристик, используются для нанесения разрушительного ущерба критически важным электросетям или банковским системам) мы немедленно приступим к развертыванию предварительных мер защиты после подтверждения степени тяжести. Мы также создаем команду для круглосуточного мониторинга ключевых каналов отправки отчетов о джейлбрейках.

Любой метод оценки взломов будет несовершенным. Тем не менее есть большая польза в возможности доносить примерную степень тяжести конкретной находки через общий фреймворк. Эта работа находится в процессе развития; по мере поступления отзывов от новых партнеров мы ожидаем, что концепция будет эволюционировать.

Мы рассчитываем в ближайшее время поделиться подробностями о предлагаемой концепции. А пока мы также запускаем новую программу HackerOne, в рамках которой исследователи безопасности могут отправлять на нашу проверку потенциальные кибервзломы, обнаруженные ими в Fable 5 (после ее доступности).

Партнерство с правительством США в сфере безопасности передового ИИ

В течение последних десяти недель компания Anthropic тесно сотрудничала с правительством США в процессе разработки подхода, отраженного в Указе президента от 2 июня О содействии инновациям и безопасности в сфере передового искусственного интеллекта. Наше взаимодействие охватывало Управление национального кибердиректора, Управление по вопросам науки и техники, Министерство финансов, Министерство торговли (включая CAISI) и профильные агентства национальной безопасности.

Мы по-прежнему привержены этой работе, опираясь на почти двухлетний опыт предшествующего сотрудничества с партнерами из правительства США в области предвводного тестирования и оценки. Взятые на себя обязательства отражают как эту прошлую работу, так и наши новые предложения по масштабированию правительственного сотрудничества по мере окончательного утверждения вышеупомянутой концепции:

  1. Предрелизный правительственный доступ и оценка. Для моделей, которые существенно раздвигают границы возможностей в областях, связанных с национальной безопасностью, мы предоставим назначенным правительственным партнерам расширенный ранний доступ как к самим моделям, так и к сопутствующим средствам защиты. Эти партнеры смогут проводить независимую оценку возможностей и тестировать наши защитные барьеры до широкого релиза. Мы выделим технических специалистов Anthropic для работы бок о бок с государственными экспертами по оценке в периоды такого тестирования.
  2. Оперативный обмен информацией о средствах защиты. При выявлении значительных джейлбрейков или паттернов неправомерного использования мы будем оперативно проводить расследование, анализ и уведомлять соответствующие правительственные ведомства. Мы будем делиться созданными нами в ответ новыми средствами защиты для их независимого тестирования. Мы также будем предоставлять государственным партнерам наши отчеты об анализе угроз до их публикации и участвовать в межведомственном центре по борьбе с уязвимостями в сфере кибербезопасности, созданном в соответствии с раз. 2(д) Указа президента от 2 июня.
  3. Выделенные ресурсы для совместных исследований. Мы существенно расширяем совместную работу с государственными партнерами в области безопасности ИИ. Мы создадим специализированные команды Anthropic для работы над общими правительственными приоритетами, выделим значительные вычислительные мощности для поддержки правительственного тестирования и исследований, а также предоставим нашу экспертизу в области безопасности и ред-теминга для содействия развитию передовых методов оценки ИИ.
  4. Единая отраслевая планка. Мы будем работать совместно с правительством и коллегами по индустрии над созданием общего добровольного стандарта безопасности и оценки для разработчиков передовых моделей. Мы внесем свой вклад в виде методов оценки, инструментов и лучших практик, которые правительство сможет применять во всей отрасли.

Мы надеемся, что это сотрудничество наряду с нашей предлагаемой согласованной отраслевой концепцией послужит основой для системных правил для всей индустрии и даже заложит основы шаблона для эффективной глобальной координации в отношении рисков и преимуществ искусственного интеллекта.

Эти правила должны быть закреплены в виде строгого регулирования и применяться на равных условиях ко всем разработчикам передовых моделей. Участие государства в выпуске ИИ требует создания долговечного и прозрачного процесса, который предоставит специалистам по защите и другим игрокам необходимую уверенность в доступе к мощным моделям.

Мы с нетерпением ждем углубления нашего сотрудничества с правительством описанными выше способами. Мы также благодарны нашим пользователям за терпение в период этих сбоев, а также исследователям и отраслевым партнерам, которые работали бок о бок с нами над возвращением Fable 5 и Mythos 5.



Сноски

  1. Для стандартных корпоративных мест (Enterprise) квота на использование Fable 5 не включена по умолчанию, однако вы можете получить доступ через кредиты использования. Если кредиты не активированы, у ваших пользователей не будет доступа к Fable 5. Для премиальных корпоративных мест Fable 5 включена в подписку до 7 июля включительно. Она расходуется из квот мест каждого участника без дополнительной оплаты. После 7 июля ваша команда сможет продолжить использовать Fable 5, активировав кредиты использования. Если кредиты не будут включены, вашим пользователям станет недоступен доступ к Fable 5.
  2. Обратите внимание, что иногда вместо термина «джейлбрейк» (взлом) используется термин «обход» (bypass). В контексте текущего обсуждения мы считаем их синонимами, однако в оставшейся части статьи используем слово «джейлбрейк», поскольку (а) оно является более распространенным термином и (б) оно соответствует терминологии, которую мы использовали в предыдущих материалах.
  3. Аналогичным образом, ни одно программное обеспечение не застраховано от уязвимостей (хотя в целом программные уязвимости обнаруживаются и исправляются проще, чем джейлбрейки языковых моделей).
  4. В других областях исследований безопасности существуют согласованные стандарты: например, Общая система оценки уязвимостей (CVSS) является стандартным способом определения серьезности конкретной уязвимости в программном обеспечении.

Полный текст статьи читайте на Anthropic