Активация средств защиты уровня безопасности ИИ 3

Мы активировали стандарты развертывания и безопасности уровня безопасности ИИ 3 (ASL-3), описанные в Политике ответственного масштабирования (RSP) компании Anthropic, одновременно с запуском Claude Opus 4. Стандарт безопасности ASL-3 предполагает усиление внутренних мер безопасности, которые затрудняют кражу весов моделей, в то время как соответствующий стандарт развертывания охватывает узкоцелевой набор мер, призванных ограничить риск неправомерного использования Claude именно для разработки или приобретения химического, биологического, радиологического и ядерного оружия (ХБРЯ). Эти меры не должны приводить к тому, что Claude будет отклонять запросы, за исключением очень узкого круга тем.
Мы развертываем Claude Opus 4 с нашими мерами ASL-3 в качестве превентивной и временной меры. Уточним: мы еще не определили, окончательно ли Claude Opus 4 преодолел порог возможностей, требующий средств защиты ASL-3. Скорее, в связи с продолжающимся улучшением знаний и возможностей, связанных с ХБРЯ, мы пришли к выводу, что для Claude Opus 4 невозможно однозначно исключить риски ASL-3 так, как это было сделано для каждой предыдущей модели, и для окончательной оценки уровня риска модели требуется более подробное изучение. (Мы исключили то, что Claude Opus 4 нуждается в стандарте ASL-4, как того требует наша RSP, и, аналогично, мы исключили то, что Claude Sonnet 4 нуждается в стандарте ASL-3).
Оценка опасных возможностей ИИ-моделей сама по себе представляет собой сложную задачу, и по мере того как модели приближаются к нашим пороговым значениям беспокойства, определение их статуса занимает больше времени. Проактивное внедрение более высокого стандарта безопасности и защищенности упрощает выпуск моделей и позволяет нам учиться на собственном опыте, итеративно совершенствуя средства защиты и снижая их влияние на пользователей.
В этой публикации и сопроводительном отчете обсуждаются новые меры и лежащие в их основе обоснования.
Предыстория
Модели ИИ с растущими возможностями требуют все более надежных средств защиты при развертывании и обеспечении безопасности. Этот принцип лежит в основе Политики ответственного масштабирования (RSP) компании Anthropic.1
- Меры по развертыванию направлены на конкретные категории неправомерного использования; в частности, наша RSP сосредоточена на снижении риска того, что модели могут быть использованы для атак с применением наиболее опасных категорий оружия — ХБРЯ.
- Контроль безопасности нацелен на предотвращение кражи весов моделей — квинтэссенции интеллекта и возможностей ИИ.
RSP компании Anthropic включает пороговые значения возможностей для моделей: если модели достигают этих порогов (или если мы еще не определили, что они находятся достаточно далеко ниже них), мы обязаны внедрить более высокий уровень стандартов уровней безопасности ИИ. До сих пор все наши модели развертывались в рамках базовых средств защиты стандарта уровня безопасности ИИ 2 (ASL-2). Меры по развертыванию ASL-2 включают обучение моделей отклонению опасных запросов, связанных с ХБРЯ. Меры безопасности ASL-2 включают защиту от оппортунистических попыток кражи весов. Стандарт ASL-3 требует более высокого уровня защиты как от угроз при развертывании, так и от угроз безопасности, пригодного для противодействия изощренным негосударственным злоумышленникам.
Обоснование
Мы еще не определили, действительно ли возможности Claude Opus 4 требуют защиты стандарта ASL-3. Так почему же мы внедрили эти средства защиты сейчас? Мы предполагали, что можем сделать это при выпуске нашей последней модели, Claude Sonnet 3.7. Тогда мы пришли к выводу, что модель не требует защиты по стандарту ASL-3. Но мы признали вполне реальную возможность того, что, учитывая темпы прогресса, модели в ближайшем будущем могут потребовать этих расширенных мер.2 И действительно, в преддверии выпуска Claude Opus 4 мы проактивно приняли решение запустить ее по стандарту ASL-3. Такой подход позволил нам сосредоточиться на разработке, тестировании и доработке этих средств защиты до того, как они понадобятся.
Этот подход также согласуется с RSP, которая позволяет нам перестраховаться и развернуть модель по более высокому стандарту, чем тот, в необходимости которого мы уверены. В данном случае это означало проактивное выполнение стандартов безопасности и развертывания ASL-3 (и исключение необходимости еще более продвинутых средств защиты). Мы продолжим оценивать возможности Claude Opus 4 в области ХБРЯ. Если мы придем к выводу, что Claude Opus 4 не превзошел соответствующий порог возможностей, то мы можем снять или скорректировать защиту ASL-3.
Меры по развертыванию
Новые меры развертывания ASL-3 узко сфокусированы на предотвращении помощи модели в решении задач, вызывающих опасения и связанных с оружием ХБРЯ,3 и в частности на предотвращении помощи в расширенных комплексных рабочих процессах по ХБРЯ таким образом, который дополняет то, что уже возможно без больших языковых моделей. Сюда входит ограничение универсальных джейлбрейков — систематических атак, которые позволяют злоумышленникам обходить наши защитные барьеры и последовательно извлекать длинные цепочки информации, связанной с ХБРЯ и улучшающей рабочие процессы. В соответствии с нашими базовыми моделями угроз, меры развертывания ASL-3 не направлены на решение проблем, не связанных с ХБРЯ, на защиту от неуниверсальных джейлбрейков или на предотвращение извлечения общедоступных единичных фрагментов информации, таких как ответ на вопрос: «Какова химическая формула зарина?» (хотя они могут случайно предотвратить это). Учитывая меняющийся ландшафт угроз, мы ожидаем, что будут обнаружены новые джейлбрейки и что нам придется быстро итеративно совершенствовать и улучшать наши системы с течением времени.
Мы разработали подход, состоящий из трех частей: сделать систему более устойчивой к джейлбрейкам, обнаруживать джейлбрейки в случае их возникновения и итеративно совершенствовать наши средства защиты.
- Повышение устойчивости системы к джейлбрейкам. Мы внедрили конституционные классификаторы — систему, в которой средства защиты на базе классификаторов в реальном времени, обученные на синтетических данных, представляющих вредоносные и безвредные промпты и завершения, связанные с ХБРЯ, отслеживают входные и выходные данные модели и вмешиваются, чтобы заблокировать узкий класс вредоносной информации о ХБРЯ. Наше предпродажное тестирование показывает, что мы можем существенно снизить успешность джейлбрейков, добавляя лишь умеренные накладные расходы на вычисления (дополнительные затраты на обработку сверх того, что требуется для инференса модели) к нормальным операциям.
- Обнаружение джейлбрейков по мере их возникновения. Мы также создали более широкую систему мониторинга, включающую программу выплаты вознаграждений за ошибки, ориентированную на стресс-тестирование наших конституционных классификаторов, автономных систем классификации и партнерств в сфере аналитики угроз для быстрого выявления потенциальных универсальных джейлбрейков, которые могли бы привести к неправомерному использованию ХБРЯ, и реагирования на них.
- Итеративное совершенствование средств защиты. Мы верим, что сможем быстро устранять уязвимости для джейлбрейков, используя такие методы, как генерация синтетических джейлбрейков, похожих на те, что мы обнаружили, и применение этих данных для обучения нового классификатора.
Все эти меры потребуют постоянной доработки, как для повышения их эффективности, так и потому, что они все же могут периодически влиять на легитимные запросы (то есть могут давать ложноположительные результаты).4 Тем не менее, они представляют собой существенный шаг вперед в защите от катастрофического неправомерного использования возможностей ИИ.5
Безопасность
Наш целевой контроль безопасности направлен на защиту весов моделей — важнейших числовых параметров, которые в случае компрометации могут позволить пользователям получить доступ к нашим моделям в обход средств защиты при развертывании. Наш подход включает более 100 различных элементов контроля безопасности, объединяющих превентивные средства управления с механизмами обнаружения и нацеленных главным образом на угрозы со стороны изощренных негосударственных субъектов6 от первоначальных точек входа через латеральное перемещение до финального извлечения. Многие из этих средств контроля, такие как двухсторонняя авторизация для доступа к весам моделей, расширенные протоколы управления изменениями и контроль конечных точек программного обеспечения с помощью белых списков двоичных файлов, являются примерами следования передовым практикам, установленным другими организациями, заботящимися о безопасности.
Однако один элемент контроля в большей степени уникален для цели защиты весов моделей: мы внедрили предварительный контроль пропускной способности исходящего трафика (эгресса). Контроль пропускной способности исходящего трафика ограничивает поток данных из безопасных вычислительных сред, где находятся веса ИИ-моделей. Совокупные веса модели имеют значительный размер. Ограничивая скорость исходящего сетевого трафика, эти средства контроля могут использовать размер весов модели для создания преимущества в безопасности. Когда потенциальная эксфильтрация весов моделей обнаруживается по необычному использованию пропускной способности, системы безопасности могут заблокировать подозрительный трафик. Со временем мы рассчитываем достичь точки, когда ограничения скорости будут настолько низкими, что эксфильтрация весов моделей до их обнаружения станет очень сложной задачей — даже если злоумышленник в остальном существенно скомпрометировал наши системы. Внедрение контроля пропускной способности исходящего трафика стало стимулирующим фактором для понимания и регулирования того, как данные вытекают за пределы наших внутренних систем, что принесло пользу нашим возможностям обнаружения угроз и реагирования на них.
Как и в случае с защитой развертывания, мы продолжаем работать над улучшением охвата и зрелости наших средств контроля безопасности, всегда принимая во внимание меняющийся ландшафт угроз. В частности, мы продолжим совершенствовать средства контроля исходящего трафика, меры противодействия более изощренным внутренним угрозам и общий уровень нашей безопасности.
Заключение
Как мы подчеркивали выше, вопрос о том, какие меры развертывания и безопасности применять к передовым моделям ИИ, далек от разрешения. Мы продолжим анализировать, итеративно совершенствовать и улучшать нашу работу. Практический опыт работы в рамках стандартов ASL-3 поможет нам выявить новые и, возможно, неожиданные проблемы и возможности.
Мы будем постоянно работать с другими представителями индустрии ИИ, пользователями Claude, а также с партнерами в правительстве и гражданском обществе над совершенствованием наших методов защиты этих моделей. Мы надеемся, что наш подробный отчет окажется полезным для других участников индустрии ИИ, пытающихся внедрить аналогичные средства защиты, и поможет всем нам подготовиться к возможностям и вызовам еще более мощного ИИ.
Читайте полный отчет.
Сноски
1RSP — это лишь один из компонентов нашего подхода к смягчению потенциальных рисков.
2В частности, у нас были некоторые свидетельства улучшенных возможностей, связанных с ХБРЯ. Эксперименты показали, что доступ к Claude Sonnet 3.7 помог участникам справляться с задачами, связанными с приобретением оружия ХБРЯ, несколько лучше, чем тем, кто имел стандартный доступ в интернет (хотя планы всех участников все равно содержали критические ошибки). Производительность моделей в таких оценках, как Тест на возможности в вирусологии, неуклонно росла с течением времени.
3Поначалу они сосредоточены исключительно на биологическом оружии, поскольку мы считаем, что на него приходится подавляющее большинство рисков, хотя мы рассматриваем возможность расширения сферы охвата на некоторые другие угрозы ХБРЯ.
4 Мы также создали системы контроля доступа, благодаря которым пользователи с приложениями двойного назначения в области науки и технологий могут проходить проверку для получения целевых исключений из некоторых действий классификатора.
5Для получения дополнительной информации о нашей оценке эффективности и достаточности этих мер см. Отчет о гарантиях развертывания ASL-3.
6Угрозы со стороны национальных государств (за исключением тех, которые используют нетривиальные цепочки атак) и риски, связанные с изощренными инсайдерами, выходят за рамки стандарта ASL-3.
Полный текст статьи читайте на Anthropic
