Политика ответственного масштабирования Anthropic: Версия 3.0

Anthropic’s Responsible Scaling Policy: Version 3.0

Мы выпускаем третью версию нашей Политики ответственного масштабирования (Responsible Scaling Policy, RSP) — добровольной структуры, которую мы используем для снижения катастрофических рисков, связанных с системами искусственного интеллекта.

Anthropic руководствуется RSP уже более двух лет, и за это время мы многое узнали как о её преимуществах, так и о недостатках. Поэтому мы обновляем политику, чтобы закрепить то, что показало хорошую эффективность, исправить необходимые аспекты и внедрить новые меры для повышения прозрачности и подотчетности нашего процесса принятия решений.

С полным текстом новой RSP можно ознакомиться здесь. В этой публикации мы расскажем о логике и соображениях, стоящих за этими изменениями.

Оригинальная RSP и наша концепция изменений

RSP — это наша попытка решить проблему устранения рисков ИИ, которых еще не существовало на момент написания документа, но которые могут стремительно возникнуть в результате экспоненциального развития технологий. Когда мы создавали первоначальную версию RSP в сентябре 2023 года, большие языковые модели по сути представляли собой интерфейсы чат-ботов. Сегодня они способны просматривать веб-страницы, писать и запускать код, использовать компьютеры и совершать автономные действия, состоящие из множества шагов. С появлением каждого нового набора возможностей возникали и новые риски. Мы ожидаем, что эта тенденция продолжится.

В основу RSP мы заложили принцип условных обязательств, или обязательств типа «если — то». Если модель превосходила определенные уровни возможностей (например, в области биологических наук, которые могли бы помочь в создании опасного оружия), то политика предписывала нам внедрить новый, более строгий набор средств защиты (например, от нецелевого использования модели и кражи её весов).

Каждому набору средств защиты соответствовал определенный «уровень безопасности ИИ» (AI Safety Level, ASL): например, ASL-2 относился к одному набору обязательных мер защиты, в то время как ASL-3 — к более строгому набору мер, необходимому для более мощных моделей ИИ.

Ранние уровни ASL (ASL-2 и ASL-3) были детально прописаны, однако сформулировать корректные защитные механизмы для моделей, которые появятся лишь через несколько поколений, было значительно сложнее. Поэтому мы намеренно оставили более поздние уровни ASL (ASL-4 и выше) в значительной степени неопределенными, рассчитывая доработать их более подробно после того, как у нас появится четкое понимание того, что будут представлять собой более высокие уровни возможностей ИИ.

Ниже приведено примерное описание нашей «концепции изменений» — то есть механизмов, с помощью которых мы надеялись повлиять на экосистему с помощью RSP:

  • Внутренний стимулирующий фактор. Внутри Anthropic мы надеялись, что RSP заставит нас рассматривать важные меры защиты как обязательное требование для запуска (и обучения) новых моделей. Это позволило донести важность таких мер до крупной и растущей организации, подтолкнув нас к более быстрому прогрессу.
  • Гонка наверх. Мы рассчитывали, что публикация нашей RSP побудит другие компании в сфере ИИ внедрить аналогичные политики. Это идея «гонки наверх» (противоположность «гонки на дно»), при которой различные участники рынка имеют стимулы улучшать, а не ослаблять защиту своих моделей и общую политику безопасности. Со временем мы надеялись, что RSP или аналогичные правила станут добровольными отраслевыми стандартами или лягут в основу законов об ИИ, направленных на поощрение безопасности и прозрачности при разработке моделей.
  • Формирование большего консенсуса в отношении рисков. Мы рассматривали пороги возможностей как потенциально важные поворотные моменты для индустрии. Если бы мы достигли важного порога возможностей (например, способности моделей ИИ поддерживать полный цикл производства биологического оружия), мы бы самостоятельно внедрили соответствующие средства защиты и использовали полученные данные об этих возможностях, чтобы убедить другие компании и правительства также принять меры. Иными словами, мы верили, что пороги возможностей могут стать подходящей отправной точкой для перехода от односторонних действий (когда Anthropic требует защиты для собственных моделей) к многосторонним усилиям (когда другие ИИ-компании и/или государства также требуют соблюдения таких мер).
  • Взгляд в будущее. Мы осознавали, что на некоторых из более поздних порогов возможностей масштаб мер противодействия, которые мы планировали (например, достижение высокой устойчивости к злонамеренному использованию моделей ИИ со стороны субъектов государственного уровня), будет трудно или невозможно реализовать силами одной лишь Anthropic. Мы надеялись, что к тому моменту, когда мы достигнем этих более высоких возможностей, мир отчетливо увидит опасность, и мы сможем координировать свои действия с правительствами по всему миру для внедрения мер защиты, которые одной компании в одиночку реализовать не под силу.

Оценка нашей концепции изменений

Спустя два с половиной года наша честная оценка заключается в том, что некоторые части этой концепции оправдали себя, а другие — нет. Ниже перечислины те области, в которых RSP оказалась успешной:

  • Наша RSP действительно стимулировала нас разрабатывать более надежные средства защиты. Например, для соответствия нашему стандарту развертывания ASL-3 (который в первую очередь касается рисков химического и биологического оружия со стороны злоумышленников с относительно скромными ресурсами и опытом) мы разработали все более изощренные и точные методы (в частности, классификаторы входных и выходных данных) для блокировки нежелательного контента.
  • Более того, общая реализация стандарта ASL-3 оказалась вполне осуществимой. Мы активировали средства защиты ASL-3 для соответствующих моделей в мае 2025 года и с тех пор работаем над их совершенствованием.
  • Наша RSP действительно подтолкнула другие компании, занимающиеся искусственным интеллектом, принять схожие стандарты: в течение нескольких месяцев после анонса нашей RSP и OpenAI, и Google DeepMind приняли в целом аналогичные структуры. Некоторые компании также вдрили классификаторы угроз биологического оружия, аналогичные нашей защите уровня ASL-3. Принципы, лежащие в основе этих добровольных стандартов, включая положения RSP, помогли сформировать основы раннего регулирования ИИ. Мы видим, как правительства по всему миру (например, в Калифорнии с законопроектом SB 53, в Нью-Йорке с законом RAISE Act, а также в рамках Кодексов практики Закона ЕС об искусственном интеллекте) начинают требовать от разработчиков передовых систем ИИ создания и публикации рамок для оценки и управления катастрофическими рисками. Anthropic выполняет эти требования посредством публичной документации, включая Документ о соответствии стандартам передовых ИИ. Поощрение подобных строгих структур прозрачности в масштабах всей отрасли было именно тем, к чему стремилась наша RSP.

Тем не менее, другие аспекты нашей концепции изменений не оправдали ожиданий:

  • Идея использования пороговых значений RSP для формирования более широкого консенсуса относительно рисков ИИ не сработала на практике — хотя определенный эффект всё же наблюдался. Мы обнаружили, что предварительно заданные уровни возможностей гораздо более неоднозначны, чем мы предполагали: в некоторых случаях возможности моделей явно приближались к порогам RSP, но у нас сохранялась значительная неопределенность в отношении того, перешагнули ли они их окончательно. Наука оценки моделей еще недостаточно развита, чтобы давать однозначные ответы. В таких случаях мы занимали превентивную позицию и внедряли соответствующие меры безопасности, однако наша внутренняя неопределенность не позволяла сформировать сильную позицию для призыва к многосторонним действиям в масштабах всей индустрии ИИ.
    • Биологические риски служат примером такой «зоны неопределенности». Наши модели теперь обладают достаточными биологическими знаниями, чтобы успешно проходить большинство тестов, которые мы можем запустить быстро и легко, поэтому мы больше не можем утверждать, что риски от конкретной модели невелики. Но одни лишь эти тесты недостаточны и для того, чтобы уверенно утверждать, что риски велика. Мы искали дополнительные доказательства, например, поддерживая масштабное испытание в лабораторных условиях (wet-lab), но результаты остаются неоднозначными — во многом потому, что исследования занимают столько времени, что к моменту их завершения появляются еще более мощные модели.
  • Несмотря на стремительный прогресс в возможностях ИИ за последние три года, действия правительств в сфере безопасности ИИ развиваются медленно. Политические приоритеты сместились в сторону конкурентоспособности ИИ и экономического роста, в то время как дискуссии о безопасности пока не получили существенной поддержки на федеральном уровне. Мы по-прежнему убеждены, что эффективное взаимодействие с правительством в вопросах безопасности ИИ одновременно необходимо и достижимо, и мы намерены продолжать диалог, основанный на фактических данных, интересах национальной безопасности, экономической конкурентоспособности и общественном доверии. Однако это долгосрочный проект, который не реализуется органично просто по мере того, как ИИ становится умнее или преодолевает определенные пороги.

Как отмечалось выше, нам удалось внедрить меры безопасности уровня ASL-3 в одностороннем порядке и с разумными издержками для операционной деятельности компании. Тем не менее, это может оказаться невозможным для более высоких уровней возможностей и высших уровней ASL. Хотя наши будущие уровни ASL во многом пока не определены, надежные меры минимизации рисков, описанные в предыдущей версии RSP, могут оказаться практически невыполнимыми без коллективных действий. В качестве иллюстрации масштаба проблемы в отчете RAND, посвященном безопасности весов моделей, отмечается, что их стандарт безопасности «SL5», направленный на пресечение приоритетных операций со стороны наиболее технически подкованных в кибернетической сфере структур, «в настоящее время невыполним» и «вероятно, потребует помощи со стороны сообщества национальной безопасности».

Сочетание таких факторов, как а) зона неопределенности, размывающая общественное восприятие рисков, б) антирегуляторный политический климат и в) требования на более высоких уровнях RSP, которые крайне сложно выполнить в одиночку, создает структурную проблему для нашей текущей RSP. Мы могли бы попытаться решить ее, определив меры безопасности для ASL-4 и ASL-5 так, чтобы их соблюдение давалось легко, однако это подорвало бы изначальный дух и принципы RSP.

Вместо этого мы решили открыто признать эти трудности и реструктурировать RSP до того, как мы достигнем столь высоких рубежей. Пересмотренная RSP призвана зафиксировать более реалистичные односторонние обязательства, которые остаются сложными, но выполнимыми в текущих условиях, и при этом продолжить всестороннее картирование рисков, которые, по нашему мнению, вся индустрия должна решать коллективно.

Обновление нашей Политики ответственного масштабирования

Новая версия нашей RSP включает в себя три ключевых элемента.

1. Разделение планов компании и рекомендаций для всей индустрии

Теперь наша RSP разделяет меры защиты на две категории: во-первых, меры, которые мы планируем внедрять независимо от действий других участников; и во-вторых, амбициозную карту соответствия возможностей и мер защиты, которая, по нашему мнению, помогла бы адекватно управлять рисками от передового ИИ, если бы она применялась во всей индустрии.

Ознакомьтесь с полным текстом Политики ответственного масштабирования.

2. Дорожная карта безопасности передовых систем (Frontier Safety Roadmap)

Наша новая RSP вводит требование разрабатывать и публиковать Дорожную карту безопасности передовых систем (Frontier Safety Roadmap), в которой будут описаны наши конкретные планы по снижению рисков в таких областях, как безопасность (Security), выравнивание (Alignment), средства защиты (Safeguards) и государственная политика (Policy). Цели, изложенные в дорожных картах, призваны быть амбициозными, но при этом достижимыми — выполняя роль того самого стимулирующего фактора, который мы считаем успешным элементом прошлых версий RSP.

Вместо того чтобы быть жесткими обязательствами, это публичные цели, в отношении которых мы будем открыто оценивать наш прогресс. Эта стратегия «необязывающих, но публично заявленных» ориентиров заимствует подход к прозрачности, который мы отстаиваем применительно к законодательству в сфере передового ИИ (хотя она предоставляет общественности гораздо больше подробностей, чем требуется по действующему законодательству), а также опирается на успехи наших предыдущих версий RSP.

Некоторые примеры целей из нашей текущей Дорожной карты безопасности передовых систем:

  • Запуск проектов класса «moonshot R&D» для исследования амбициозных и, возможно, нетрадиционных способов достижения беспрецедентного уровня информационной безопасности;
  • Разработка метода тестирования на проникновение и уязвимости (red-teaming) для наших систем (вероятно, с задействием значительной автоматизации), который превзойдет совместный вклад сотен участников нашей программы выплаты вознаграждений за найденные уязвимости;
  • Внедрение ряда системных мер для обеспечения того, чтобы Claude действовал в соответствии со своей конституцией;
  • Создание комплексных централизованных реестров всей нашей критически важной деятельности по разработке ИИ и использование самого ИИ для анализа этих реестров на предмет выявления проблем, включая подозрительное поведение инсайдеров (как людей, так и ИИ) и угрозы безопасности;
  • Публикация дорожной карты мер политики с конкретными предложениями по «регуляторной лестнице» — политике, которая масштабируется по мере роста рисков и может помочь ориентировать государственную политику в отношении ИИ.

Ознакомьтесь с Дорожной картой безопасности передовых систем, чтобы узнать больше об этих и других наших целях.

3. Отчеты о рисках и внешняя экспертиза

Отчеты о рисках (Risk Reports) — это еще один способ усовершенствовать то, что хорошо зарекомендовало себя в предыдущей версии RSP. Мы обнаружили, что создание прообраза Отчета о рисках — нашего Отчета о средствах защиты от мая 2025 года — оказалось полезным как для нашего внутреннего понимания, так и для информирования общественности о рисках. Отчеты о рисках выводят этот подход на уровень более систематической и комплексной практики.

Отчеты о рисках будут предоставлять подробную информацию о профиле безопасности наших моделей на момент публикации. Они выйдут за рамки простого описания возможностей моделей и объяснят, как именно соотносятся между собой возможности, модели угроз (конкретные способы, с помощью которых модели могут создавать угрозы) и активные меры по снижению рисков, а также дадут оценку общего уровня опасности. Отчеты о рисках будут публиковаться в сети (с некоторыми изъятиями1) каждые 3–6 месяцев.

Новая RSP также требует проведения внешней экспертизы Отчетов о рисках при определенных обстоятельствах. Мы назначим независимых экспертов-рецензентов, которые глубоко знакомы с исследованиями в области безопасности ИИ, замотивированы действовать открыто и честно в отношении позиции Anthropic по безопасности и не имеют серьезных конфликтов интересов. Они получат доступ к полному или минимально отредактированному тексту Отчета о рисках и подвергнут наши аргументы, аналитику и принятые решения всесторонней общественной оценке. Хотя наши текущие модели пока не требуют внешнего ревью, мы уже проводим пилотные запуски и движемся к этой цели.

Отчеты о рисках будут освещать любые разрывы между нашими текущими мерами безопасности и более амбициозными рекомендациями по обеспечению безопасности в масштабах всей индустрии. Мы надеемся, что описание и обнародование таких пробелов поможет повысить осведомленность общественности и, как следствие, будет способствовать полезным изменениям в политике в будущем.

Ознакомьтесь с первоначальным Отчетом о рисках.

Заключение

Политика ответственного масштабирования изначально задумывалась как живой документ: политика, обладающая гибкостью, необходимой для изменений по мере того, как модели ИИ становятся более способными. Эта третья редакция усиливает то, что работало в предыдущей версии RSP, возлагает на нас обязательства по большей прозрачности в отношении наших планов и оценок рисков, а также отделяет наши рекомендации для индустрии в целом от того, чего мы можем достичь как отдельная компания.

В том же духе прагматизма мы продолжим пересматривать и совершенствовать нашу RSP, а также методы оценки и снижения рисков по мере развития технологий.

Сноски

1. Как мы обсуждаем в RSP, мы будем стремиться свести к минимуму изъятия (цензуру текста) в публичной версии Отчета о рисках. Причины, по которым нам все же может потребоваться скрыть часть текста, включают соблюдение законодательства, защиту интеллектуальной собственности, общественную безопасность и конфиденциальность.

Полный текст статьи читайте на Anthropic