Представляем обновленную политику ответственного масштабирования (Responsible Scaling Policy)

A hand with a feather quill writing a policy document.

Сегодня мы публикуем масштабное обновление нашей Политики ответственного масштабирования (Responsible Scaling Policy, RSP) — структуры управления рисками, которую мы используем для смягчения потенциальных катастрофических угроз от передовых систем искусственного интеллекта. Это обновление предлагает более гибкий и тонкий подход к оценке рисков ИИ и управлению ими, сохраняя при этом наше обязательство не обучать и не развертывать модели до тех пор, пока мы не внедрим адекватные меры безопасности. Ключевые усовершенствования включают новые пороги возможностей, указывающие на необходимость повышения уровня защиты; уточненные процессы оценки возможностей моделей и достаточности наших мер безопасности (вдохновленные методологиями обоснования безопасности);, а также новые меры для внутреннего управления и внешнего взаимодействия. Извлекая уроки из нашего опыта внедрения и опираясь на практики управления рисками, применяемые в других критически важных отраслях, мы стремимся лучше подготовиться к стремительным темпам развития ИИ.

Возможности и вызовы передового ИИ

По мере совершенствования передовых моделей ИИ они способны принести революционную пользу нашему обществу и экономике. ИИ может ускорить научные открытия, произвести революцию в здравоохранении, усовершенствовать систему образования и создать совершенно новые сферы для человеческого творчества и инноваций. Тем не менее, передовые системы ИИ также создают новые проблемы и риски, которые требуют тщательного изучения и эффективных мер защиты.

В сентябре 2023 года мы опубликовали нашу Политику ответственного масштабирования — концепцию управления рисками, связанными с постоянно развивающимися системами ИИ. Спустя год практического применения и извлечения уроков мы представляем существенно обновленную версию, которая отражает полученный опыт и учитывает технологический прогресс.

Хотя эта политика сосредоточена на катастрофических рисках, подобных тем, что перечислены ниже, они не являются единственными рисками, за которыми мы следим и к которым готовимся. Наша Политика использования (Usage Policy) устанавливает стандарты использования наших продуктов, включая правила, которые запрещают применять наши модели для распространения дезинформации, подстрекательства к насилию или проявлениям ненависти, а также для мошеннических или оскорбительных действий. Мы постоянно совершенствуем наши технические средства для масштабного обеспечения стандартов доверия и безопасности. Кроме того, мы проводим исследования, чтобы понять более широкие общественные последствия использования наших моделей. Наша Политика ответственного масштабирования дополняет нашу работу в этих областях, помогая лучше понимать текущие и потенциальные риски.

Концепция соразмерных мер защиты

Как и прежде, мы придерживаемся нашего главного принципа: мы не будем обучать или развертывать модели до тех пор, пока не внедрим меры безопасности и защиты, удерживающие риски на приемлемом уровне. Наша RSP основана на принципе соразмерной защиты: меры безопасности должны масштабироваться в соответствии с потенциальными рисками. Для этого мы используем Стандарты уровней безопасности ИИ (AI Safety Level Standards, Стандарты ASL) — ступенчатые наборы мер безопасности и защиты, которые становятся более строгими по мере роста возможностей моделей. По аналогии с уровнями биобезопасности, они начинаются с ASL-1 для моделей с базовыми возможностями (например, ботов, играющих в шахматы) и переходят к ASL-2, ASL-3 и так далее.

В обновленной политике мы усовершенствовали методологию оценки конкретных возможностей (и связанных с ними рисков) и внедрения соразмерных мер безопасности и защиты. Наша обновленная структура состоит из двух ключевых компонентов:

  • Пороги возможностей (Capability Thresholds): Конкретные способности ИИ, достижение которых потребует более надежных мер защиты по сравнению с нашим текущим базовым уровнем.
  • Требуемые меры защиты (Required Safeguards): Конкретные стандарты ASL, необходимые для снижения рисков после достижения порога возможностей.

В настоящее время все наши модели функционируют в соответствии со стандартами ASL-2, которые отражают передовой опыт современной индустрии. Наша обновленная политика определяет два ключевых порога возможностей, достижение которых потребует повышения уровня защиты:

  • Автономные исследования и разработка в области ИИ: Если модель способна самостоятельно решать сложные исследовательские задачи в области ИИ, для которых обычно требуется экспертный уровень человека (что потенциально может значительно и непредсказуемо ускорить развитие ИИ), мы требуем повышенных стандартов безопасности (потенциально ASL-4 или выше) и дополнительных гарантий надежности, чтобы избежать ситуации, когда разработка опережает нашу способность справляться с возникающими рисками.
  • Химическое, биологическое, радиологическое и ядерное оружие (ХБРЯ): Если модель способна существенным образом помочь человеку с базовой технической подготовкой в создании или развертывании оружия ХБРЯ, мы требуем усиленных мер безопасности и контроля развертывания (стандарты ASL-3).

Меры безопасности ASL-3 предполагают усиленные меры безопасности и контроля развертывания. Что касается безопасности данных и доступа, сюда войдут внутренний контроль доступа и более надежная защита весов моделей. Что касается рисков развертывания, мы планируем реализовать многоуровневый подход для предотвращения нецелевого использования, включая мониторинг в реальном времени и асинхронный мониторинг, протоколы быстрого реагирования и тщательное тестирование на проникновение (red teaming) до развертывания.

Внедрение и надзор

Для содействия эффективному выполнению политики мы создали:

  • Оценку возможностей: Регулярные оценки моделей на основе наших Порогов возможностей для определения того, соответствуют ли текущие меры безопасности актуальному положению дел. (Краткие описания прошлых оценок доступны здесь.)
  • Оценку мер защиты: Регулярная оценка эффективности наших мер безопасности и защиты развертывания с целью проверки того, достигли ли мы планки требуемых мер безопасности. (Краткие описания этих решений будут доступны здесь.)
  • Документирование и принятие решений: Процессы документирования оценок возможностей и мер защиты, вдохновленные процедурами (такими как методологии обоснования безопасности), распространенными в отраслях с повышенными требованиями к надежности.
  • Меры внутреннего управления и внешнего взаимодействия: Наша методология оценки будет подкреплена внутренним стресс-тестированием в дополнение к существующему процессу внутреннего информирования о проблемах безопасности. Мы также запрашиваем отзывы внешних экспертов о наших методологиях.1

Извлекая уроки из опыта

Мы многому научились за первый год действия предыдущей версии RSP и используем это обновление как возможность осмыслить то, что сработало хорошо, и то, что имеет смысл скорректировать в политике. В рамках этого мы провели первый обзор того, насколько точно мы следовали установленной структуре, и выявили небольшое число случаев, когда мы не до конца выполняли букву ее требований. К ним относились процедурные вопросы, такие как завершение комплекса оценок на три дня позже запланированного срока или недостаточная ясность в отношении того, как и где нам следует фиксировать любые изменения в наших оценочных тестах-заглушках (placeholder evaluations). Мы также отметили несколько случаев, когда мы могли бы добиться чуть лучших результатов модели за счет применения стандартных методов (таких как цепочка рассуждений или «лучший из N» — chain-of-thought или best-of-N).

Во всех случаях мы пришли к выводу, что эти инциденты несли минимальный риск для безопасности наших моделей. Мы использовали дополнительные три дня для доработки и улучшения наших оценок; альтернативный набор тестов, который мы использовали, обеспечил более точную оценку по сравнению с заглушками;, а наша методология оценки по-прежнему показывала, что мы находимся на достаточно безопасном расстоянии от пороговых значений. Из этого мы вынесли два ценных урока, которые внедрили в нашу обновленную структуру: нам необходимо было заложить больше гибкости в наши правила и усовершенствовать процесс отслеживания соблюдения RSP. Подробнее вы можете прочитать здесь.

С тех пор как год назад мы впервые выпустили RSP, нашей целью было предложить пример концепции, из которой другие могли бы черпать вдохновение при создании собственных политик управления рисками ИИ. Мы надеемся, что проактивный обмен нашим опытом внедрения собственной политики поможет другим компаниям в реализации их собственных систем управления рисками и внесет свой вклад в формирование передового опыта во всей экосистеме ИИ.

Взгляд в будущее

Границы возможностей ИИ стремительно расширяются, из-за чего сложно заранее предсказать, какие именно меры безопасности окажутся уместными для будущих систем. Все аспекты нашей программы безопасности будут продолжать развиваться: наши правила, методология оценки, меры защиты, а также исследования потенциальных рисков и способов их минимизации.

Кроме того, соучредитель и главный научный сотрудник Джаред Каплан (Jared Kaplan) займет пост директора по ответственному масштабированию (Responsible Scaling Officer) компании Anthropic, сменив соучредителя и технического директора Сэма МакКэндлиша (Sam McCandlish), который исполнял эту роль последний год. Сэм курировал первоначальное внедрение RSP и продолжит уделять основное внимание своим обязанностям технического директора. По мере того как мы наращиваем усилия по реализации RSP, мы также открываем вакансию руководителя направления по ответственному масштабированию (Head of Responsible Scaling). Эта роль будет отвечать за координацию множества команд, необходимых для итеративного совершенствования и успешного соблюдения RSP.

Если вы хотите внести свой вклад в управление рисками ИИ в Anthropic, мы нанимаем сотрудников! Многие из наших команд теперь занимаются управлением рисками в рамках RSP, в том числе:

  • Команда передового тестирования на проникновение (Frontier Red Team, отвечает за моделирование угроз и оценку возможностей)
  • Команда доверия и безопасности (Trust & Safety, отвечает за разработку мер защиты при развертывании)
  • Команда безопасности и комплаенса (Security and Compliance, отвечает за меры информационной безопасности и управление рисками)
  • Научная группа по выравниванию / Alignment Science (включая подкоманды, отвечающие за разработку мер безопасности ASL-3+, оценку возможностей на предмет несоответствия целям и программу внутреннего стресс-тестирования выравнивания)
  • Команда RSP (отвечает за разработку политик, обеспечение соответствия и межфункциональное выполнение по всей компании)

Ознакомьтесь с обновленной политикой на сайте anthropic.com/rsp, а с дополнительной информацией — на anthropic.com/rsp-updates.

Мы выражаем искреннюю благодарность многочисленным внешним группам, которые предоставили бесценные отзывы при разработке и доработке нашей Политики ответственного масштабирования.


Сноски

1 Мы также поделились нашей методологией оценки с обоими Институтами безопасности ИИ (AI Safety Institutes), а также с рядом независимых экспертов и организаций для получения отзывов. Это не означает одобрения со стороны Институтов безопасности ИИ или независимых экспертов и организаций. 


Полный текст статьи читайте на Anthropic