Размышления о нашей Политике ответственного масштабирования

Прошлым летом мы опубликовали нашу первую Политику ответственного масштабирования (Responsible Scaling Policy, RSP), которая направлена на предотвращение катастрофических сбоев в сфере безопасности и нецелевого использования передовых моделей. Принимая эту политику, наша главная цель заключалась в том, чтобы помочь преобразовать концепции безопасности высокого уровня в практические руководства для быстро развивающихся технических организаций и продемонстрировать их жизнеспособность в качестве возможных стандартов. По мере внедрения политики мы рассчитываем узнать очень многое и планируем делиться своими выводами. В этой статье представлены размышления по итогам реализации политики на данный момент. Мы также работаем над обновленной версией RSP и скоро подели ею.
Мы обнаружили, что наличие четко сформулированной политики в отношении катастрофических рисков чрезвычайно ценно. Она обеспечила структурированную основу для уточнения наших организационных приоритетов и обсуждения сроков проектов, численности персонала, моделей угроз и компромиссов. Процесс реализации политики также выявил целый ряд важных вопросов, проектов и зависимостей, которые в противном случае могли бы потребовать больше времени для выявления или остаться без обсуждения.
Совместить стремление к жестким обязательствам с тем фактом, что мы все еще ищем правильные ответы — задача непростая. В некоторых случаях первоначальная политика является неоднозначной и требует уточнений. Там, где остаются открытые исследовательские вопросы или неопределенности, установление излишне специфических требований вряд ли выдержит испытание временем. Тем не менее, поскольку игроки отрасли сталкиваются со все большим коммерческим давлением, мы надеемся перейти от добровольных обязательств к устоявшимся передовым практикам, а затем и к четко проработанным правилам.
Продолжая дорабатывать и совершенствовать первоначальную политику, мы активно изучаем возможности интеграции практик из существующих областей управления рисками и операционной безопасности. Хотя ни одна из этих областей сама по себе не является идеальным аналогом, мы рассчитываем почерпнуть ценные идеи из ядерной безопасности, биобезопасности, системной безопасности, беспилотных транспортных средств, аэрокосмической отрасли и кибербезопасности. Мы формируем междисциплинарную команду, которая поможет нам интегрировать наиболее релевантные и ценные практики из каждой из этих сфер.
Наша текущая основа для этого кратко изложена ниже в виде пяти основных обязательств.
- Установление возможностей красной линии (Red Line Capabilities). Мы берем на себя обязательство выявлять и публиковать «возможности красной линии», которые могут появиться в будущих поколениях моделей и будут представлять слишком большой риск при хранении или развертывании в соответствии с нашими текущими правилами техники безопасности и безопасности (известными как стандарт ASL-2).
- Тестирование на наличие возможностей красной линии (Оценки рисков передовых моделей). Мы обязуемся продемонстрировать отсутствие возможностей красной линии в моделях или — если мы не можем этого сделать — действовать так, как будто они присутствуют (подробнее об этом ниже). Это предполагает сотрудничество с профильными экспертами для разработки ряда «Оценок рисков передовых моделей» (Frontier Risk Evaluations) — эмпирических тестов, неуспешное прохождение которых давало бы веские доказательства против того, что модель обладает или приближается к возможностям красной линии. Мы также обязуемся поддерживать прозрачный процесс оценки и публичную сводку наших текущих оценок.
- Реагирование на появление возможностей красной линии. Мы обязуемся разработать и внедрить новый стандарт безопасности и защищенности, достаточный для работы с моделями, обладающими возможностями красной линии. Этот набор мер называется стандартом ASL-3. Мы обязуемся не только определить меры по снижению рисков, составляющие этот стандарт, но также подробно описать и соблюдать процесс обеспечения контроля для проверки эффективности стандарта. Наконец, мы обязуемся приостановить обучение или развертывание, если это необходимо для того, чтобы модели с возможностями красной линии обучались, хранились и развертывались только тогда, когда мы сможем применить стандарт ASL-3.
- Итеративное расширение этой политики. Прежде чем приступать к деятельности, требующей соблюдения стандарта ASL-3, мы обязуемся опубликовать четкое описание его верхнего предела применимости: новый набор возможностей красной линии, для которых мы должны разработать оценки рисков передовых моделей и которые потребуют более высокого стандарта безопасности и защищенности (ASL-4) перед началом обучения и развертывания. Это включает в себя поддержание прозрачного процесса оценки и публикацию сводки наших оценок.
- Механизмы обеспечения соответствия (Assurance Mechanisms). Мы обязуемся гарантировать выполнение этой политики в полном соответствии с замыслом путем внедрения механизмов обеспечения соответствия. Они должны гарантировать, что наш процесс оценки проходит стресс-тестирование; наши меры по снижению рисков и обеспечению безопасности проверяются публично или независимыми экспертами; наш Совет директоров и Траст долгосрочных выгод осуществляют достаточный надзор за выполнением политики для выявления любых областей ее несоблюдения;, а сама политика обновляется посредством соответствующего процесса.
Моделирование угроз и оценки
Наши команды передового тестирования на проникновение (Frontier Red Team) и науки об алгоритмах выравнивания (Alignment Science) сосредоточились на моделировании угроз и взаимодействии с профильными экспертами. Они в основном сосредоточены на: (а) улучшении моделей угроз для определения того, какие возможности потребуют применения стандарта безопасности и защищенности ASL-3, (б) совместной работе с командами, разрабатывающими средства контроля ASL-3, для обеспечения того, чтобы эти средства были адаптированы к правильным рискам, и (в) картировании возможностей, с которыми стандарт ASL-3 не сможет справиться, и которые мы продолжим тестировать даже после его внедрения. Некоторые ключевые выводы:
- Каждое новое поколение моделей обладает эмерджентными возможностями, что делает предсказание свойств будущих моделей необычайно сложной задачей. Существует острая необходимость в дальнейшем моделировании угроз.
- Среди экспертов существуют обоснованные разногласия по поводу того, какие риски следует ставить на первое место и как новые возможности могут причинить вред, даже в относительно устоявшихся областях химической, биологической, радиологической и ядерной (ХБРЯ) безопасности. Общение с самым широким кругом экспертов в различных подобластях оказалось полезным ввиду отсутствия единого мнения.
- Попытки сделать модели угроз количественными оказались полезными для принятия решений о том, какие возможности и сценарии следует приоритизировать.
Наши команды Frontier Red Team, Alignment Science, тонкой настройки (Finituning) и стресс-тестирования выравнивания сосредоточены на создании оценок и улучшении нашей общей методологии. В настоящее время мы проводим тестирование перед развертыванием в области кибербезопасности, ХБРЯ и автономности моделей для передовых моделей, которые достигли 4-кратного превышения объема вычислений нашей последней протестированной модели (вы можете прочитать более подробное описание нашего последнего набора оценок модели Claude 3 Opus здесь). Мы также тестируем модели в процессе обучения, если они достигают этого порога, и перетестируем нашу наиболее способную модель каждые 3 месяца, чтобы учесть улучшения от тонкой настройки. Команды также сосредоточены на создании оценок в ряде новых областей для мониторинга возможностей, для которых стандарт ASL-3 по-прежнему будет непригоден, и наисследовании способов сделать весь процесс тестирования более надежным. Некоторые ключевые выводы:
- Быстрые итерационные циклы с профильными экспертами особенно ценны для понимания того, когда уровень сложности теста плохо откалиброван или задача оторвана от рассматриваемой модели угрозы.
- Мы должны все активнее стремиться задействовать и поощрять растущую экосистему исследователей и компаний в этой сфере. Многие из рисков, которые мы стремимся оценить, в особенности те, которые связаны с автономностью или несоответствием целей (misalignment), по своей сути сложны и носят спекулятивный характер, и наше собственное тестирование и моделирование угроз, вероятнее всего, неполны. Также будет ценным развитие зрелой внешней экосистемы, которая сможет адекватно оценивать качество наших заявлений, а также предлагать доступные тесты как услугу для компаний с меньшими ресурсами. Мы начали тестировать партнерские отношения с внешними организациями в этих областях.
- Различные методологии оценки имеют свои сильные и слабые стороны, и методы, которые наиболее убедительно оценивают возможности модели, будут различаться в зависимости от модели угроз или рассматриваемой области.
- Наборы данных типа «вопрос-ответ» относительно просты в разработке и быстро запускаются. Тем не менее, они могут не в полной мере отражать реальные риски из-за своих изначально ограниченных форматов. Команды продолжат изучать возможность разработки наборов данных, которые служат хорошими прокси-индикаторами для более сложных наборов задач и могут запускать более комплексный, трудоемкий процесс тестирования.
- Испытания с участием людей, сравнивающие производительность испытуемых с доступом к моделям и испытуемых с поисковыми системами, ценны для измерения областей, связанных с нецелевым использованием. Однако они трудоемки и требуют надежных, хорошо задокументированных и воспроизводимых процессов. Мы обнаружили, что для получения значимых сигналов по результатам испытаний особенно важно сосредоточиться на установлении хороших экспертных базовых показателей, обеспечении достаточного размера выборки и проведении тщательного статистического анализа. Мы изучаем способы масштабирования нашей инфраструктуры для проведения таких тестов.
- Оценки автоматизированных задач доказали свою информативность для моделей угроз, в которых модели действуют автономно. Однако создание реалистичных виртуальных сред — это один из наиболее ресурсоемких видов оценки. Такие задачи также требуют безопасной инфраструктуры и безопасного обращения с взаимодействиями моделей, включая ручную проверку использования инструментов человеком, когда задача затрагивает открытый интернет, блокировку потенциально вредоносных ответов и изолирование уязвимых машин для снижения масштаба возможных последствий. Эти факторы затрудняют масштабирование таких задач.
- Хотя они менее строги и воспроизводимы, чем описанные выше подходы, красные команды экспертов (expert red-teaming) и проверка поведения модели с помощью транскриптов также доказали свою ценность. Эти методы позволяют проводить более открытый анализ возможностей моделей и облегчают получение экспертных мнений об актуальности различных задач или вопросов оценки.
- Существует ряд нерешенных исследовательских вопросов, на которых наши команды сосредоточатся в ближайшие месяцы для создания надежного процесса оценки. Мы приветствуем дальнейшие исследования в этих областях со стороны более широкого исследовательского сообщества.
- Мы стремимся собирать данные о рисках моделей и готовить подходящие меры по их снижению до достижения опасных порогов. Это требует экстраполяции текущих данных на будущие уровни рисков. В идеале «законы масштабирования», ведущие к опасным возможностям, должны быть плавными, что позволит прогнозировать, когда у моделей могут развиться опасные возможности. В будущем мы надеемся научиться точно прогнозировать, насколько более способной в определенной области окажется модель следующего поколения.
- Для помощи моделям в более эффективном выполнении задач могут применяться различные методы, включая обучение с подкреплением на основе специфических для предметной области данных, инженерию промптов и контролируемую тонкую настройку. Это делает невозможным гарантировать, что мы выявляем все релевантные возможности модели в процессе тестирования. Хороший процесс оценки предполагает целенаправленные усилия по успешному прохождению тестов и инвестиции в улучшение выявления возможностей. Это важно для симуляции сценариев, в которых хорошо обеспеченные ресурсами злоумышленники обходят средства контроля безопасности и получают доступ к весам модели. Однако не существует четкой границы между попытками приложить колоссальные усилия для выявления опасной возможности в какой-то модели и простым обучением модели обладанию этой возможностью. Мы надеемся сделать более точные и принципиальные заявления о том, как должен выглядеть достаточный уровень выявления возможностей в будущих версиях политики.
- Существует значительная ценность в том, чтобы сделать наш процесс оценки рисков понятным для внешних наблюдателей. Поэтому мы стремимся заранее определять результаты тестов, которые, по нашему мнению, указывают на недопустимый уровень риска в случае непринятия мер по его снижению. Эти четкие обязательства помогают избежать давления со стороны производства, стимулирующего ослабление стандартов, хотя они неизбежно могут приводить к несколько грубым или произвольным пороговым значениям. Мы хотели бы изучить способы более эффективной агрегации различных источников данных, описанных выше, при сохранении внешней понятности для проверяемых обязательств. Аналогичным образом мы можем рассмотреть возможность включения других источников данных, таких как прогнозирование, которые широко используются в других отраслях.
Стандарт ASL-3
Наши команды по безопасности, науке об алгоритмах выравнивания, а также по доверию и безопасности (Trust and Safety) сосредоточились на разработке стандарта ASL-3. Их цель — спроектировать и внедрить набор средств контроля, которые в достаточной мере снизят риск кражи весов моделей негосударственными субъектами или нецелевого использования моделей через наши продуктовые интерфейсы. Этот стандарт был бы достаточен для многих моделей с возможностями, при которых даже низкий уровень злоупотреблений может привести к катастрофе. Однако его было бы недостаточно для противодействия возможностям, которые могут получить государственные группировки или группы со значительной поддержкой и ресурсами со стороны государства. Некоторые ключевые выводы:
- Наши текущие планы по обеспечению безопасного и ответственного использования моделей во всех наших продуктовых интерфейсах (например, Vertex, Bedrock, Claude.ai) включают масштабирование исследований моделей классификаторов для автоматического обнаружения и реагирования, а также укрепление всех аспектов традиционных практик доверия и безопасности.
- В отношении злоумышленного использования людьми мы считаем наиболее перспективным подход эшелонированной защиты (defense-in-depth). Он будет включать в себя использование комбинации обучения с подкреплением на основе отзывов людей (RLHF) и конституционального ИИ (Constitutional AI), систем классификаторов, обнаруживающих нарушения на нескольких этапах взаимодействия с пользователем (например, запросы пользователя, ответы модели и на уровне беседы), а также реагирование на инциденты и устранение уязвимостей для обхода защиты (jailbreaks). Создание практичной сквозной системы также потребует балансирования затрат, пользовательского опыта и надежности, опираясь на существующие архитектуры доверия и безопасности.
- Как описано в Политике ответственного масштабирования, мы проведем тестирование этой сквозной системы силами «красной команды» перед развертыванием, чтобы обеспечить устойчивость к сложным атакам. Мы подчеркиваем важность увязки усилий по снижению рисков напрямую с моделями угроз и обнаружили, что эти цели по снижению рисков улучшаются благодаря тесному сотрудничеству между командами, разрабатывающими наш подход красного тестирования, и исследователями, руководящими нашими усилиями по моделированию угроз и оценкам.
- Масштабирование нашей программы безопасности и разработка комплексной дорожной карты для защиты от широкого круга негосударственных субъектов потребовали огромных усилий: около 8% всех сотрудников Anthropic в настоящее время работают в смежных с безопасностью областях, и мы ожидаем, что эта доля будет расти по мере того, как модели будут становиться все более ценными с экономической точки зрения для злоумышленников. Модели угроз и цели безопасности, сформулированные в RSP, оказались особенно ценными для нашей команды безопасности, помогая расставить приоритеты и мотивировать необходимые изменения.
- Внедрение уровня безопасности, требуемого стандартом ASL-3, потребует изменения каждого аспекта повседневной работы сотрудников. Чтобы осуществить эти изменения продуманным образом, наша команда безопасности инвестировала значительное время в построение партнерских отношений с командами, особенно исследователями, для сохранения продуктивности и применения передовых средств кибербезопасности к инструментарию.
- Наше моделирование угроз исходит из того, что компрометация устройств инсайдеров является нашим вектором наибольшего риска. Учитывая это, одной из наших главных задач стала реализация многосторонней авторизации и контроля доступа с ограничением по времени для снижения риска эксфильтрации весов моделей. В рамках этой системы сотрудникам предоставляется временный доступ и только через минимально необходимый набор разрешений. К счастью, в Anthropic уже сформировалась культура экспертной оценки (peer review) в командах разработчиков программного обеспечения, исследований, коммуникаций и финансов, поэтому принятие многосторонних средств контроля по мере приближения к уровню ASL-3 стало благожелательно воспринятым продолжением этих существующих культурных норм.
- В столь быстро развивающейся области часто бывает сложно заранее определить меры по снижению рисков или даже методы, которые мы будем использовать для оценки их эффективности. Мы хотим брать на себя обязательства там, где это возможно, сохраняя при этом определенную степень свободы при появлении новой информации и ситуаций. Мы ожидаем, что и для стандарта ASL-3, и для будущих стандартов будет наиболее практичным предоставить высокоуровневый эскиз ожидаемых мер по снижению рисков и установить четкие стандарты «подтверждения» (attestation), которым они должны соответствовать перед использованием. Например, в отношении нашего стандарта безопасности мы можем прояснить цель защиты от негосударственных субъектов без предварительного указания детальных мер контроля и объединить это с разумным процессом подтверждения, включающим подробные списки средств контроля, рецензирование независимыми экспертами и одобрение советом директоров.
Структуры обеспечения соответствия
Наконец, наши команды по ответственному масштабированию, стресс-тестированию алгоритмов выравнивания и комплаенсу сосредоточились на изучении возможных структур управления, координации и обеспечения соответствия. Мы намерены со временем внедрить больше независимых проверок и планируем нанять менеджера по рискам для разработки этих структур с опорой на передовой опыт других отраслей и соответствующие исследования. Некоторые ключевые выводы:
- Сложность и межфункциональный характер описанных выше рабочих потоков требуют высокого уровня централизованной координации. Мы продолжим формировать команду по ответственному масштабированию для управления сложной сетью рабочих процессов и зависимостей. На фоне множества конкурирующих приоритетов мощная поддержка со стороны руководства также имела решающее значение для подтверждения того, что выявление и минимизация рисков от передовых моделей является приоритетом компании, заслуживающим значительных ресурсов.
- Ценность представляет создание «второй линии обороны» — команд, способных применить более состязательный подход к нашим основным рабочим процессам. Наша команда по стресс-тестированию алгоритмов выравнивания начала подвергать стресс-тестам наши оценки, вмешательства и общую реализацию политики. Например, команда представила размышления о потенциальном недостаточном выявлении возможностей (under-elicitation) вместе с нашим отчетом об оценках модели Claude 3 Opus, которые были переданы нашему Совету директоров и обобщены в нашем отчете для Бюро промышленности и безопасности Министерства торговли США. Со временем может иметь смысл создать специализированную внутреннюю аудиторскую функцию.
- В дополнение к предоставлению регулярных обновлений нашему Совету директоров и Трасту долгосрочных выгод, мы поделились отчетами об оценках и ежеквартальными отчетами о прогрессе в достижении будущих мер безопасности со всеми сотрудниками. Поощрение у сотрудников чувства причастности к RSP и возможности делиться идеями о том, как улучшить политику, оказалось чрезвычайно полезным: персонал использует свой разнообразный опыт для предоставления ценных идей. Недавно мы также внедрили политику сообщения о нарушениях, которая позволяет сотрудникам анонимно сообщать нашему специалисту по ответственному масштабированию о своих опасениях по поводу реализации нашей RSP.
Обеспечение ответственного обучения и развертывания будущих поколений передовых моделей потребует серьезных инвестиций как со стороны Anthropic, так и со стороны других участников отрасли и правительств. Наша Политика ответственного масштабирования стала мощным объединяющим фактором: в последние месяцы цели многих команд напрямую связывались с основными направлениями работы, описанными выше. Достигнутый нами прогресс в оперативном внедрении мер безопасности за этот период потребовал активного участия команд со всей компании Anthropic, и предстоит сделать еще очень многое. Наша цель при публикации этих размышлений в преддверии предстоящего Саммита по искусственному интеллекту в Сеуле (AI Seoul Summit) — продолжить дискуссию о создании продуманных, эмпирически обоснованных структур для управления рисками от передовых моделей. Мы с нетерпением ждем возможности увидеть, как другие компании принимают собственные структуры и делятся своим опытом, что приведет к выработке общих передовых практик и послужит основой для будущих усилий правительств.
Полный текст статьи читайте на Anthropic
