Наша обновленная концепция готовности (Preparedness Framework)

Представляем нашу обновленную концепцию оценки и предотвращения серьезного ущерба от возможностей передовых моделей ИИ.

Читать документ полностью
OpenAI Preparedness Framework illustration

Мы выпускаем обновление нашей концепции готовности (Preparedness Framework) — процесса отслеживания и подготовки к появлению продвинутых возможностей ИИ, которые могут создать новые риски нанесения серьезного ущерба. По мере того как наши модели становятся все более функциональными, безопасность в возрастающей степени будет зависеть от наличия надежных средств защиты в реальном мире.

Это обновление включает в себя более четкую направленность на конкретные риски, имеющие наибольшее значение, более строгие требования к тому, что означает «достаточное минимизирование» этих рисков на практике, а также более понятные операционные рекомендации по оценке, регулированию и раскрытию информации о наших мерах безопасности. Кроме того, мы представляем исследовательские категории, ориентированные на будущее, которые позволяют нам оставаться на передовом рубеже понимания развивающихся возможностей и идти в ногу с направлением развития технологий. Мы продолжим вкладывать значительные средства в этот процесс, делая нашу работу по обеспечению готовности более практичной, строгой и прозрачной по мере развития технологий.

Мы извлекли много полезного из собственного тестирования, идей внешних экспертов и практического опыта. Это обновление отражает достигнутый прогресс. В соответствии с нашими ключевыми принципами безопасности, в нем реализованы целевые улучшения, которые включают:

  • Четкие критерии для приоритизации возможностей высокого риска. Мы используем структурированный процесс оценки рисков, чтобы определить, может ли передовая возможность привести к серьезному ущербу, и относим ее к определенной категории на основе заданных критериев. Мы отслеживаем возможности, которые соответствуют пяти ключевым критериям, делающим их приоритетными для заблаговременной подготовки: риск должен быть правдоподобным, измеримым, серьезным, принципиально новым, а также мгновенным или непоправимым. Мы измеряем прогресс в отношении этих возможностей и создаем средства защиты от рисков, которые они порождают.
  • Более четкие категории возможностей. Мы обновили классификацию возможностей, чтобы применить эти критерии и отразить наше текущее понимание.
    • Отслеживаемые категории (Tracked Categories): Это устоявшиеся направления, для которых у нас есть отработанные методы оценки и действующие средства защиты. К ним относятся биологические и химические возможности, возможности в сфере кибербезопасности, а также возможности самосовершенствования ИИ. Мы по-прежнему считаем, что некоторые из наиболее преобразующих преимуществ ИИ будут связаны с его использованием в науке, инженерии и исследованиях, в том числе благодаря возможностям из наших отслеживаемых категорий. Ранние инвестиции как в оценку, так и в средства защиты для этих категорий двойного назначения позволят нам безопасно раскрыть преимущества, которые мы ожидаем от их использования.
    • Исследовательские категории (Research Categories): Мы вводим набор исследовательских категорий возможностей — это области, которые могут представлять риски серьезного ущерба, но пока не соответствуют нашим критериям для отнесения к отслеживаемым категориям. Мы работаем над созданием моделей угроз и оценки передовых возможностей для этих областей. Текущие направления включают автономность на больших дистанциях, маскировку (намеренное занижение показателей эффективности), автономную репликацию и адаптацию, подрыв средств защиты, а также ядерные и радиологические угрозы.
    • Риски, связанные с убеждением (persuasion risks), будут рассматриваться за пределами концепции готовности, в том числе через нашу спецификацию моделей (Model Spec), ограничение использования наших инструментов для политической агитации или лоббирования, а также в рамках наших постоянных расследований случаев ненадлежащего использования наших продуктов (включая обнаружение и пресечение операций влияния).
  • Уточненные уровни возможностей. Мы оптимизировали уровни до двух четких пороговых значений, которые соответствуют конкретным операционным обязательствам: высокий уровень возможностей (High capability), который может усилить существующие пути нанесения серьезного ущерба, и критический уровень возможностей (Critical capability), который может создать беспрецедентные новые пути нанесения серьезного ущерба. Охватываемые системы, достигающие высокого уровня возможностей, должны иметь средства защиты, которые в достаточной степени минимизируют сопутствующий риск серьезного ущерба до их развертывания. Системы, достигающие критического уровня возможностей, также требуют наличия средств защиты, которые в достаточной степени минимизируют сопутствующие риски в процессе разработки. Консультативная группа по безопасности (Safety Advisory Group, SAG), междисциплинарная команда внутренних лидеров в области безопасности, оценивает, достаточно ли средства защиты минимизируют серьезный риск, и дает целенаправленные рекомендации — от одобрения развертывания до запроса дополнительной оценки или более надежных мер защиты. Их рекомендации передаются руководству OpenAI для принятия окончательных решений с сохранением обязательства переоценивать средства защиты при появлении новых данных.
  • Масштабируемые оценки для поддержки более частых тестирований. Достижения в области рассуждения позволяют нам совершенствовать модели чаще и иногда без проведения масштабных циклов нового обучения. Это означает, что методы оценки также должны масштабироваться. Мы создали растущий набор автоматизированных оценок, которые могут успевать за этим ускоренным темпом, продолжая при этом проводить «глубокие погружения» под руководством экспертов, чтобы гарантировать, что масштабируемые оценки измеряют именно то, что нужно.
  • Реагирование на изменения на передовом рубеже. Если другой разработчик передовых систем ИИ выпустит систему высокого риска без сопоставимых средств защиты, мы можем скорректировать наши требования. Однако сначала мы тщательно подтвердим, что ландшафт рисков действительно изменился, публично заявим о том, что вносим коррективы, оценим, что корректировка существенно не увеличивает общий риск серьезного ущерба, и при этом сохраним более высокий уровень защиты.
  • Определенные отчеты о средствах защиты (Safeguards Reports). Мы сосредоточились на выпуске отчетов о возможностях (Capabilities Reports, ранее известных как «Табло готовности» — Preparedness Scorecard), которые оценивают, перешла ли модель порог, создающий риски. Теперь мы добавляем больше деталей о том, как мы будем разрабатывать надежные средства защиты и проверять их эффективность в специализированных отчетах о средствах защиты, что соответствует нашему принципу эшелонированной защиты (defense in depth), который будет определять решения о развертывании. SAG рассматривает оба отчета, оценивает остаточный риск и дает руководству OpenAI рекомендации относительно того, является ли система достаточно безопасной для развертывания.

Мы продолжим публиковать наши выводы в рамках концепции готовности при каждом выпуске передовых моделей, как мы это делали для GPT‑4o, OpenAI o1, Operator, o3‑mini, deep research и GPT‑4.5, а также делиться новыми бенчмарками для поддержки более широких усилий по обеспечению безопасности в масштабах всей отрасли.

Мы искренне благодарны внутренним командам, внешним исследователям и коллегам по индустрии, которые внесли неоценимый вклад в это последнее обновление. Концепция готовности остается «живым» документом, и мы планируем продолжать ее обновление по мере получения новых знаний.

Автор

OpenAI

Полный текст статьи читайте на OpenAI