Реагирование на новый рубеж критических кибервозможностей

Frame.png?w=1600&h=900&fit=fill

Кибербезопасность стремительно меняется по мере того, как модели становятся все более эффективными способами, которые могут как укреплять киберзащиту, так и делать возможными атаки с беспрецедентными скоростью и масштабом.

Наши последние внутренние оценки Astra, одной из наших будущих моделей, проведенные за последние несколько дней, указывают на значительные успехи в области агентского написания кода и кибербезопасности. Эти результаты в сочетании с экспертными оценками привели нас вчера вечером к выводу, что мы не можем исключить наличие критических кибервозможностей в рамках нашей Концепции готовности (Preparedness Framework).

Мы делимся этой информацией, потому что считаем важным быть прозрачными перед общественностью, а также сообществами специалистов по безопасности и защищенности в отношении этого потенциального изменения возможностей.

Мы впервые опубликовали нашу Концепцию готовности в декабре 2023 года, задолго до того, как модели приблизились к биологическим, химическим и кибернетическим возможностям, а также возможностям самосовершенствования ИИ на таком уровне. Мы создали ее, чтобы получить руководство для выявления прогресса в возможностях и последующего планирования действий нашей компании по мере появления этих возможностей. Предыдущие модели, включая GPT‑5.6‑Sol, оценивались на предмет передовых кибервозможностей и были оценены по высокому (а не критическому) порогу.

Оценка критических возможностей в области кибербезопасности 

Согласно нашей Концепции готовности, модель достигает критического порога кибербезопасности, если она может выявлять и разрабатывать функциональные атаки нулевого дня всех уровней серьезности во многих защищенных критически важных системах реального мира без вмешательства человека, либо способна разрабатывать и осуществлять комплексные новые стратегии кибератак против укрепленных целей, получая на вход лишь высокоуровневую желаемую цель. 

Хотя мы продолжаем проводить бенчмаркинг и оценку этой модели, наши предварительные оценки указывают на достаточно высокую производительность, из-за которой мы не можем исключить критический уровень возможностей на данный момент. Astra — это будущая модель, и она не участвовала в эксплуатации уязвимостей Hugging Face. 

Принимаемые нами меры

Соответственно, мы расширили тестирование наших средств защиты и элементов управления безопасностью на устойчивость, чтобы они соответствовали развертыванию таких возможностей. На внутреннем уровне мы также предприняли следующие шаги для обеспечения того, чтобы дальнейшая разработка этой модели велась безопасно и надежно:  

  • Мы внедряем более строгие меры контроля безопасности для моделей с более высокими возможностями и сопутствующей деятельности, включая изолированные тестовые среды, ограниченный доступ к сети и инструментам, усиленную защиту и шифрование весов модели, дополнительные возможности мониторинга и обнаружения, а также изолированное выполнение (песочницу).
  • Мы временно приостанавливаем внутреннюю деятельность с использованием Astra, которая еще не соответствует этим ужесточенным требованиям контроля безопасности.
  • Мы внедрили универсальный мониторинг рискованных действий и отклонений в поведении (мизалаймента) во всех агентских приложениях Astra, включая обучение и оценку. Мониторы оценивают ход мыслей (Chain of Thought) модели и запускают реакцию безопасности для проверки и прерывания деятельности с высоким уровнем риска.
  • Мы будем сотрудничать с соответствующими правительственными ведомствами и избранными организациями по безопасности ИИ для тестирования возможностей этой модели.
  • Мы предоставим рекомендуемые средства контроля безопасности сторонним партнерам по тестированию для безопасного проведения оценок и рабочих нагрузок с более высоким уровнем риска. 

Эта концепция уже помогала нам проходить через другие переходы возможностей. В июне 2025 года, когда наши модели приблизились к высокому порогу возможностей в области биологии в рамках Концепции готовности, мы изложили шаги, которые мы предпринимаем для укрепления мер защиты, расширения тестирования, работы с внешними экспертами и развертывания дополнительных средств контроля безопасности. Мы применяем тот же принцип и здесь.

Мы считаем, что передовые модели с кибервозможностями должны помогать защитникам выявлять и устранять уязвимости раньше злоумышленников. Мы стремимся работать бок о бок с правительствами, институтами безопасности и гражданским обществом, чтобы гарантировать, что передовые возможности таких моделей, как Astra, и тех, что последуют за ними, развертываются ответственно и широко на благо всего человечества.

Автор

OpenAI

Полный текст статьи читайте на OpenAI