Реагирование на новый рубеж критических кибервозможностей

Кибербезопасность стремительно меняется по мере того, как модели становятся все более эффективными способами, которые могут как укреплять киберзащиту, так и делать возможными атаки с беспрецедентными скоростью и масштабом.
Наши последние внутренние оценки Astra, одной из наших будущих моделей, проведенные за последние несколько дней, указывают на значительные успехи в области агентского написания кода и кибербезопасности. Эти результаты в сочетании с экспертными оценками привели нас вчера вечером к выводу, что мы не можем исключить наличие критических кибервозможностей в рамках нашей Концепции готовности (Preparedness Framework).
Мы делимся этой информацией, потому что считаем важным быть прозрачными перед общественностью, а также сообществами специалистов по безопасности и защищенности в отношении этого потенциального изменения возможностей.
Мы впервые опубликовали нашу Концепцию готовности в декабре 2023 года, задолго до того, как модели приблизились к биологическим, химическим и кибернетическим возможностям, а также возможностям самосовершенствования ИИ на таком уровне. Мы создали ее, чтобы получить руководство для выявления прогресса в возможностях и последующего планирования действий нашей компании по мере появления этих возможностей. Предыдущие модели, включая GPT‑5.6‑Sol, оценивались на предмет передовых кибервозможностей и были оценены по высокому (а не критическому) порогу.
Оценка критических возможностей в области кибербезопасности
Согласно нашей Концепции готовности, модель достигает критического порога кибербезопасности, если она может выявлять и разрабатывать функциональные атаки нулевого дня всех уровней серьезности во многих защищенных критически важных системах реального мира без вмешательства человека, либо способна разрабатывать и осуществлять комплексные новые стратегии кибератак против укрепленных целей, получая на вход лишь высокоуровневую желаемую цель.
Хотя мы продолжаем проводить бенчмаркинг и оценку этой модели, наши предварительные оценки указывают на достаточно высокую производительность, из-за которой мы не можем исключить критический уровень возможностей на данный момент. Astra — это будущая модель, и она не участвовала в эксплуатации уязвимостей Hugging Face.
Принимаемые нами меры
Соответственно, мы расширили тестирование наших средств защиты и элементов управления безопасностью на устойчивость, чтобы они соответствовали развертыванию таких возможностей. На внутреннем уровне мы также предприняли следующие шаги для обеспечения того, чтобы дальнейшая разработка этой модели велась безопасно и надежно:
- Мы внедряем более строгие меры контроля безопасности для моделей с более высокими возможностями и сопутствующей деятельности, включая изолированные тестовые среды, ограниченный доступ к сети и инструментам, усиленную защиту и шифрование весов модели, дополнительные возможности мониторинга и обнаружения, а также изолированное выполнение (песочницу).
- Мы временно приостанавливаем внутреннюю деятельность с использованием Astra, которая еще не соответствует этим ужесточенным требованиям контроля безопасности.
- Мы внедрили универсальный мониторинг рискованных действий и отклонений в поведении (мизалаймента) во всех агентских приложениях Astra, включая обучение и оценку. Мониторы оценивают ход мыслей (Chain of Thought) модели и запускают реакцию безопасности для проверки и прерывания деятельности с высоким уровнем риска.
- Мы будем сотрудничать с соответствующими правительственными ведомствами и избранными организациями по безопасности ИИ для тестирования возможностей этой модели.
- Мы предоставим рекомендуемые средства контроля безопасности сторонним партнерам по тестированию для безопасного проведения оценок и рабочих нагрузок с более высоким уровнем риска.
Эта концепция уже помогала нам проходить через другие переходы возможностей. В июне 2025 года, когда наши модели приблизились к высокому порогу возможностей в области биологии в рамках Концепции готовности, мы изложили шаги, которые мы предпринимаем для укрепления мер защиты, расширения тестирования, работы с внешними экспертами и развертывания дополнительных средств контроля безопасности. Мы применяем тот же принцип и здесь.
Мы считаем, что передовые модели с кибервозможностями должны помогать защитникам выявлять и устранять уязвимости раньше злоумышленников. Мы стремимся работать бок о бок с правительствами, институтами безопасности и гражданским обществом, чтобы гарантировать, что передовые возможности таких моделей, как Astra, и тех, что последуют за ними, развертываются ответственно и широко на благо всего человечества.
Автор
Полный текст статьи читайте на OpenAI
