OpenAI предложила правила внешнего аудита безопасности своих моделей
- OpenAI представила свод из 7 принципов и 4 направлений для долгосрочного аудита надежности своих систем независимыми экспертами.
- Проверки с «серым» доступом охватят безопасность обучения, защиту от джейлбрейков, риски биоугроз и расследования критических инцидентов.
- Компания уже ведет переговоры с несколькими сторонними организациями о запуске пилотных проектов по новой схеме.
OpenAI опубликовала свод принципов и приоритетов для проведения внешнего аудита безопасности своих моделей. Документ описывает 4 направления, по которым независимые организации — частные и некоммерческие — смогут проверять утверждения лаборатории о надёжности систем. В отличие от предварительных оценок перед запуском продуктов, новые процедуры рассчитаны на длительную и глубокую проверку, не привязанную к конкретным релизам.
Первое направление — независимая оценка «кейсов безопасности» (safety cases), охватывающих обучение, тестирование, внутреннее и внешнее развёртывание моделей. Аудиторы должны будут ответить на вопрос: подтверждаются ли заявления компании о безопасности реальными данными и соблюдались ли заявленные условия на всех этапах. Отдельно экспертам предстоит проверить, не создают ли методы обучения стимулы для обмана, саботажа или обхода ограничений со стороны ИИ.

Второе направление касается критических защитных механизмов — от мониторинга дезадаптации до защиты от джейлбрейков. Проверяющие получат «серый» доступ к системам, чтобы в реалистичных условиях протестировать, насколько надёжно фильтры блокируют вредоносные запросы в сферах кибербезопасности и биооружия, и где именно защита даёт сбой.
Третье направление — аудит тестов на возможности из категорий риска Preparedness Framework (химические и биологические угрозы, киберугрозы, способность ИИ к самоулучшению) и тестов на риски дезадаптации.
Четвёртое, наиболее чувствительное направление — независимое расследование критических инцидентов сбоя моделей. В качестве примера приводится случай со взломом платформы Hugging Face, когда привлечение внешней стороны оказалось оправданным.
От оценщиков потребуют экспертизу в киберкриминалистике, анализе цепочек рассуждений моделей и технике расследований. OpenAI подчёркивает, что выводы таких проверок могут напрямую влиять на «кейс безопасности» конкретной модели.
Лаборатория также сформулировала 7 принципов проведения аудита: заранее согласованный объём проверки и регистрируемые «заявления о безопасности», пропорциональный доступ к данным с учётом ограничений по интеллектуальной собственности, прозрачная методология, подтверждённая экспертиза и независимость оценщиков, защита конфиденциальности, практические рекомендации по исправлению уязвимостей и ответственная практика публикации отчётов. OpenAI заявила, что уже ведёт переговоры с несколькими сторонними организациями о пилотных проектах в рамках новой схемы.
© iXBT
Об этом также пишут
- TheNextWeb.ru OpenAI разрешит сторонним группам тестировать свои модели во время обучения 22.09.2026 21:25
- TheNextWeb.ru OpenAI назвала четыре вещи, которые должны протестировать специалисты по безопасности 22.09.2026 22:20
- 3DNews «Ставки растут»: OpenAI пустит сторонних проверяющих на более ранние этапы разработки ИИ-моделей 23.09.2026 11:10
