Системная карта OpenAI o3‑mini

Системная карта OpenAI o3-mini
Конкретные области риска
- Запрещенный контент
- Обход защиты (Jailbreaks)
- Галлюцинации
Сводная таблица готовности
- ХБРЯ (химические, биологические, радиологические и ядерные материалы)Средний
- КибербезопасностьНизкий
- УбеждениеСредний
- Автономность моделиСредний
Оценки в таблице
- Низкий
- Средний
- Высокий
- Критический
К развертыванию допускаются только модели с оценкой «средний» или ниже после применения мер по снижению рисков.
Дальнейшая разработка разрешена только для моделей с оценкой «высокий» или ниже после применения мер по снижению рисков.
Введение
Серия моделей OpenAI o обучена с использованием масштабного обучения с подкреплением для рассуждения с помощью цепочки мыслей (chain of thought). Эти расширенные возможности рассуждения открывают новые пути для повышения безопасности и надежности наших моделей. В частности, наши модели могут учитывать наши правила техники безопасности в контексте при ответе на потенциально небезопасные запросы благодаря согласованному выравниванию (deliberative alignment). Благодаря этому OpenAI o3‑mini достигает уровня передовых показателей на определенных бенчмарках для таких рисков, как генерация противоправных советов, выбор стереотипных ответов и подверженность известным методам обхода защиты. Обучение моделей включению цепочки мыслей перед ответом способно принести существенные преимущества, одновременно увеличивая потенциальные риски, обусловленные повышенным интеллектом.
В рамках Методологии обеспечения готовности (Preparedness Framework), Консультативная группа OpenAI по безопасности (SAG) рекомендовала классифицировать модель OpenAI o3‑mini (до применения мер по снижению рисков) как модель со средним общим уровнем риска. Она оценивается как имеющая средний риск в категориях «Убеждение», «ХБРЯ» (химические, биологические, радиологические и ядерные материалы) и «Автономность модели», а также низкий риск в категории «Кибербезопасность». К развертыванию допускаются только модели с оценкой «Средний» или ниже после применения мер по снижению рисков, а дальнейшая разработка разрешена только для моделей с оценкой «Высокий» или ниже после применения мер по снижению рисков.
Благодаря улучшенным показателям в написании кода и инженерных исследованиях, OpenAI o3‑mini стала первой моделью, достигшей среднего уровня риска в категории «Автономность модели». Тем не менее, она все еще демонстрирует слабые результаты в оценках, предназначенных для тестирования реальных возможностей машинного обучения в исследованиях, необходимых для самосовершенствования, что требуется для получения классификации «Высокий». Наши результаты подчеркивают необходимость создания надежных методов выравнивания, тщательного тестирования их эффективности на стресс-тестах и соблюдения скрупулезных протоколов управления рисками.
В данном отчете описана работа по безопасности, проделанная для модели OpenAI o3‑mini, включая оценку безопасности, независимое стороннее тестирование на проникновение (red teaming) и оценки в рамках Методологии обеспечения готовности.
Авторы
Полный текст статьи читайте на OpenAI
