OpenAI o1‑mini

o1-mini-research.png?w=1600&h=900&fit=fi

Развитие экономически эффективного рассуждения.

Вклад в разработку

Мы выпускаем OpenAI o1‑mini — экономически эффективную модель для логических рассуждений. o1‑mini превосходно справляется с задачами STEM, особенно в математике и программировании, практически не уступая производительности OpenAI o1 на таких тестовых бенчмарках, как AIME и Codeforces. Мы ожидаем, что o1‑mini станет более быстрой и экономичной моделью для приложений, требующих логического мышления без обширных знаний об окружающем мире.

Сегодня мы запускаем o1‑mini для пользователей API 5-го уровня по цене на 80% ниже, чем у OpenAI o1‑preview. Пользователи ChatGPT Plus, Team, Enterprise и Edu могут использовать o1‑mini в качестве альтернативы o1‑preview с более высокими лимитами запросов и меньшей задержкой (см. Скорость модели).

Оптимизировано для рассуждений в области STEM

Большие языковые модели, такие как o1, предварительно обучены на огромных текстовых датасетах. Хотя эти высокоемкие модели обладают обширными знаниями об окружающем мире, их использование в реальных приложениях может быть дорогим и медленным. В отличие от них, o1‑mini — это более компактная модель, оптимизированная для рассуждений в сфере STEM на этапе предварительного обучения. После обучения с использованием того же конвейера обучения с подкреплением (RL) с высокими вычислительными затратами, что и o1, o1‑mini достигает сопоставимой производительности во многих полезных задачах на логику, оставаясь при этом значительно более экономичной.

При оценке на бенчмарках, требующих интеллекта и логических рассуждений, o1‑mini показывает хорошие результаты по сравнению с o1‑preview и o1. Однако o1‑mini хуже справляется с задачами, требующими не-STEM фактологических знаний (см. Ограничения).

Математическая производительность по сравнению со стоимостью вывода
AIMEСтоимость вывода (%)

Математика: На математической олимпиаде старшеклассников AIME модель o1‑mini (70.0%) конкурирует с o1 (74.4%) при значительно более низкой стоимости и превосходит o1‑preview (44.6%). Результат o1‑mini (около 11/15 вопросов) ставит её примерно в число 500 лучших старшеклассников США.

Программирование: На сайте соревнований Codeforces модель o1‑mini набирает 1650 баллов Elo, что также сопоставимо с o1 (1673) и выше, чем у o1‑preview (1258). Этот показатель Elo выводит модель примерно на 86-й перцентиль программистов, соревнующихся на платформе Codeforces. o1‑mini также хорошо показывает себя на бенчмарке программирования HumanEval и в школьных соревнованиях по кибербезопасности Capture the Flag (CTF).

Codeforces
90012581650Elo
HumanEval
90.2%92.4%92.4%Точность
Соревнования CTF по кибербезопасности
20.0%43.0%28.7%Точность (Pass@12)

STEM: На некоторых академических бенчмарках, требующих логических рассуждений, таких как GPQA (естественные науки) и MATH-500, o1‑mini превосходит GPT‑4o. o1‑mini уступает GPT‑4o в таких задачах, как MMLU, а также отстает от o1‑preview на бенчмарке GPQA из-за нехватки обширных знаний об окружающем мире.

MMLU0-shot CoT
92.3%90.8%85.2%88.7%
GPQADiamond, 0-shot CoT
77.3%73.3%60.0%53.6%
MATH-5000-shot CoT
94.8%85.5%90.0%60.3%

Оценка предпочтений людей: Мы попросили экспертов-асессоров сравнить o1‑mini с GPT‑4o на сложных запросах с открытым концом из различных областей, используя ту же методологию, что и в нашем сравнении o1‑preview и GPT‑4o. Как и в случае с o1‑preview, модель o1‑mini предпочтительнее GPT‑4o в областях, требующих глубоких рассуждений, но не имеет преимущества перед GPT‑4o в задачах, связанных преимущественно с обработкой языка.

Оценка человеческих предпочтений в сравнении с chatgpt-4o-latest
ДоменДоля побед по сравнению с GPT-4o (%)

Скорость модели

В качестве конкретного примера мы сравнили ответы моделей GPT‑4o, o1‑mini и o1‑preview на вопрос на логику слов. Хотя GPT‑4o не ответила правильно, модели o1‑mini и o1‑preview справились с задачей, причем o1‑mini выдала ответ примерно в 3–5 раз быстрее.

Сравнение скорости чата

Безопасность

Модель o1‑mini обучена с использованием тех же методов выравнивания и безопасности, что и o1‑preview. Устойчивость модели к взлому (jailbreak) на внутренней версии датасета StrongREJECT на 59% выше по сравнению с GPT‑4o. Перед развертыванием мы тщательно оценили риски безопасности o1‑mini, используя те же подходы к оценке готовности, внешнему тестированию на проникновение (red-тестированию) и оценкам безопасности, что и для o1‑preview. Подробные результаты этих оценок мы публикуем в прилагаемой карточке системы (system card).

Метрика

GPT‑4o

o1‑mini

% безопасных завершений (отказ на вредоносные промпты) (стандартно)

0.99

0.99

% безопасных завершений на вредоносные промпты (сложные случаи: джейлбрейки и краевые случаи)

0.714

0.932

% соответствия на безопасных краевых случаях («отсутствие избыточных отказов»)

0.91

0.923

Оценка качества@0.1 для оценки джейлбрейков StrongREJECT  (Souly et al. 2024⁠)

0.22

0.83

Оценка джейлбрейков на основе действий человека

0.77

0.95

Ограничения и дальнейшие шаги

Из-за своей специализации на возможностях рассуждения в области STEM (наука, технология, инженерия и математика), фактические знания o1‑mini по не-STEM темам, таким как даты, биографии и общие знания, сопоставимы с небольшими языковыми моделями, такими как GPT‑4o mini. Мы устраним эти ограничения в будущих версиях, а также поэкспериментируем с расширением модели на другие модальности и специальности за пределами STEM.

Авторы

OpenAI

Полный текст статьи читайте на OpenAI