OpenAI o1‑mini

Развитие экономически эффективного рассуждения.
Мы выпускаем OpenAI o1‑mini — экономически эффективную модель для логических рассуждений. o1‑mini превосходно справляется с задачами STEM, особенно в математике и программировании, практически не уступая производительности OpenAI o1 на таких тестовых бенчмарках, как AIME и Codeforces. Мы ожидаем, что o1‑mini станет более быстрой и экономичной моделью для приложений, требующих логического мышления без обширных знаний об окружающем мире.
Сегодня мы запускаем o1‑mini для пользователей API 5-го уровня по цене на 80% ниже, чем у OpenAI o1‑preview. Пользователи ChatGPT Plus, Team, Enterprise и Edu могут использовать o1‑mini в качестве альтернативы o1‑preview с более высокими лимитами запросов и меньшей задержкой (см. Скорость модели).
Оптимизировано для рассуждений в области STEM
Большие языковые модели, такие как o1, предварительно обучены на огромных текстовых датасетах. Хотя эти высокоемкие модели обладают обширными знаниями об окружающем мире, их использование в реальных приложениях может быть дорогим и медленным. В отличие от них, o1‑mini — это более компактная модель, оптимизированная для рассуждений в сфере STEM на этапе предварительного обучения. После обучения с использованием того же конвейера обучения с подкреплением (RL) с высокими вычислительными затратами, что и o1, o1‑mini достигает сопоставимой производительности во многих полезных задачах на логику, оставаясь при этом значительно более экономичной.
При оценке на бенчмарках, требующих интеллекта и логических рассуждений, o1‑mini показывает хорошие результаты по сравнению с o1‑preview и o1. Однако o1‑mini хуже справляется с задачами, требующими не-STEM фактологических знаний (см. Ограничения).
Математика: На математической олимпиаде старшеклассников AIME модель o1‑mini (70.0%) конкурирует с o1 (74.4%) при значительно более низкой стоимости и превосходит o1‑preview (44.6%). Результат o1‑mini (около 11/15 вопросов) ставит её примерно в число 500 лучших старшеклассников США.
Программирование: На сайте соревнований Codeforces модель o1‑mini набирает 1650 баллов Elo, что также сопоставимо с o1 (1673) и выше, чем у o1‑preview (1258). Этот показатель Elo выводит модель примерно на 86-й перцентиль программистов, соревнующихся на платформе Codeforces. o1‑mini также хорошо показывает себя на бенчмарке программирования HumanEval и в школьных соревнованиях по кибербезопасности Capture the Flag (CTF).
STEM: На некоторых академических бенчмарках, требующих логических рассуждений, таких как GPQA (естественные науки) и MATH-500, o1‑mini превосходит GPT‑4o. o1‑mini уступает GPT‑4o в таких задачах, как MMLU, а также отстает от o1‑preview на бенчмарке GPQA из-за нехватки обширных знаний об окружающем мире.
Оценка предпочтений людей: Мы попросили экспертов-асессоров сравнить o1‑mini с GPT‑4o на сложных запросах с открытым концом из различных областей, используя ту же методологию, что и в нашем сравнении o1‑preview и GPT‑4o. Как и в случае с o1‑preview, модель o1‑mini предпочтительнее GPT‑4o в областях, требующих глубоких рассуждений, но не имеет преимущества перед GPT‑4o в задачах, связанных преимущественно с обработкой языка.
Скорость модели
В качестве конкретного примера мы сравнили ответы моделей GPT‑4o, o1‑mini и o1‑preview на вопрос на логику слов. Хотя GPT‑4o не ответила правильно, модели o1‑mini и o1‑preview справились с задачей, причем o1‑mini выдала ответ примерно в 3–5 раз быстрее.
Сравнение скорости чата
Безопасность
Модель o1‑mini обучена с использованием тех же методов выравнивания и безопасности, что и o1‑preview. Устойчивость модели к взлому (jailbreak) на внутренней версии датасета StrongREJECT на 59% выше по сравнению с GPT‑4o. Перед развертыванием мы тщательно оценили риски безопасности o1‑mini, используя те же подходы к оценке готовности, внешнему тестированию на проникновение (red-тестированию) и оценкам безопасности, что и для o1‑preview. Подробные результаты этих оценок мы публикуем в прилагаемой карточке системы (system card).
Метрика | GPT‑4o | o1‑mini |
% безопасных завершений (отказ на вредоносные промпты) (стандартно) | 0.99 | 0.99 |
% безопасных завершений на вредоносные промпты (сложные случаи: джейлбрейки и краевые случаи) | 0.714 | 0.932 |
% соответствия на безопасных краевых случаях («отсутствие избыточных отказов») | 0.91 | 0.923 |
Оценка качества@0.1 для оценки джейлбрейков StrongREJECT (Souly et al. 2024) | 0.22 | 0.83 |
Оценка джейлбрейков на основе действий человека | 0.77 | 0.95 |
Ограничения и дальнейшие шаги
Из-за своей специализации на возможностях рассуждения в области STEM (наука, технология, инженерия и математика), фактические знания o1‑mini по не-STEM темам, таким как даты, биографии и общие знания, сопоставимы с небольшими языковыми моделями, такими как GPT‑4o mini. Мы устраним эти ограничения в будущих версиях, а также поэкспериментируем с расширением модели на другие модальности и специальности за пределами STEM.
Авторы
Полный текст статьи читайте на OpenAI
