Представляем GPT‑5.4 mini и nano

Быстрые и эффективные модели, оптимизированные для написания кода и субагентов
Сегодня мы выпускаем GPT‑5.4 mini и nano — наши самые производительные небольшие модели на сегодняшний день. Они переносят многие преимущества GPT‑5.4 в более быстрые и эффективные модели, созданные для рабочих нагрузок с высоким объемом запросов.
GPT‑5.4 mini значительно превосходит GPT‑5 mini в задачах программирования, рассуждений, мультимодального понимания и использования инструментов, работая при этом более чем в 2 раза быстрее. Она также приближается к производительности более крупной модели GPT‑5.4 по результатам ряда тестов, включая SWE-Bench Pro и OSWorld-Verified.
GPT‑5.4 nano — это самая маленькая и дешевая версия GPT‑5.4 для задач, где скорость и стоимость имеют первостепенное значение. Она также представляет собой значительный шаг вперед по сравнению с GPT‑5 nano. Мы рекомендуем её для классификации, извлечения данных, ранжирования и субагентов программирования, выполняющих более простые вспомогательные задачи.
Эти модели созданы для тех рабочих нагрузок, где задержка напрямую влияет на пользовательский опыт: ассистенты программиста, которым необходимо быть отзывчивыми, субагенты, быстро выполняющие вспомогательные задачи, системы управления компьютером, захватывающие и интерпретирующие скриншоты, а также мультимодальные приложения, способные анализировать изображения в реальном времени. В таких сценариях лучшей моделью часто оказывается не самая крупная, а та, которая способна быстро отвечать, надежно использовать инструменты и при этом хорошо справляться со сложными профессиональными задачами.
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| SWE-Bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
1 Наивысшее доступное для GPT‑5 mini значение reasoning_effort — «high».
Вот что думают наши пользователи после тестирования GPT‑5.4 mini и nano в своих рабочих процессах:
Программирование
GPT‑5.4 mini и nano особенно эффективны в рабочих процессах разработки, где важна быстрая итерация. Модели с низким уровнем задержки справляются с точечными правками, навигацией по кодовой базе, генерацией интерфейсов и циклами отладки, что делает их отличным выбором для задач программирования, которые нужно выполнять быстрее и с меньшими затратами.
В бенчмарках GPT‑5.4 mini стабильно превосходит GPT‑5-mini при аналогичных задержках и приближается к показателям успешного выполнения уровня GPT‑5.4, работая при этом значительно быстрее. Это обеспечивает одно из лучших соотношений производительности и задержки для рабочих процессов разработки.
Мы оцениваем задержку, анализируя поведение наших моделей в продакшене и имитируя его в офлайн-режиме. Оценка задержки учитывает длительность вызовов инструментов (время выполнения кода), сгенерированные токены и входные токены. Реальная задержка может существенно отличаться и зависит от множества факторов, не учтенных в нашей симуляции. Аналогичным образом, затраты оцениваются на основе цен на API этих моделей на момент написания статьи. В будущем цены могут измениться. Уровни усилий рассуждения (reasoning_effort) варьировались от low до xhigh.
Субагенты
GPT‑5.4 mini также отлично подходит для систем, объединяющих модели разного размера. Например, в Codex более крупная модель, такая как GPT‑5.4, может брать на себя планирование, координацию и финальное принятие решений, делегируя параллельные подзадачи (вроде поиска по кодовой базе, ревью крупного файла или обработки вспомогательных документов) субагентам на базе GPT‑5.4 mini. Узнайте, как работают субагенты в Codex, в документации.
Этот паттерн становится все более полезным по мере того, как маленькие модели становятся быстрее и функциональнее. Вместо того чтобы использовать одну модель для всего, разработчики могут проектировать системы, где крупные модели решают, что делать, а небольшие модели быстро выполняют работу в больших масштабах. GPT‑5.4 mini — наша сильнейшая мини-модель для рабочих процессов такого типа.
Использование компьютера
GPT‑5.4 mini также сильна в мультимодальных задачах, особенно связанных с использованием компьютера. Модель способна быстро интерпретировать скриншоты насыщенных пользовательских интерфейсов для оперативного выполнения задач. В тесте OSWorld-Verified модель GPT‑5.4 mini приближается к GPT‑5.4, существенно превосходя при этом GPT‑5 mini.
Доступность и цены
GPT‑5.4 mini доступна уже сегодня в API, Codex и ChatGPT.
В API модель GPT‑5.4 mini поддерживает текстовые и визуальные входящие данные, использование инструментов, вызов функций, веб-поиск, поиск по файлам, использование компьютера и навыки. Она имеет контекстное окно в 400 тыс. токенов и стоит $0.75 за 1 млн входных токенов и $4.50 за 1 млн выходных токенов.
В Codex модель GPT‑5.4 mini доступна в приложении Codex, CLI, расширении для IDE и веб-версии. Она использует всего 30% квоты GPT‑5.4, позволяя разработчикам быстро решать более простые задачи программирования в Codex примерно за треть стоимости. Codex также может делегировать задачи субагентам GPT‑5.4 mini, чтобы менее интенсивная по части рассуждений работа выполнялась на более дешевой модели.
В ChatGPT модель GPT‑5.4 mini доступна пользователям Free и Go с помощью функции «Thinking» в меню +. Для всех остальных пользователей GPT‑5.4 mini доступна в качестве резервного варианта при превышении лимитов для GPT‑5.4 Thinking.
GPT‑5.4 nano доступна только через API и стоит $0.20 за 1 млн входных токенов и $1.25 за 1 млн выходных токенов.
Дополнительную информацию о мерах безопасности моделей можно найти в приложении к системной карте в нашем центре безопасности развертывания (Deployment Safety Hub).
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| SWE-bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| MCP Atlas | 67.2% | 57.7% | 56.1% | 47.6% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| τ2-bench (telecom) | 98.9% | 93.4% | 92.5% | 74.1% |
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| HLE w/ tool | 52.1% | 41.5% | 37.7% | 31.6% |
| HLE w/o tools | 39.8% | 28.2% | 24.3% | 18.3% |
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
| MMMUPro w/ Python | 81.5% | 78.0% | 69.5% | 74.1% |
| MMMUPro | 81.2% | 76.6% | 66.1% | 67.5% |
| OmniDocBench 1.5 (no tools)² — чем меньше, тем лучше | 0.109 | 0.1263 | 0.2419 | 0.1791 |
| GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) | |
|---|---|---|---|---|
| OpenAI MRCR v2 8-needle 64K–128K | 86.0% | 47.7% | 44.2% | 35.1% |
| OpenAI MRCR v2 8-needle 128K–256K | 79.3% | 33.6% | 33.1% | 19.4% |
| Graphwalks BFS 0K–128K | 93.1% | 76.3% | 73.4% | 73.4% |
| Graphwalks parents 0–128K (accuracy) | 89.8% | 71.5% | 50.8% | 64.3% |
1 Максимальное значение reasoning_effort, доступное для GPT‑5 mini, — 'high'.
2 Общее расстояние редактирования (Overall Edit Distance). Тест OmniDocBench запускался с параметром reasoning_effort, установленным в значение 'none', чтобы продемонстрировать производительность при низкой стоимости и низкой задержке.
Автор
Полный текст статьи читайте на OpenAI
