Представляем GPT‑5.4 mini и nano

5.4_Mini_Nano_Hero___SEO.png?w=1600&h=90

Быстрые и эффективные модели, оптимизированные для написания кода и субагентов

Сегодня мы выпускаем GPT‑5.4 mini и nano — наши самые производительные небольшие модели на сегодняшний день. Они переносят многие преимущества GPT‑5.4 в более быстрые и эффективные модели, созданные для рабочих нагрузок с высоким объемом запросов.

GPT‑5.4 mini значительно превосходит GPT‑5 mini в задачах программирования, рассуждений, мультимодального понимания и использования инструментов, работая при этом более чем в 2 раза быстрее. Она также приближается к производительности более крупной модели GPT‑5.4 по результатам ряда тестов, включая SWE-Bench Pro и OSWorld-Verified.

GPT‑5.4 nano — это самая маленькая и дешевая версия GPT‑5.4 для задач, где скорость и стоимость имеют первостепенное значение. Она также представляет собой значительный шаг вперед по сравнению с GPT‑5 nano. Мы рекомендуем её для классификации, извлечения данных, ранжирования и субагентов программирования, выполняющих более простые вспомогательные задачи.

Эти модели созданы для тех рабочих нагрузок, где задержка напрямую влияет на пользовательский опыт: ассистенты программиста, которым необходимо быть отзывчивыми, субагенты, быстро выполняющие вспомогательные задачи, системы управления компьютером, захватывающие и интерпретирующие скриншоты, а также мультимодальные приложения, способные анализировать изображения в реальном времени. В таких сценариях лучшей моделью часто оказывается не самая крупная, а та, которая способна быстро отвечать, надежно использовать инструменты и при этом хорошо справляться со сложными профессиональными задачами.

GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
SWE-Bench Pro (Public)57.7%54.4%52.4%45.7%
Terminal-Bench 2.075.1%60.0%46.3%38.2%
Toolathlon54.6%42.9%35.5%26.9%
GPQA Diamond93.0%88.0%82.8%81.6%
OSWorld-Verified75.0%72.1%39.0%42.0%

1 Наивысшее доступное для GPT‑5 mini значение reasoning_effort — «high».

Вот что думают наши пользователи после тестирования GPT‑5.4 mini и nano в своих рабочих процессах:

Программирование

GPT‑5.4 mini и nano особенно эффективны в рабочих процессах разработки, где важна быстрая итерация. Модели с низким уровнем задержки справляются с точечными правками, навигацией по кодовой базе, генерацией интерфейсов и циклами отладки, что делает их отличным выбором для задач программирования, которые нужно выполнять быстрее и с меньшими затратами.

В бенчмарках GPT‑5.4 mini стабильно превосходит GPT‑5-mini при аналогичных задержках и приближается к показателям успешного выполнения уровня GPT‑5.4, работая при этом значительно быстрее. Это обеспечивает одно из лучших соотношений производительности и задержки для рабочих процессов разработки.

Мы оцениваем задержку, анализируя поведение наших моделей в продакшене и имитируя его в офлайн-режиме. Оценка задержки учитывает длительность вызовов инструментов (время выполнения кода), сгенерированные токены и входные токены. Реальная задержка может существенно отличаться и зависит от множества факторов, не учтенных в нашей симуляции. Аналогичным образом, затраты оцениваются на основе цен на API этих моделей на момент написания статьи. В будущем цены могут измениться. Уровни усилий рассуждения (reasoning_effort) варьировались от low до xhigh.

Субагенты

GPT‑5.4 mini также отлично подходит для систем, объединяющих модели разного размера. Например, в Codex более крупная модель, такая как GPT‑5.4, может брать на себя планирование, координацию и финальное принятие решений, делегируя параллельные подзадачи (вроде поиска по кодовой базе, ревью крупного файла или обработки вспомогательных документов) субагентам на базе GPT‑5.4 mini. Узнайте, как работают субагенты в Codex, в документации.

Этот паттерн становится все более полезным по мере того, как маленькие модели становятся быстрее и функциональнее. Вместо того чтобы использовать одну модель для всего, разработчики могут проектировать системы, где крупные модели решают, что делать, а небольшие модели быстро выполняют работу в больших масштабах. GPT‑5.4 mini — наша сильнейшая мини-модель для рабочих процессов такого типа.

Использование компьютера

GPT‑5.4 mini также сильна в мультимодальных задачах, особенно связанных с использованием компьютера. Модель способна быстро интерпретировать скриншоты насыщенных пользовательских интерфейсов для оперативного выполнения задач. В тесте OSWorld-Verified модель GPT‑5.4 mini приближается к GPT‑5.4, существенно превосходя при этом GPT‑5 mini.

Доступность и цены

GPT‑5.4 mini доступна уже сегодня в API, Codex и ChatGPT.

В API модель GPT‑5.4 mini поддерживает текстовые и визуальные входящие данные, использование инструментов, вызов функций, веб-поиск, поиск по файлам, использование компьютера и навыки. Она имеет контекстное окно в 400 тыс. токенов и стоит $0.75 за 1 млн входных токенов и $4.50 за 1 млн выходных токенов.

В Codex модель GPT‑5.4 mini доступна в приложении Codex, CLI, расширении для IDE и веб-версии. Она использует всего 30% квоты GPT‑5.4, позволяя разработчикам быстро решать более простые задачи программирования в Codex примерно за треть стоимости. Codex также может делегировать задачи субагентам GPT‑5.4 mini, чтобы менее интенсивная по части рассуждений работа выполнялась на более дешевой модели.

В ChatGPT модель GPT‑5.4 mini доступна пользователям Free и Go с помощью функции «Thinking» в меню +. Для всех остальных пользователей GPT‑5.4 mini доступна в качестве резервного варианта при превышении лимитов для GPT‑5.4 Thinking.

GPT‑5.4 nano доступна только через API и стоит $0.20 за 1 млн входных токенов и $1.25 за 1 млн выходных токенов.

Дополнительную информацию о мерах безопасности моделей можно найти в приложении к системной карте в нашем центре безопасности развертывания (Deployment Safety Hub).

Написание кода
GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
SWE-bench Pro (Public)57.7%54.4%52.4%45.7%
Terminal-Bench 2.075.1%60.0%46.3%38.2%
Вызов инструментов
GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
MCP Atlas67.2%57.7%56.1%47.6%
Toolathlon54.6%42.9%35.5%26.9%
τ2-bench (telecom)98.9%93.4%92.5%74.1%
Интеллект
GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
GPQA Diamond93.0%88.0%82.8%81.6%
HLE w/ tool52.1%41.5%37.7%31.6%
HLE w/o tools39.8%28.2%24.3%18.3%
Мультимодальность / Зрение / CUA
GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
OSWorld-Verified75.0%72.1%39.0%42.0%
MMMUPro w/ Python81.5%78.0%69.5%74.1%
MMMUPro81.2%76.6%66.1%67.5%
OmniDocBench 1.5 (no tools)² — чем меньше, тем лучше0.1090.12630.24190.1791
Длинный контекст
GPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high¹)
OpenAI MRCR v2 8-needle 64K–128K86.0%47.7%44.2%35.1%
OpenAI MRCR v2 8-needle 128K–256K79.3%33.6%33.1%19.4%
Graphwalks BFS 0K–128K93.1%76.3%73.4%73.4%
Graphwalks parents 0–128K (accuracy)89.8%71.5%50.8%64.3%

1 Максимальное значение reasoning_effort, доступное для GPT‑5 mini, — 'high'.

2 Общее расстояние редактирования (Overall Edit Distance). Тест OmniDocBench запускался с параметром reasoning_effort, установленным в значение 'none', чтобы продемонстрировать производительность при низкой стоимости и низкой задержке.

Автор

OpenAI

Полный текст статьи читайте на OpenAI