Представляем GPT‑5.3‑Codex‑Spark

Сверхбыстрая модель для написания кода в реальном времени в Codex.
Сегодня мы выпускаем предварительную исследовательскую версию GPT‑5.3‑Codex‑Spark — уменьшенной версии GPT‑5.3‑Codex и нашей первой модели, созданной для написания кода в реальном времени. Codex-Spark знаменует собой первый важный этап в нашем партнерстве с Cerebras, о котором мы объявили в январе. Модель Codex-Spark оптимизирована для обеспечения практически мгновенной работы на оборудовании с ультранизкой задержкой, выдавая более 1000 токенов в секунду и оставаясь при этом крайне эффективной для реальных задач программирования.
Мы делимся Codex-Spark на платформе Cerebras в качестве исследовательской превью-версии с пользователями ChatGPT Pro, чтобы разработчики могли начать экспериментировать уже сейчас, пока мы работаем с Cerebras над наращиванием емкости датацентров, улучшением пользовательского опыта и развертыванием наших более крупных передовых моделей.
Наши новейшие передовые модели продемонстрировали особую силу в выполнении долгосрочных задач, работая автономно в течение часов, дней или недель без вмешательства человека. Codex-Spark — это наша первая модель, разработанная специально для работы с Codex в реальном времени: внесения целевых правок, изменения логики или доработки интерфейсов с мгновенным получением результатов. Благодаря Codex-Spark система Codex теперь поддерживает как амбициозные долгосрочные задачи, так и оперативную работу «на лету». Мы надеемся извлечь пользу из опыта использования модели разработчиками и учесть их отзывы по мере расширения доступа.
На момент запуска Codex-Spark имеет окно контекста размером 128 тыс. токенов и работает только с текстом. В период исследовательской превью-версии для Codex-Spark будут действовать собственные лимиты запросов, а ее использование не будет учитываться в стандартных лимитах. Тем не менее, в периоды высокой нагрузки вы можете столкнуться с ограничениями доступа или временным помещением в очередь по мере того, как мы обеспечиваем баланс надежности для всех пользователей.
Скорость и интеллект
Codex-Spark оптимизирована для интерактивной работы, где задержка имеет такое же значение, как и интеллектуальные возможности. Вы можете сотрудничать с моделью в реальном времени, прерывая ее или перенаправляя в процессе работы, а также быстро итеративно улучшать код благодаря практически мгновенным ответам. Поскольку модель настроена на скорость, ее стандартный стиль работы отличается легковесностью: она вносит минимальные, целенаправленные правки и не запускает тесты автоматически, если вы об этом не попросите.
Программирование
Codex-Spark — это высокоэффективная небольшая модель, оптимизированная для быстрого вывода. На SWE-Bench Pro и Terminal-Bench 2.0, двух бенчмарках для оценки возможностей агентной разработки программного обеспечения, GPT‑5.3‑Codex‑Spark демонстрирует высокую производительность, выполняя задачи за малую долю времени по сравнению с GPT‑5.3‑Codex.
Продолжительность оценивается как сумма: (1) времени генерации вывода (выходные токены ÷ скорость выборки), (2) времени предварительного заполнения (токены префилла ÷ скорость префилла), (3) общего времени выполнения инструментов и (4) общих сетевых накладных расходов.
Снижение задержки для всех моделей
В процессе обучения Codex-Spark стало очевидно, что скорость модели — это лишь часть уравнения для совместной работы в реальном времени; нам также потребовалось сократить задержку во всем конвейере запросов и ответов. Мы внедрили улучшения задержки «от конца до конца» (end-to-end) в нашей инфраструктуре, которые принесут пользу всем моделям. «Под капотом» мы оптимизировали передачу потоковых ответов от клиента к серверу и обратно, переписали ключевые фрагменты стека вывода и переработали инициализацию сеансов, чтобы первый видимый токен появлялся быстрее, а Codex оставался отзывчивым по мере ваших итераций. Благодаря внедрению постоянного WebSocket-соединения и целевым оптимизациям в Responses API мы сократили накладные расходы на каждый цикл «клиент-сервер» на 80%, накладные расходы на токен — на 30%, а время до появления первого токена — на 50%. Путь через WebSocket включен для Codex-Spark по умолчанию и скоро станет стандартным для всех моделей.
На базе Cerebras
Codex-Spark работает на процессоре Wafer Scale Engine 3 от Cerebras — специализированном ИИ-ускорителе для высокоскоростного вывода, обеспечивающем для Codex уровень обслуживания с приоритетом низкой задержки. Мы объединили усилия с Cerebras, чтобы добавить этот низколатентный путь в тот же производственный стек обслуживания, что и остальной наш парк, благодаря чему он бесшовно работает в Codex и закладывает основу для поддержки будущих моделей.
«Больше всего в GPT-5.3-Codex-Spark нас привлекает партнерство с OpenAI и сообществом разработчиков с целью узнать, какие возможности открывает быстрый вывод: новые паттерны взаимодействия, новые сценарии использования и принципиально иной опыт работы с моделью. Это превью — только начало».
Графические процессоры (GPU) остаются фундаментальной основой наших конвейеров обучения и вывода, обеспечивая наиболее экономически эффективные токены для широкого использования. Cerebras дополняет эту базу, превосходно справляясь с рабочими нагрузками, требующими экстремально низкой задержки, что сужает петлю обратной связи и делает Codex более отзывчивым по мере итераций. GPU и Cerebras можно комбинировать для единых рабочих нагрузок для достижения максимальной производительности.
Доступность и детали
Codex-Spark сегодня выходит в формате исследовательской превью-версии для пользователей ChatGPT Pro в последних версиях приложения Codex, CLI и расширения для VS Code. Поскольку модель работает на специализированном оборудовании с низкой задержкой, ее использование регулируется отдельным лимитом запросов, который может корректироваться в зависимости от нагрузки в ходе предварительного просмотра. Кроме того, мы делаем Codex-Spark доступной через API для небольшой группы дизайн-партнеров, чтобы понять, как разработчики хотят интегрировать модель в свои продукты. Мы будем расширять доступ в ближайшие недели по мере дальнейшей настройки интеграции в условиях реальных рабочих нагрузок.
В настоящее время Codex-Spark поддерживает только текст с размером окна контекста 128 тыс. токенов и является первой в семействе сверхбыстрых моделей. По мере того как мы вместе с сообществом разработчиков будем узнавать, где именно быстрые модели проявляют себя лучше всего при написании кода, мы будем внедрять новые возможности, включая модели большего размера, увеличенную длину контекста и мультимодальный ввод.
Codex-Spark прошла такое же обучение по безопасности, что и наши основные модели, включая обучение по вопросам кибербезопасности. Мы оценили Codex-Spark в рамках нашего стандартного процесса развертывания, который включает базовые оценки кибервозможностей и других аспектов, и пришли к выводу, что у модели нет правдоподобных шансов достичь порога нашего Фреймворка готовности (Preparedness Framework) для высоких возможностей в области кибербезопасности или биологии.
Что дальше
Codex-Spark — это первый шаг к Codex с двумя взаимодополняющими режимами: рассуждениями и выполнением задач на дальнюю перспективу, а также сотрудничеством в реальном времени для быстрой итерации. Со временем эти режимы объединятся: Codex сможет поддерживать тесный интерактивный цикл с вами, делегируя фоновые долгосрочные задачи субагентам или распределяя задачи между множеством моделей параллельно, когда вам нужны широта охвата и скорость, избавляя вас от необходимости выбирать единственный режим заранее.
По мере того как модели становятся более способными, скорость взаимодействия превращается в очевидное «узкое горлышко». Сверхбыстрый вывод сужает этот цикл, делая использование Codex более естественным и расширяя границы возможного для каждого, кто превращает идею в работающее программное обеспечение.
Автор
Полный текст статьи читайте на OpenAI
