Как GPT‑5.6 объединяет передовой интеллект с передовой эффективностью

Мы разработали семейство моделей GPT‑5.6 так, чтобы соблюсти баланс между возможностями и стоимостью во всем спектре задач, для которых пользователи применяют наши модели. Наша флагманская модель GPT‑5.6 Sol с максимальным уровнем рассуждений превосходит Claude Fable 5 в индексе агентов программирования Artificial Analysis (Artificial Analysis Coding Agent Index) при менее чем половине стоимости. Terra демонстрирует столь же высокие результаты на бенчмарках интеллекта, как и GPT‑5.5, но при этом вдвое дешевле, а Luna — наша самая быстрая и доступная модель, которая стоит на 80% дешевле Sol. Чтобы обеспечить такую эффективность, наши исследовательские и технические команды провели масштабную оптимизацию на каждом ключевом уровне нашей архитектуры. Эти улучшения охватывают сами модели, инференс (процесс запуска моделей для генерации вывода) и нашу агентскую обвязку (harness), которая используется как в Codex, так и в ChatGPT Work.

За последние четыре года число активных пользователей наших моделей выросло до 1 миллиарда, а количество компаний-клиентов превысило 2 миллиона. На протяжении всего этого времени эффективность оставалась ключевым фактором для того, чтобы сделать преимущества искусственного интеллекта доступными каждому. Наша миссия — гарантировать, что общий искусственный интеллок (AGI) принесет пользу всему человечеству. В эти годы мы непрерывно работали над расширением возможностей оптимизации во всей нашей инфраструктуре, чтобы предлагать самые производительные модели на любой точке кривой «стоимость — интеллект». Наивысшей эффективности по показателю «интеллект на токен» нам удалось достичь в GPT‑5.6, которая обучена выполнять больше работы на один токен. В процессе обучения мы оптимизируем систему как по успешности выполнения задач, так и по эффективности, настраивая модель на выбор более прямого пути решения задачи.

В этой статье мы выходим за рамки самих моделей и рассказываем о том, как мы добились эффективности за счет достижений в двух других ключевых компонентах нашей архитектуры: 1) инференс — за счет оптимизации таких процессов, как балансировка нагрузки, спекулятивное детокенизирование (speculative decoding), кэширование и оптимизация кернелов (ядер), что позволяет получать больше результатов на том же «железе», и 2) наша агентская обвязка — включая более эффективное управление раздуванием контекста, использованием инструментов и повторной работой. Мы также расскажем о роли GPT‑5.6 Sol в автономном достижении многих из этих улучшений. Хотя каждое отдельное улучшение может показаться незначительным, в совокупности эти достижения позволяют нам находиться на переднем крае как в отношении интеллекта, так и в отношении эффективности.

Diagram showing GPT-5.6 efficiency across the agent harness, API orchestration, and model inference, producing less network data, less CPU work, and more GPU output.

Ускорение инференса с помощью GPT‑5.6 Sol

В мире с ограниченными вычислительными ресурсами, где спрос на модели растет быстрее, чем пропускная способность, эффективность лежит в основе проектирования любой системы. Это особенно справедливо для нашей архитектуры инференса, которая запускает обученные модели для генерации ответов. Наша главная задача — обслуживать больше токенов на том же «железе», сохраняя при этом уровень интеллекта, задержки (latency), доступность и надежность, которых ожидают пользователи.

Достижение этой цели требует оптимизации всей системы в целом. Модель может быть высокоэффективной сама по себе, но оставаться дорогой в обслуживании, если запросы распределяются неэффективно, оборудование простаивает, а перемещение данных замедляет вычисления. Улучшения на каждом уровне суммируются: выигрыш обеспечивается за счет оптимизации маршрутизации (куда отправляются запросы), планирования (когда они отправляются), кернелов (программного обеспечения, выполняющегося на GPU), кэширования (сохранения и повторного использования результатов работы) и реализации моделей (порядка выполнения кода на GPU). Модель GPT‑5.6 Sol в Codex сыграла ключевую роль во всех этих направлениях оптимизации.

Первый важный пример — балансировка нагрузки. В глобальном масштабе мы направляем запросы с учетом таких факторов, как география, доступная емкость и тип ускорителя (тип GPU или специализированного чипа, на котором работает модель). Внутри кластера мы распределяем работу между экземплярами модели в зависимости от нагрузки, длины контекста, доступности кэша и других характеристик запроса. Наконец, внутри каждого экземпляра работа должна эффективно распределяться между ускорителями, подсетями модели и вычислительными ядрами. GPT‑5.6 Sol в Codex помогает нам анализировать рабочий трафик, выявлять ранее упущенные источники дисбаланса, тестировать новые стратегии маршрутизации и постоянно настраивать эти эвристики. Только эти улучшения балансировки нагрузки драматически снизили стоимость обслуживания наших моделей.

Мы также использовали GPT‑5.6 Sol для оптимизации прямого прогона (forward pass) модели — вычислений, которые преобразуют входные данные в предсказания следующих токенов. Даже когда отдельные операции выполняются быстро, избыточные перемещения памяти, синхронизация и неэффективная организация данных могут приводить к простоям GPU. Чтобы избежать этого, GPT‑5.6 Sol находила задачи, которые можно было предварительно вычислить, предотвратить или распараллелить. С помощью Codex модель GPT‑5.6 Sol автономно переписала и оптимизировала наши производственные кернелы — базовый код, который выполняет математические операции, составляющие основу модели. Отчасти это удалось благодаря тому, что мы обучили GPT‑5.6 эффективно писать и улучшать кернелы на языках Triton и Gluon (это два открытых языка программирования для GPU, поддерживаемых OpenAI). Эти усилия в сочетании с общими усовершенствованиями кернелов от GPT‑5.6 Sol снизили сквозные затраты на инференс на 20%. Мы также вложили значительные средства в инструменты верификации, такие как инструмент с открытым исходным кодом FpSan (Floating-Point Sanitizer), помогающий проверять корректность кернелов, написанных GPT‑5.6 Sol.

Спекулятивное детокенизирование (speculative decoding) — еще один рычаг повышения скорости и эффективности. Этот метод заключается в задействовании небольшой предварительной модели (или «спекулянта»), работающей параллельно с основной моделью и предлагающей сразу несколько токенов для одновременной проверки основной моделью. Когда эти предложения принимаются, система может генерировать несколько выходных токенов за один проход главной модели, сокращая объем ресурсоемких последовательных вычислений. GPT‑5.6 Sol улучшила собственную вспомогательную модель, спроектировав и проведя сотни экспериментов с ее архитектурой, тестируя изменения размера, структуры и функций. Кроме того, GPT‑5.6 Sol запускала и отслеживала процесс обучения спекулятивной модели, автономно вмешиваясь при возникновении проблем, включая аппаратные сбои и нестабильность обучения. Полученные в результате улучшения повысили эффективность генерации токенов более чем на 15%.

При обработке некэшированных входных токенов модель создает кэш ключей-значений (KV cache) за один ресурсоемкий проход; при генерации вывода она многократно читает этот кэш и расширяет его. Оптимальная конфигурация для обслуживания запросов (такая как батчинг, шардирование и управление KV-кэшем) сильно зависит от рабочей нагрузки — длины промпта и ответа, размера батча, коэффициента попадания в кэш, характеристик запросов и многого другого. Однако ранее пространство конфигураций было слишком велико для систематической настройки, что заставляло инженеров полагаться на общие эвристические подходы. Используя GPT‑5.6 Sol в Codex, мы смогли проанализировать производственные нагрузки, сгенерировать и оценить различные конфигурации-кандидаты, а также гипер-оптимизировать настройку движка и модели под каждый сценарий. Это делает новый уровень специфичной для нагрузок оптимизации практичным, позволяя извлекать больше полезной производительности инференса из того же оборудования.

Оптимизация инференса — это непрерывный цикл обратной связи. Мы измеряем поведение системы в реальных условиях, выявляем основные узкие места, вносим изменения и проверяем, что они улучшают всю систему в целом, а не какой-то изолированный бенчмарк. GPT‑5.6 Sol и Codex ускоряют каждый этап этого цикла. Благодаря этому наша команда может исследовать больше идей, быстрее реагировать на изменение рабочих нагрузок и создавать архитектуру инференса с меньшей задержкой, большей пропускной способностью и сниженными затратами для пользователей.

Как наша агентская обвязка оптимизирует повторяющуюся работу

ChatGPT Work и Codex выполняют сложные задачи посредством серии запросов к модели и вызовов инструментов. За один цикл взаимодействия — от запроса пользователя до финального ответа — Codex может изучить исходный код, выполнить поиск по истории деплоев, прочитать отчеты об инцидентах, отредактировать файл и запустить тесты. Каждый из этих шагов может требовать отдельного запроса.

Подготовка контекста, передача данных, запуск инференса, вызов инструментов и запуск процессов требуют времени и вычислительных ресурсов. Если для выполнения задачи требуется 30 запросов к модели, даже одна дополнительная секунда на каждый запрос в сумме дает ощутимую задержку. Повышение общей производительности означает сокращение объема повторяющейся работы во всей системе, а не просто ускорение самой модели.

A user task enters the model, which can call a tool, receive a result, and make another model decision repeatedly before completing the task.

Один пользовательский запрос может содержать множество итераций модели и инструментов. Любые издержки внутри повторяющейся области могут оплачиваться многократно.

Эти множители затрат легли в основу нашей агентской обвязки, представляющей собой уровень оркестрации на Rust, который связывает воедино наши модели, инструменты и окружение пользователя. Далее мы расскажем о том, как предотвращение раздувания контекста, загрузка инструментов и повторное использование результатов делают каждый запрос более эффективным.

Предотвращение раздувания контекста

По мере того как агенты получают доступ к все большему числу инструментов, навыков, плагинов и истории бесед, контекстные окна могут легко разрастаться. Это увеличивает стоимость, отвлекает модель и провоцирует ненужные рассуждения. Обвязка помогает снизить эти издержки за счет отложенного обнаружения (deferred discovery), благодаря которому интеграции, пользовательские инструменты MCP, навыки и плагины становятся видимыми только тогда, когда это необходимо. Обвязка также предотвращает непреднамеренное расходование контекстного окна отдельными инструментами и интеграциями MCP. По умолчанию вывод инструментов ограничивается 10 000 токенов, если модель не запрашивает иной лимит.

Сохранение точных префиксов для кэширования промптов

Как упоминалось ранее, цикл работы агента может отправлять одни и те же инструкции, историю бесед, определения инструментов и предыдущие результаты на GPU несколько раз в течение одного хода взаимодействия. Обработка этих повторяющихся входных данных обходится дорого, поэтому кэширование промптов повторно использует вычисления, связанные с ранее обработанным префиксом промпта. Чтобы сохранить этот префикс, обвязка обрабатывает всю видимую для модели историю как неизменяемую структуру с добавлением данных только в конец (append-only): новые сообщения, результаты работы инструментов и обновления окружения добавляются в самый конец, а не вставляются в более ранний контекст. Инструменты также выводятся в детерминированном порядке, в то время как настройки среды выполнения (например, политики подтверждения) применяются во время выполнения, а не встраиваются в определения инструментов. Этот выбор архитектуры вносит значительный вклад в высокие показатели попадания в кэш промптов для Codex и ChatGPT Work.

Three requests compare bytes sent over a persistent connection with the growing context seen by the model and the prefix eligible for cache reuse.

Инкрементальная передача изменяет то, что пересылается по сети; кэширование подсказок (prompt caching) изменяет то, что модель может не пересчитывать заново. Ширина является концептуальной, а дополнительный слой сжатия не показан.

Эффективность по всей кривой интеллекта

Прирост эффективности, достигнутый в GPT‑5.6, является результатом многолетних комплексных улучшений на всех уровнях стека, охватывающих исследования, инференс и нашу агентную среду. Роль GPT‑5.6 в реализации многих из этих усовершенствований заставляет нас с оптимизмом смотреть на то, как будут ускоряться темпы оптимизации. Мы продолжим проводить масштабную оптимизацию в таких областях, как оптимизация ядер, наряду с фундаментальными улучшениями нашего стека. Мы с нетерпением ждем возможности предоставить эти постоянные внутренние улучшения нашим пользователям и клиентам в виде более доступного и экономичного интеллекта.

Особая благодарность Мэтью Феррари (Matthew Ferrari), Филиппу Тилле (Philippe Tillet), Ахмеду Ибрагиму (Ahmed Ibrahim), Джо Гершенсону (Joe Gershenson) и Стиву Коффи (Steve Coffey), сотрудникам технического отдела, за их вклад в эту публикацию.

Автор

Мэтью Феррари, Фил Тиллет, Ахмед Ибрагим, Джо Гершенсон, Стив Коффи

Полный текст статьи читайте на OpenAI