Руководство по GPT-5.6 для разработчиков

Технические уроки от стартапов, использующих технологию в продакшене
GPT‑5.6 устанавливает новый стандарт соотношения цены и производительности
Семейство моделей GPT‑5.6 делает производительность агентных систем передового уровня значительно более доступной, одновременно расширяя границы возможного.
В этом руководстве мы показываем, как стартапы используют более продуманный выбор моделей и новые элементы управления API для обеспечения непрерывности рассуждений, мультиагентной оркестровки и программного вызова инструментов с целью создания более быстрых и мощных агентов за малую часть прежней стоимости.
Улучшенный пользовательский опыт «из коробки»
Начиная с GPT‑5, каждое новое поколение моделей стремилось решать задачи на более длинных горизонтах с меньшим количеством токенов. GPT‑5.6 продолжает эту тенденцию: более высокая производительность агентов, более низкие затраты и минимальные изменения в базовой инфраструктуре обвязки (harness).
Улучшения в общей экономической эффективности сочетаются с повышенной точностью при меньших затратах на рассуждения (reasoning effort). Например, в бенчмарке Agents» Last Exam модель GPT‑5.6 Sol с «низким» уровнем рассуждений превзошла GPT‑5.5 с «высоким» уровнем при неизменной инфраструктуре. Мы наблюдали аналогичные успешные результаты при тестировании в продакшене, где стартапы сообщают о существенном снижении затрат для различных рабочих процессов за счет уменьшения интенсивности рассуждений по сравнению с предыдущими настройками по умолчанию.
»Мы интегрировали GPT‑5.6 в нашу рабочую среду, и низкий уровень рассуждений дал нам наилучшие результаты. Модель понимала, когда данных просто не хватало, не тратила время на тупиковые ветки и находила правильный ответ, используя меньше токенов.»— Иззи Миллер (Izzy Miller), руководитель отдела исследований ИИ, Hex
Выбор модели
Исторически переход на флагманскую модель с максимальной доступностью рассуждений был лучшим вариантом для долгосрочных сценариев использования. Во многом это было связано с тем, что такие модели значительно превосходили оптимизированные по стоимости аналоги в работе с большими контекстами и вызове инструментов. С появлением семейства 5.6 ситуация изменилась: благодаря увеличению вычислительных ресурсов во время тестирования (test-time compute) модели Luna и Terra часто демонстрируют производительность, сопоставимую с GPT‑5.4 и 5.5, при значительно более низкой стоимости.
»Luna сохраняет 98% точности извлечения данных GPT‑5.5 при стоимости, составляющей одну восемнадцатую от прежней. Это дает нашим агентам возможность качественного понимания документов по цене, которая делает такое решение практичным для гораздо большего числа рабочих процессов.»— Сергей Щоголев, ведущий инженер по разработке агентов, Hypha
Рассмотрим задачи в BrowseComp — поисковом бенчмарке, который проверяет способность модели искать малоизвестные факты. Три месяца назад GPT‑5.5 (Extra High) набрала 84,36% в этом бенчмарке при общей стоимости $33,27. На момент запуска GPT‑5.6 Luna (Extra High) обеспечивает практически ту же производительность, набирая 84,04% при стоимости $1,33. С тех пор мы еще больше снизили цены. Подробнее о нашем последнем снижении цен.
Меньшие по размеру модели семейства 5.6 отлично подходят для высоконагруженных сценариев, взаимодействий, чувствительных к задержкам, и повторяющихся шагов в агентных рабочих процессах. Например, если вы управляете стартапом в сфере юридических технологий, который анализирует рукописные служебные записки перед агентским анализом, вместо использования флагманской модели для всего сценария вы можете задействовать Terra или Luna для извлечения данных и добиться существенной экономии средств.
Развитие Responses API для проектирования более эффективных агентов
Помимо повышения производительности GPT‑5.6 «из коробки», мы также добавили в Responses API новые примитивы для достижения дополнительных преимуществ. Мы обучили GPT‑5.6 сквозным образом с использованием трех взаимодополняющих архитектурных решений, которые позволяют агентам работать более эффективно:
- Повторное использование уже проделанной работы: благодаря возможности сохранения рассуждений между вызовами модели и использованию нативного сжатия для компрессии долгосрочных диалогов, модель может поддерживать логическую связность своей работы на более длинных горизонтах задач без путаницы и необходимости заново восстанавливать предыдущий контекст.
- Параллельная декомпозиция там, где это уместно: использование нативной мультиагентной оркестровки позволяет координировать работу нескольких агентов в параллельных потоках для более быстрого выполнения сложных задач.
- Перенос детерминированной работы в код: использование программного вызова инструментов для фильтрации, агрегации и оркестровки результатов работы инструментов вне контекстного окна модели, что резервирует токены модели для принятия решений и снижает затраты, задержки и деградацию контекста.
При совместном использовании разница может быть разительной. Например, в ARC-AGI-3 модель GPT‑5.6 Sol набрала 13,3% со стандартной обвязкой. Однако после включения сохранения рассуждений и сжатия этот показатель подскочил до 38,3%, при этом было использовано примерно в 6 раз меньше выходных токенов. Никаких изменений в самой модели, но почти тройной прирост производительности. Подробнее о нашем исследовании инфраструктуры ARC-AGI-3 вы можете прочитать здесь.
Программный вызов инструментов
Агентные рабочие процессы часто включают два типа задач:
- Задачи, требующие вынесения суждений
- Работа, которая в основном сводится к перемещению, фильтрации и объединению данных
Когда агент извлекает 100 документов, фильтрует их по дате и определяет релевантные транзакции, модели не нужно рассуждать над каждым промежуточным результатом в своем контекстном окне. Программный вызов инструментов позволяет GPT‑5.6 писать код на JavaScript для оркестровки инструментов, запускать независимые вызовы параллельно и обрабатывать их результаты за пределами контекстного окна. Модель может сосредоточиться на том, что требует интеллекта: на принятии решений.
»В финансовых исследованиях самая сложная часть — это надежное получение документов, координация инструментов и работа с цифрами. В ходе наших оценок GPT‑5.6 с использованием программного вызова инструментов соответствовала качеству наших критериев, используя при этом на 21% меньше входных токенов. В этом и заключается разница между агентом, который может обсуждать финансовые исследования, и агентом, который действительно способен их проводить.»— Алекс Ванг (Alex Wang), отдел прикладного ИИ, Rogo
Мультиагентность
При выполнении сложных распараллеливаемых задач распределение действий и рассуждений между несколькими потоками агентов обеспечивает как более быстрое выполнение задач, так и более высокий интеллект. В таких конфигурациях основной агент отвечает за оркестровку субагентов и делегирование им задач. Субагенты выполняют свои задачи параллельно и в конечном итоге передают результат обратно первичному агенту для окончательного синтеза. Команды могут начать использовать мультиагентность на нативном уровне, включив мультиагентный режим в Responses API. Именно так работает и настройка максимальной производительности (ultra capability) в ChatGPT.
»Qualia запускает команды агентов для решения неструктурированных исследовательских задач, и GPT‑5.6 Sol пришлась как нельзя кстати. Она продемонстрировала заметное улучшение по сравнению с GPT‑5.5, завершала работу быстрее практически любой другой протестированной нами модели и быстро стала нашей основной моделью OpenAI.»— Е Чи (E Chi), основатель, Quadrillion
»GPT‑5.6 — лучший оркестратор из всех, что мы видели от OpenAI. Мы одновременно загрузили в нее шесть спецификаций (написав, создав и обсудив каждую из них), и она удержала в поле зрения абсолютно все без потери качества.»— Джон Белл (Jon Bell), сооснователь и директор по продукту, Obvious
»Qualia запускает команды агентов для решения неструктурированных исследовательских задач, и GPT‑5.6 Sol пришлась как нельзя кстати. Она продемонстрировала заметное улучшение по сравнению с GPT‑5.5, завершала работу быстрее практически любой другой протестированной нами модели и быстро стала нашей основной моделью OpenAI.»— Е Чи (E Chi), основатель, Quadrillion
Хотя GPT‑5.6 отлично понимает необходимое количество субагентов и моменты, когда их следует порождать, мультиагентным поведением можно легко управлять. Инструктаж модели о том, когда именно вызывать субагентов, может повысить вероятность порождения агентов только в тех ситуациях, когда дополнительные затраты токенов приведут к повышению производительности.
Кэширование промптов
Во всем семействе моделей время жизни (TTL) кеша промптов было увеличено минимум до 30 минут, а точки останова кеша теперь можно задавать детерминировано в пределах контекстного окна модели. Это позволило стартапам значительно улучшить показатель попадания в кеш (cache hit rate).
»Мы добавили точки останова кеша и ключи, специфичные для рабочей области, к общему промпту размером 29 000 токенов и сократили объем некешируемых входных данных на 28%. 30-минутное окно кеширования также дало огромный прирост: наши агенты смогли повторно использовать один и тот же контекст в разных запусках, вместо того чтобы начинать все с нуля.»— Лоренцо Дентиле (Lorenzo Gentile), инженер по искусственному интеллекту, Ploy
Помимо настройки точек останова кеша, дальнейшее использование подходящего ключа prompt_cache_key повышает вероятность того, что запросы попадут на тот же механизм выводов, который ранее обрабатывал аналогичный префикс, тем самым снижая задержку.
Заключение
Что бросается в глаза на этих примерах, так это то, насколько сильно изменилась экономика создания агентов.
Варианты использования, которые раньше на каждом шаге требовали передовой модели (frontier model), теперь могут достигать сопоставимых или лучших результатов за малую долю затрат — за счет использования меньших моделей, настройки уровня рассуждений и принятия эффективных архитектурных решений.
Мы с нетерпением ждем возможности увидеть, что создадите вы!
Об авторах
Это руководство было подготовлено Самартом Маддуру (Samarth Madduru), Прашантом Миталом (Prashant Mital), Дейвом Лео (Dave Leo) и Жюльеном Рейманом (Julien Reiman) на основе их опыта тесной работы со стартапами, создающими продукты на базе GPT-5.6, — от раннего тестирования до этапа продакшена.
Полный текст статьи читайте на OpenAI
