Повышение эффективности соотношения цены и производительности с GPT‑5.6

Повышая эффективность каждого слоя, OpenAI обеспечивает более высокую производительность на каждый вложенный доллар для широкого спектра корпоративных рабочих нагрузок.
Вчера мы рассказывали о том, как GPT‑5.6 помог сделать себя более эффективным в работе. Сегодня мы переносим эти достижения на пользу нашим клиентам, снижая цены на модели GPT‑5.6 Luna и Terra, а также обеспечивая более высокую скорость работы GPT‑5.6 Sol в API. Вместе эти обновления помогают клиентам извлекать максимум пользы из каждого доллара, инвестированного в ИИ, и действовать быстрее, когда время имеет решающее значение.
Начиная с сегодняшнего дня, GPT‑5.6 Luna, наша самая быстрая и доступная модель, станет дешевле на 80%, а GPT‑5.6 Terra, наша сбалансированная модель для повседневных задач, — на 20%. Снижение цен на Luna и Terra также учитывается при расходе лимитов платных подписок при использовании Codex и ChatGPT Work. Luna предоставляет компаниям гораздо более экономичный способ обработки больших объемов задач с очень высоким качеством. Модель способна использовать инструменты и выполнять многоэтапные рабочие процессы, что делает практичное использование ИИ-приложений в масштабе доступным для гораздо более широкого круга задач.
Сделать передовой интеллект более доступным и распространенным — важнейшая часть миссии OpenAI, направленной на то, чтобы польза от общего искусственного интеллекта (AGI) досталась всему человечеству. Эти изменения претворяют данное обязательство в жизнь. Они отражают многолетние улучшения в методах создания, развертывания и применения наших моделей.
Мы также представляем режим Fast mode в API, который приходит на смену функции приоритетной обработки (Priority Processing). Для GPT‑5.6 Sol режим Fast mode обеспечивает в 2,5 раза большую скорость по сравнению со стандартной обработкой при удвоенной стоимости, без каких-либо компромиссов в качестве интеллекта. Режим Fast mode имеет обратную совместимость: запросы с меткой priority автоматически будут использовать Fast mode.
»GPT‑5.6 Luna — это максимум того, что мы видели в категории «интеллект, который дешевле измерять». Я никогда не встречал модель настолько доступную и при этом столь мощную — она открывает для Replit такие сценарии использования, о внедрении которых мы и не помышляли в ближайшее время.»Микеле Катаста, президент и руководитель направления ИИ в Replit
Соответствие интеллекта поставленным задачам
Эффективное использование ИИ начинается с конечного результата. Ставки, цена ошибки, срочность и масштаб определяют правильный баланс интеллекта, скорости, надежности и стоимости. Этот баланс может меняться от одного этапа рабочего процесса к другому.
GPT‑5.6 предоставляет компаниям гораздо больше возможностей для оптимизации этого уравнения. Luna обеспечивает производительность, сопоставимую с моделями передового уровня годичной давности, примерно за 6 центов на доллар за задачу и почти в девять раз быстрее. В профессиональной деятельности, измеряемой тестом Agents» Last Exam, Luna превосходит Fable 5 при расчетной стоимости задачи почти на 99% ниже.
На практике компании могут определять желаемый результат и стандарты качества, а затем использовать оценочные тесты, чтобы определить, где дополнительный интеллект существенно улучшает результат, а где более быстрая и дешевая обработка может обеспечить то же качество. Например, в рабочем процессе написания кода можно использовать Sol для разрешения неопределенностей и составления плана, а затем задействовать Luna для реализации четко сформулированных изменений, написания и запуска тестов, а также оценки результатов. Для другого рабочего процесса может потребоваться иной баланс.
Семейство GPT‑5.6 расширяет диапазон этого выбора. Компании могут применять максимум полезного интеллекта на каждом этапе, оплачивая при этом ту ценность, которую он создает.
Обеспечение такой гибкости начинается с повышения эффективности каждого слоя, лежащего в основе моделей.
Как мы расширяем границы эффективности
Наше преимущество в эффективности достигается за счет совершенствования самих моделей, систем инференса, которые их запускают, и агентской обвязки, связывающей их с инструментами и контекстом. Модели GPT‑5.6 выбирают более прямой путь выполнения задач. Улучшенная маршрутизация поддерживает высокую производительность аппаратного обеспечения, оптимизированное производственное ПО генерирует токены эффективнее, а более грамотное управление контекстом помогает агентам избегать повторения уже выполненной работы. В совокупности эти улучшения позволяют нам выполнять больше полезной работы с тем же объемом вычислений, сокращая время, количество токенов и затраты, необходимые для каждого результата.
GPT‑5.6 Sol все активнее помогает нам находить и внедрять следующий этап улучшений. В рамках процесса под управлением человека Sol автономно переписал и оптимизировал производственные ядра, разработал и провел сотни экспериментов по улучшению генерации токенов, а также контролировал обучение, вмешиваясь при возникновении проблем. Работа с ядрами помогла снизить общую стоимость обслуживания модели на 20%, а проведенные эксперименты повысили эффективность генерации токенов более чем на 15%. Эта работа продолжается, создавая более тесную обратную связь: по мере того как наши модели совершенствуются и получают возможность работать более автономно, скорость повышения нашей эффективности возрастает. Подробнее об инженерной составляющей GPT‑5.6.
Вычислительная стратегия, созданная для масштабирования
Удовлетворение спроса на доступный интеллект требует как увеличения вычислительных мощностей, так и повышения их продуктивности. Мы создаем устойчивый портфель инфраструктуры и подбираем для каждой рабочей нагрузки системы, наилучшим образом подходящие для ее выполнения. Такой подход поддерживает оба конца кривой соотношения цены и производительности. В бюджетном сегменте новые цены на Luna и Terra делают высокопроизводительную обработку экономически выгодной в гораздо больших масштабах. На передовом крае Fast mode предоставляет клиентам API более быстрый доступ к Sol, когда важна скорость ответа.
Предприятия могут активнее внедрять ИИ в повседневные операции без ущерба для скорости при выполнении наиболее важных задач. Крупномасштабный анализ документов, классификация клиентских запросов и рутинная реализация могут стать экономически выгодными для повсеместного применения, в то время как сложные рабочие нагрузки Sol могут выполняться быстрее, когда оправдана надбавка за премиум-качество.
Эти преимущества имеют накопительный эффект. В рамках процессов под управлением человека более способные модели помогают нашей технической команде находить следующее поколение улучшений, сокращая путь к более высокой производительности и меньшим затратам. Наша стратегия по-прежнему сосредоточена на одновременном развитии возможностей и эффективности, чтобы каждое поколение интеллекта могло выполнять больший объем работы с меньшими затратами.
Доступность и цены
GPT‑5.6 Terra и Luna по-прежнему доступны в ChatGPT Work, Codex и OpenAI API. В ChatGPT Work и Codex пользователи бесплатных тарифов и тарифов Go могут использовать Terra, а пользователи Plus, Pro, Business и Enterprise могут выбирать между Terra и Luna.
С 30 июля стоимость использования API составляет $2 за миллион входных токенов и $12 за миллион выходных токенов для Terra, а также $0,20 за миллион входных токенов и $1,20 за миллион выходных токенов для Luna. Цены на Sol остаются без изменений. Стоимость подписок и квоты на использование ChatGPT и Codex не меняются, при этом использование Terra и Luna теперь расходует меньше кредитов. Изменения цен начнут внедряться в AWS позднее сегодня.
Режим Fast mode для GPT‑5.6 Sol заменяет функцию Priority Processing в API и соответствует параметру /fast в Codex. Существующие запросы к API с тегом priority продолжат работать. Посмотреть полную информацию о ценах на API.
Автор
Полный текст статьи читайте на OpenAI
