Представляем GPT‑5.5
Новый класс интеллекта для реальной работы
В этой публикации представлена модель GPT-5.5.
Узнайте о новейшей модели OpenAI:
Обновление от 24 апреля 2026 г.: GPT‑5.5 и GPT‑5.5 Pro теперь доступны в API. Системная карта (System Card) также была обновлена с описанием дополнительных примененных мер безопасности.
Мы выпускаем GPT‑5.5 — нашу самую умную и интуитивно понятную модель на сегодняшний день, которая представляет собой следующий шаг к новому способу выполнения работы с помощью компьютера.
GPT‑5.5 быстрее понимает ваши намерения и может самостоятельно выполнять большую часть работы. Она превосходно пишет и отлаживает код, проводит исследования в сети, анализирует данные, создает документы и электронные таблицы, управляет ПО и переключается между инструментами до тех пор, пока задача не будет выполнена. Вместо того чтобы тщательно контролировать каждый шаг, вы можете поручить GPT‑5.5 сложную многокомпонентную задачу и доверить ей планирование, использование инструментов, проверку результатов, преодоление неопределенности и доведение дела до конца.
Наибольший прирост наблюдается в области агентного программирования, работы за компьютером, интеллектуального труда и ранних научных исследований — в сферах, где прогресс зависит от учета контекста и последовательных действий во времени. GPT‑5.5 обеспечивает этот скачок в интеллекте без ущерба для скорости: более крупные и мощные модели часто работают медленнее при обслуживании запросов, но GPT‑5.5 соответствует задержке GPT‑5.4 на один токен при реальном использовании, демонстрируя при этом гораздо более высокий уровень интеллекта. Кроме того, она тратит значительно меньше токенов на выполнение тех же задач Codex, что делает ее одновременно более эффективной и способной.
Мы выпускаем GPT‑5.5 с нашим самым надежным набором средств защиты на сегодняшний день, разработанным для снижения рисков злоупотребления при сохранении доступа к полезной работе. Мы оценили эту модель с помощью нашего полного набора платформ безопасности и готовности, поработали с внутренними и внешними командами по имитации угроз (red teams), добавили целевое тестирование для расширенных возможностей в области кибербезопасности и биологии, а также собрали отзывы о реальных сценариях использования от почти 200 доверенных партнеров с ранним доступом перед выпуском.
Сегодня GPT‑5.5 становится доступна пользователям тарифов Plus, Pro, Business и Enterprise в ChatGPT и Codex, а GPT‑5.5 Pro — пользователям Pro, Business и Enterprise в ChatGPT. Развертывание в API требует иных мер безопасности, и мы тесно сотрудничаем с партнерами и клиентами над требованиями к безопасности при ее масштабном использовании. Мы очень скоро добавим GPT‑5.5 и GPT‑5.5 Pro в API.
GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro | |
Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% |
Expert-SWE (Internal) | 73.1% | 68.5% | - | - | - | - |
GDPval (wins or ties) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - |
Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% |
BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% |
FrontierMath Tier 1–3 | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% |
FrontierMath Tier 4 | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% |
CyberGym | 81.8% | 79.0% | - | - | 73.1% | - |
Возможности модели
OpenAI создает глобальную инфраструктуру для агентного ИИ, позволяя людям и компаниям по всему миру выполнять работу с помощью искусственного интеллекта. За последний год мы стали свидетелями того, как ИИ драматически ускорил разработку программного обеспечения. С появлением GPT‑5.5 в Codex и ChatGPT эта же трансформация начинает распространяться на научные исследования и более широкие задачи, которые люди выполняют на компьютерах.
В этих областях GPT‑5.5 не просто умнее; она эффективнее решает проблемы, часто достигая более качественных результатов с меньшим количеством токенов и повторных попыток. Согласно индексу кодирования Artificial Analysis (Coding Index), GPT‑5.5 обеспечивает передовой уровень интеллекта при вдвое меньшей стоимости по сравнению с конкурирующими передовыми моделями для программирования.
Индекс интеллекта Artificial Analysis (Artificial Analysis Intelligence Index) представляет собой средневзвешенное значение 10 оценок, проведенных внешней стороной: AA-LCR, AA-Omniscience, CritPt, GDPval-AA, GPQA Diamond, Humanity«s Last Exam, IFBench, SciCode, Terminal-Bench Hard, τ²-Bench Telecom.
Агентное программирование
GPT‑5.5 — наша самая сильная модель для агентного программирования на сегодняшний день. В Terminal-Bench 2.0, который тестирует сложные рабочие процессы командной строки, требующие планирования, итераций и координации инструментов, она достигает передовой точности в 82,7%. В SWE-Bench Pro, оценивающем решение реальных проблем на GitHub, она достигает 58,6%, выполняя больше задач от начала до конца за один проход по сравнению с предыдущими моделями. В Expert-SWE, нашей внутренней передовой оценке для долгосрочных задач программирования с медианным расчетным временем выполнения человеком в 20 часов, GPT‑5.5 также превосходит GPT‑5.4.
По всем трем тестам GPT‑5.5 превосходит показатели GPT‑5.4, расходуя при этом меньше токенов.
Сильные стороны модели в программировании особенно ярко проявляются в Codex, где она может брать на себя инженерные задачи — от реализации и рефакторинга до отладки, тестирования и валидации. Раннее тестирование показывает, что GPT‑5.5 лучше справляется с паттернами поведения, от которых зависит реальная инженерная работа: удержание контекста в крупных системах, логический анализ неоднозначных сбоев, проверка предположений с помощью инструментов и проведение изменений по всей окружающей кодовой базе.
Помимо бенчмарков, ранние тестировщики отметили, что GPT‑5.5 демонстрирует повышенную способность понимать структуру системы: почему происходит сбой, где именно нужно внести исправление и что еще в кодовой базе может при этом пострадать.

«Первая известная мне модель для написания кода, обладающая серьезной концептуальной ясностью».

«Первая известная мне модель для написания кода, обладающая серьезной концептуальной ясностью».
Дэн Шиппер (Dan Shipper), основатель и генеральный директор Every, охарактеризовал GPT‑5.5 как «первую известную мне модель для написания кода, обладающую серьезной концептуальной ясностью».
После запуска приложения он потратил несколько дней на устранение неполадок, возникших после релиза, прежде чем привлечь одного из своих лучших инженеров для переписывания части системы. Чтобы протестировать GPT‑5.5, он фактически отмотал время назад: сможет ли модель изучить сломанное состояние и выдать тот же вариант переписывания, к которому в итоге пришел инженер? GPT‑5.4 не смогла. GPT‑5.5 — смогла.

«У меня действительно возникает ощущение, что я работаю с более высоким интеллектом, и тут присутствует почти что элемент уважения.»

«У меня действительно возникает ощущение, что я работаю с более высоким интеллектом, и тут присутствует почти что элемент уважения.»
Пьетро Скирано (Pietro Schirano), генеральный директор MagicPath, заметил аналогичный качественный скачок, когда GPT‑5.5 объединила ветку с сотнями изменений интерфейса и рефакторинга с основной веткой, в которой также произошло множество изменений, разрешив эту задачу за один подход примерно за 20 минут.
Старшие инженеры, тестировавшие модель, отметили, что GPT‑5.5 заметно превосходит GPT‑5.4 и Claude Opus 4.7 в плане логического мышления и автономности: она заранее выявляет проблемы и прогнозирует потребности в тестировании и проверке без дополнительных подсказок. В одном из случаев инженер попросил ее переработать систему комментариев в совместном редакторе уценки (markdown), а вернувшись, обнаружил практически готовый стек из 12 диффов. Другие отметили, что им требовалось на удивление мало исправлений реализации и они чувствовали себя гораздо увереннее в планах GPT‑5.5 по сравнению с GPT‑5.4.
Один из инженеров NVIDIA, получивший ранний доступ к модели, зашел так далеко, что заявил: «Потеря доступа к GPT‑5.5 ощущается так, будто мне ампутировали конечность».
Интеллектуальная работа
Те же преимущества, которые делают GPT‑5.5 отличным инструментом для написания кода, делают ее мощной и для повседневной работы за компьютером. Благодаря тому, что модель лучше понимает намерения пользователя, она может более естественно проходить весь цикл интеллектуальной работы: поиск информации, понимание сути, использование инструментов, проверку результатов и превращение сырых данных в нечто полезное.
В Codex модель GPT‑5.5 справляется с созданием документов, электронных таблиц и презентаций лучше, чем GPT‑5.4. Альфа-тестеры отметили, что она превзошла прошлые модели в таких задачах, как исследование операций, моделирование в электронных таблицах и преобразование неструктурированных бизнес-данных в планы. В сочетании с возможностями использования компьютера в Codex, GPT‑5.5 приближает нас к ощущению, что модель действительно способна работать за компьютером вместе с вами: видеть происходящее на экране, нажимать кнопки, вводить текст, перемещаться по интерфейсам и точно переключаться между инструментами.
Команды OpenAI уже используют эти преимущества в реальных рабочих процессах. На сегодняшний день более 85% сотрудников компании еженедельно используют Codex в таких областях, как разработка программного обеспечения, финансы, коммуникации, маркетинг, наука о данных и управление продуктами. В команде по коммуникациям GPT‑5.5 в Codex использовалась для анализа данных о запросах на выступления за шесть месяцев, создания системы оценки и рисков, а также проверки автоматизированного агента в Slack, чтобы запросы с низким уровнем риска обрабатывались автоматически, а более рискованные направлялись на рассмотрение человеком. В финансовом отделе с помощью Codex было проанализировано 24 771 налоговых форм K-1 общей сложностью 71 637 страниц; при этом использовался рабочий процесс, исключающий персональные данные, что помогло команде ускорить выполнение задачи на две недели по сравнению с предыдущим годом. В команде по выходу на рынок (Go-to-Market) один из сотрудников автоматизировал создание еженедельных бизнес-отчетов, сэкономив от 5 до 10 часов в неделю.
В ChatGPT функция GPT‑5.5 Thinking обеспечивает более оперативную помощь в решении сложных проблем благодаря более умным и лаконичным ответам, помогающим эффективнее справляться со сложными задачами. Она превосходно справляется с профессиональной работой, такой как программирование, исследования, синтез и анализ информации, а также с задачами, требующими работы с документами, особенно при использовании плагинов.
В GPT‑5.5 Pro ранние тестеры отмечают значительный качественный скачок как в сложности, так и в качестве работы, с которой может справиться ChatGPT, а также улучшение задержек, что делает ее гораздо более практичной для ресурсоемких задач. По сравнению с GPT‑5.4 Pro, по мнению тестеров, ответы GPT‑5.5 Pro стали значительно более полными, структурированными, точными, релевантными и полезными, причем особенно высокие результаты показали в сферах бизнеса, юриспруденции, образования и науки о данных.
GPT‑5.5 демонстрирует производительность на уровне передовых достижений (state-of-the-art) по множеству бенчмарков, отражающих подобные виды работ. В тесте GDPval, который оценивает способность агентов выполнять четко поставленные задачи интеллектуального труда в 44 профессиях, GPT‑5.5 набирает 84,9%. В бенчмарке OSWorld-Verified, измеряющем способность модели самостоятельно управлять реальной компьютерной средой, результат составляет 78.7%. А в Tau2-bench Telecom, оценивающем сложные рабочие процессы в сфере обслуживания клиентов, модель достигает 98,0% без настройки промтов (prompt tuning). GPT‑5.5 также показывает высокие результаты в других бенчмарках интеллектуального труда: 60,0% в FinanceAgent, 88.5% в задачах внутреннего инвестиционно-банковского моделирования и 54.1% в OfficeQA Pro.
Тестирование в Tau2-bench Telecom проводилось без настройки промтов (а в качестве модели пользователя использовалась GPT‑4.1). GPT‑5.5 лучше понимает суть задачи и более эффективно расходует токены по сравнению со своими предшественницами.
Научные исследования
GPT‑5.5 также демонстрирует улучшения в процессах научных и технических исследований, которые требуют гораздо большего, чем просто ответ на сложный вопрос. Исследователям необходимо изучать идеи, собирать доказательства, проверять предположения, интерпретировать результаты и определять дальнейшие шаги. GPT‑5.5 лучше справляется с поддержанием этого непрерывного цикла по сравнению с другими моделями.
Стоит отметить, что GPT‑5.5 демонстрирует явное превосходство над GPT‑5.4 в GeneBench — новом бенчмарке, сфокусированном на многоэтапном анализе научных данных в генетике и количественной биологии. Эти задачи требуют от моделей умения работать с потенциально неоднозначными или содержащими ошибки данными при минимальном надзоре, преодолевать реальные препятствия (например, скрытые факторы искажения или сбои контроля качества), а также корректно применять и интерпретировать современные статистические методы. Производительность модели особенно впечатляет с учетом того, что подобные задачи обычно соответствуют многодневным проектам научных экспертов.
Аналогично, в BixBench — бенчмарке, ориентированном на биоинформатику и анализ данных в реальных условиях, — модель GPT‑5.5 продемонстрировала лидирующие результаты среди моделей с опубликованными баллами. Научные возможности модели теперь достаточно сильны, чтобы существенно ускорить прогресс на переднем крае биомедицинских исследований в качестве полноценного ученого-соавтора.
В другом примере внутренняя версия GPT‑5.5 с пользовательским окружением помогла открыть новое доказательство, касающееся чисел Рамсея — одного из центральных объектов комбинаторики. Комбинаторика изучает то, как дискретные объекты сочетаются друг с другом: графы, сети, множества и закономерности. Числа Рамсея отвечают на вопрос о том, насколько большой должна быть сеть, прежде чем в ней неизбежно появится определенный порядок. Результаты в этой области редки и часто технически сложны. В данном случае GPT‑5.5 нашла доказательство давнего асимптотического факта об «офф-диагональных» числах Рамсея, которое впоследствии было верифицировано в Lean. Этот результат представляет собой конкретный пример того, как GPT‑5.5 вносит вклад не просто в виде кода или объяснений, а предлагает удивительный и полезный математический аргумент в ключевой исследовательской области.
Ранние тестировщики использовали GPT‑5.5 Pro в ChatGPT не столько как инструмент для получения готовых ответов за один запрос, сколько как научного партнера: для критики рукописей в несколько проходов, стресс-тестирования технических аргументов, предложения аналитических подходов и работы с кодом, заметками и контекстом из PDF-файлов. Общей чертой является то, что GPT‑5.5 лучше помогает исследователям переходить от вопроса к эксперименту и результату.


Дерья Унутмаз (Derya Unutmaz), профессор иммунологии и исследователь в Лаборатории Джексона по геномной медицине, использовал GPT‑5.5 Pro для анализа набора данных экспрессии генов, включающего 62 образца и почти 28 000 генов. В результате был подготовлен подробный исследовательский отчет, который не только обобщил полученные данные, но и выделил ключевые вопросы и идеи — работу, на которую, по его словам, у его команды ушли бы месяцы.


Бартош Наскренцкий (Bartosz Naskręcki), доцент математики в Университете имени Адама Мицкевича в Познани (Польша), использовал GPT‑5.5 в Codex для создания приложения алгебраической геометрии по единственному запросу всего за 11 минут. Приложение визуализирует пересечение квадратичных поверхностей и преобразует полученную кривую в модель Вейерштрасса.
Позже он доработал приложение, добавив более стабильную визуализацию особенностей и точные коэффициенты, которые можно повторно использовать в дальнейшей работе. По его мнению, главное изменение заключается в том, что теперь Codex может помогать в реализации пользовательской математической визуализации и рабочих процессов компьютерной алгебры, которые раньше требовали специализированных инструментов. В совокупности эти примеры показывают, как GPT‑5.5 воплощает экспертные замыслы в работающие исследовательские инструменты и аналитические решения.

Автор: Бартош Наскренцкий
Запрос: # Пересечение поверхностей в алгебраической геометрии
Создай приложение, которое рисует две квадратичные поверхности и выделяет красным цветом кривую их пересечения. Используй вычислительную теорему Римана — Роха для преобразования этого в кривую Вейерштрасса.
## Главное окно
Две тонированные поверхности со слегка прозрачной заливкой, высококачественный рендеринг, пересекающиеся по алгебраической кривой красного цвета
Вращение с помощью мыши в обоих направлениях, полноценный жест щипка для масштабирования, тактильное нажатие для вызова небольшого меню со слайдерами для изменения коэффициентов каждой поверхности; обнаружение через уровень Z-буфера
## Правое боковое окно
Короткое уравнение Вейерштрасса (над полем рациональных чисел Q или квадратичным расширением поля), вычисляемое «на лету» с помощью формул эффективной теоремы Римана — Роха
## Режим окружения (Ambient), в котором все элементы управления скрыты и пользователь может наслаждаться красотой форм
## Характеристики
Приложение работает в браузере, легковесная реализация с использованием новейших библиотек полного стека (full stack), портативная, готовая к развертыванию
## Документация
Git-репозиторий, журнал, план (файлы Markdown)
«Невероятно вдохновляет использовать новую модель OpenAI GPT-5.5 в нашей связке, задействовать ее для анализа огромных массивов биохимических данных с целью прогнозирования эффективности лекарств для человека, а затем видеть, как она обеспечивает значительный прирост точности в наших самых сложных тестах по поиску лекарств. Если OpenAI продолжит в том же духе, к концу года основы разработки лекарств изменятся».
Эффективность инференса нового поколения
Запуск GPT‑5.5 с задержкой уровня GPT‑5.4 потребовал переосмысления инференса как единой интегрированной системы, а не набора изолированных оптимизаций. Модель GPT‑5.5 разрабатывалась совместно, обучалась и развертывалась на системах NVIDIA GB200 и GB300 NVL72. Codex и GPT‑5.5 сыграли ключевую роль в достижении наших целевых показателей производительности. Codex помог команде быстрее переходить от идеи к реализации, пригодной для бенчмаркинга: наброску подходов, созданию схем экспериментов и определению того, какие оптимизации заслуживают более глубоких инвестиций. GPT‑5.5 помогла найти и внедрить ключевые улучшения в самом стеке. Проще говоря, модель помогла усовершенствовать инфраструктуру, которая ее обслуживает.
Одним из таких улучшений стали эвристики балансировки нагрузки и секционирования. До появления GPT‑5.5 мы разделяли запросы на ускорителе на фиксированное количество фрагментов для распределения работы между вычислительными ядрами, гарантируя, что крупные и мелкие запросы могут выполняться на одном и том же графическом процессоре. Однако заранее определенное число статических фрагментов не оптимально для всех типов трафика. Чтобы эффективнее задействовать GPU, Codex проанализировал многонедельные паттерны производственного трафика и написал пользовательские эвристические алгоритмы для оптимального секционирования и балансировки работы. Эта работа оказала колоссальное влияние, увеличив скорость генерации токенов более чем на 20%.
Развитие кибербезопасности ради всеобщей безопасности
Подготовка мира к появлению моделей, которые очень хорошо умеют находить и устранять уязвимости в системе безопасности, — это командная игра, требующая от всей экосистемы усердной работы по повышению устойчивости, демократизации доступа к моделям и итеративному развертыванию для новой эры киберзащиты.
Передовые модели становятся все более способными в сфере кибербезопасности. Эти возможности получат широкое распространение, и мы считаем, что лучший путь вперед — убедиться, что они направлены на ускорение киберзащиты и укрепление экосистемы.
GPT‑5.5 — это небольшой, но важный шаг на пути к ИИ, способному решать самые сложные мировые задачи, такие как кибербезопасность. В декабре с выходом GPT‑5.2 мы заблаговременно развернули необходимые средства киберзащиты, чтобы ограничить потенциальное злоупотребление нашими моделями в киберсфере; теперь же, с выходом GPT‑5.5, мы внедряем более строгие классификаторы потенциальных киберрисков, которые поначалу могут показаться некоторым пользователям раздражающими по мере их тонкой настройки.
Мы в течение многих лет выделяли кибербезопасность в качестве отдельной категории в нашем Фреймворке готовности по мере того, как наши модели постепенно совершенствовались, параллельно разрабатывая и калибруя меры защиты в ходе итераций, чтобы иметь возможность ответственно выпускать модели со значительными возможностями в области кибербезопасности.
- Мы внедряем передовые в отрасли меры защиты для кибервозможностей такого уровня. Впервые функции безопасности, ориентированные на кибербезопасность, были представлены нами в модели GPT‑5.2 в прошлом году, и мы продолжили их тестирование, доработку и развитие в последующих версиях. Для GPT‑5.5 мы разработали более строгий контроль в отношении рискованных действий и конфиденциальных запросов, связанных с кибербезопасностью, а также добавили защиту от повторного нецелевого использования. Широкий доступ стал возможен благодаря нашим инвестициям в безопасность моделей, аутентификацию пользователей и мониторинг недопустимого использования. Мы месяцами работали с внешними экспертами над разработкой, тестированием и совершенствованием надежности этих средств защиты. С выходом GPT‑5.5 мы гарантируем, что разработчики смогут с легкостью защищать свой код, одновременно установив более жесткий контроль над киберрабочими процессами, которые с наибольшей вероятностью могут быть использованы злоумышленниками во вред.
- Мы расширяем доступ для ускорения киберзащиты на всех уровнях. Мы делаем наши модели, ориентированные на кибербезопасность, доступными через программу Trusted Access for Cyber (Доверенный доступ для кибербезопасности), начиная с Codex. Это включает расширенный доступ к продвинутым возможностям кибербезопасности GPT‑5.5 с меньшими ограничениями для верифицированных пользователей, соответствующих определенным сигналам доверия на момент запуска. Организации, отвечающие за защиту критической инфраструктуры, могут подать заявку на получение доступа к таким кибермоделям, как GPT‑5.4‑Cyber, при условии соблюдения строгих требований безопасности для использования этих моделей в целях защиты своих внутренних систем. Это предоставляет широкому кругу проверенных защитников более мощные инструменты для законной работы по обеспечению безопасности с меньшим количеством ненужных препятствий, гарантируя демократизацию доступа к важным оборонительным возможностям. Пользователи могут подать заявку на доверенный доступ на странице chatgpt.com/cyber, чтобы сократить количество необоснованных отказов при использовании GPT‑5.5 для проверенной работы по защите.
- Мы сотрудничаем с правительственными партнерами для защиты критической инфраструктуры на благо общества. Совместно мы изучаем, как передовой ИИ может поддержать защитную работу официальных лиц, отвечающих за системы, от которых зависят люди — от цифровых систем, обеспечивающих безопасность важных данных налогоплательщиков, до электросетей и систем водоснабжения в местных сообществах.
Мы оцениваем биологические/химические и кибернетические возможности GPT‑5.5 как «Высокие» в соответствии с нашей Методологией обеспечения готовности (Preparedness Framework). Хотя GPT‑5.5 не достигла критического уровня возможностей в области кибербезопасности, наши оценки и тестирование показали, что ее кибернетические способности стали шагом вперед по сравнению с GPT‑5.4.
Кроме того, перед выпуском GPT‑5.5 прошла наш полный процесс оценки безопасности и управления, включая проверки готовности, тестирование для конкретных доменов, новые целевые оценки расширенных биологических и кибернетических возможностей, а также надежное тестирование с участием внешних экспертов. Подробнее мы рассказываем об этом в системной карте GPT‑5.5.
Эта работа отражает наш комплексный подход к обеспечению устойчивости ИИ, который, по нашему мнению, необходим по мере развития возможностей моделей. Мы хотим, чтобы мощный ИИ был доступен людям, использующим его для защиты систем, институтов и общества. Жизнеспособный путь заключается в доверенном доступе, надежных средствах защиты, масштабируемых вместе с возможностями, а также в операционном потенциале для обнаружения серьезных злоупотреблений и реагирования на них.
Доступность и цены
Сегодня модель GPT‑5.5 становится доступна пользователям тарифных планов Plus, Pro, Business и Enterprise в ChatGPT и Codex, а GPT‑5.5 Pro внедряется для пользователей Pro, Business и Enterprise в ChatGPT. Очень скоро мы добавим GPT‑5.5 и GPT‑5.5 Pro в API.
В ChatGPT модель GPT‑5.5 Thinking доступна пользователям Plus, Pro, Business и Enterprise. GPT‑5.5 Pro, созданная для решения еще более сложных задач и работы с повышенной точностью, доступна пользователям Pro, Business и Enterprise.
В Codex модель GPT‑5.5 доступна на тарифах Plus, Pro, Business, Enterprise, Edu и Go с окном контекста в 400 тыс. токенов. GPT‑5.5 также доступна в быстром режиме (Fast mode), генерируя токены в 1,5 раза быстрее при 2,5-кратном увеличении стоимости.
Для разработчиков API модель gpt-5.5 скоро будет доступна в интерфейсах Responses и Chat Completions API по цене 5 долларов за 1 млн входных токенов и 30 долларов за 1 млн выходных токенов с окном контекста в 1 млн токенов. Пакетные цены (Batch) и цены Flex доступны за половину стандартного тарифа API, в то время как приоритетная обработка (Priority processing) предлагается по цене, в 2,5 раза превышающей стандартную. Мы также выпустим модель gpt-5.5-pro в API для обеспечения еще более высокой точности по цене 30 долларов за 1 млн входных токенов и 180 долларов за 1 млн выходных токенов. Полную информацию см. на странице цен.
Хотя GPT‑5.5 стоит дороже, чем GPT‑5.4, она одновременно умнее и значительно эффективнее в плане токенов. В Codex мы тщательно настроили работу системы, чтобы для большинства пользователей GPT‑5.5 выдавала лучшие результаты, расходуя меньше токенов, чем GPT‑5.4, и продолжая предоставлять щелие лимиты использования для всех тарифных планов.
Оценки
Программирование
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
SWE-Bench Pro (Публичный) * | 58.6% | 57.7% | - | - | 64.3% | 54.2% |
Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% |
Expert-SWE (Внутренняя) | 73.1% | 68.5% | - | - | - | - |
*Лаборатории отметили признаки заучивания наизусть в ходе этой оценки
Профессиональные задачи
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
GDPval (победы или ничьи) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
FinanceAgent v1.1 | 60.0% | 56.0% | - | 61.5% | 64.4% | 59.7% |
Investment Banking Modeling Tasks (Внутренняя) | 88.5% | 87.3% | 88.6% | 83.6% | - | - |
OfficeQA Pro | 54.1% | 53.2% | - | - | 43.6% | 18.1% |
Использование компьютера и компьютерное зрение
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - |
MMMU Pro (без инструментов) | 81.2% | 81.2% | - | - | - | 80.5% |
MMMU Pro (с инструментами) | 83.2% | 82.1% | - | - | - | - |
Использование инструментов
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% |
MCP Atlas** | 75.3% | 70.6% | - | - | 79.1% | 78.2% |
Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% |
Tau2-bench Telecom*** | 98.0% | 92.8% | - | - | - | - |
** MCP Atlas: результаты от Scale AI после последнего обновления в апреле 2026 года.
*** Tau2-bench telecom: результаты для 5.5 и 5.4 с исходными промптами, т. е. без настройки промптов. Здесь исключены результаты других лабораторий, которые оценивались с корректировкой промптов.
Академические тесты
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
GeneBench | 25.0% | 19.0% | 33.2% | 25.6% | - | - |
FrontierMath Tier 1–3 | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% |
FrontierMath Tier 4 | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% |
BixBench | 80.5% | 74.0% | - | - | - | - |
GPQA Diamond | 93.6% | 92.8% | - | 94.4% | 94.2% | 94.3% |
Humanity’s Last Exam (без инструментов) | 41.4% | 39.8% | 43.1% | 42.7% | 46.9% | 44.4% |
Humanity’s Last Exam (с инструментами) | 52.2% | 52.1% | 57.2% | 58.7% | 54.7% | 51.4% |
Кибербезопасность
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
Задачи соревнований Capture-the-Flag (Внутренние)**** | 88.1% | 83.7% | - | - | - | - |
CyberGym | 81.8% | 79.0% | - | - | 73.1% | - |
**** Расширение списка наиболее сложных CTF-задач, использовавшихся в системных картах, за счет добавления новых сложных заданий.
Длинный контекст
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
Graphwalks BFS 256k f1 | 73.7% | 62.5% | - | - | 76.9% | - |
Graphwalks BFS 1mil f1 | 45.4% | 9.4% | - | - | 41.2% (Opus 4.6) | - |
Graphwalks parents 256k f1 | 90.1% | 82.8% | - | - | 93.6% | - |
Graphwalks parents 1mil f1 | 58.5% | 44.4% | - | - | 72.0% (Opus 4.6) | - |
OpenAI MRCR v2 8-needle 4K-8K | 98.1% | 97.3% | - | - | - | - |
OpenAI MRCR v2 8-needle 8K-16K | 93.0% | 91.4% | - | - | - | - |
OpenAI MRCR v2 8-needle 16K-32K | 96.5% | 97.2% | - | - | - | - |
OpenAI MRCR v2 8-needle 32K-64K | 90.0% | 90.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 64K-128K | 83.1% | 86.0% | - | - | - | - |
OpenAI MRCR v2 8-needle 128K-256K | 87.5% | 79.3% | - | - | 59.2% | - |
OpenAI MRCR v2 8-needle 256K-512K | 81.5% | 57.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 74.0% | 36.6% | - | - | 32.2% | - |
Абстрактное мышление
Оценка | GPT‑5.5 | GPT‑5.4 | GPT‑5.5 Pro | GPT‑5.4 Pro | Claude Opus 4.7 | Gemini 3.1 Pro |
ARC-AGI-1 (Проверено) | 95.0% | 93.7% | - | 94.5% | 93.5% | 98.0% |
ARC-AGI-2 (Проверено) | 85.0% | 73.3% | - | 83.3% | 75.8% | 77.1% |
Оценки GPT проводились с уровнем интенсивности рассуждений (reasoning effort), установленным на xhigh, в исследовательской среде, что в некоторых случаях может давать результаты, слегка отличающиеся от рабочей версии ChatGPT.
Автор
Полный текст статьи читайте на OpenAI
