Представляем GPT‑5.4

Создано для профессиональной работы
Сегодня мы выпускаем GPT‑5.4 в ChatGPT (в режиме GPT‑5.4 Thinking), API и Codex. Это наша самая мощная и эффективная передовая модель для профессиональной работы. Мы также выпускаем GPT‑5.4 Pro в ChatGPT и API для пользователей, которым требуется максимальная производительность при решении сложных задач.
GPT‑5.4 объединяет лучшие наши недавние достижения в области рассуждений, написания кода и агентских рабочих процессов в рамках единой передовой модели. Она включает в себя ведущие в отрасли возможности программирования GPT‑5.3‑Codex и одновременно улучшает взаимодействие модели с инструментами, программными средами и профессиональными задачами, связанными с электронными таблицами, презентациями и документами. В результате получается модель, которая выполняет сложную реальную работу точно, эффективно и результативно — предоставляя именно то, что вы просите, с меньшим количеством итераций.
В ChatGPT модель GPT‑5.4 Thinking теперь может предоставлять предварительный план своих рассуждений, что позволяет вам корректировать ход работы прямо во время генерации ответа, получая на выходе результат, который точнее соответствует вашим потребностям, без дополнительных шагов. GPT‑5.4 Thinking также улучшает глубокие исследования в Интернете, особенно для высокоспецифичных запросов, и лучше сохраняет контекст для вопросов, требующих более длительных рассуждений. В совокупности эти улучшения означают более качественные ответы, которые приходят быстрее и остаются релевантными поставленной задаче.
В Codex и API модель GPT‑5.4 стала первой нашей моделью общего назначения со встроенными современными функциями управления компьютером (computer-use), что позволяет агентам управлять компьютерами и выполнять сложные рабочие процессы в различных приложениях. Она поддерживает до 1 млн токенов контекста, что позволяет агентам планировать, выполнять и проверять задачи на больших временных горизонтах. GPT‑5.4 также улучшает работу моделей в крупных экосистемах инструментов и коннекторов благодаря поиску инструментов (tool search), помогая агентам находить и использовать нужные инструменты более эффективно без ущерба для интеллекта. Наконец, GPT‑5.4 — это наша самая эффективная с точки зрения токенов модель рассуждений на сегодняшний день: она использует значительно меньше токенов для решения проблем по сравнению с GPT‑5.2, что снижает расход токенов и повышает скорость работы.
В сочетании с достижениями в области общих рассуждений, написания кода и профессиональной интеллектуальной работы GPT‑5.4 обеспечивает создание более надежных агентов, ускорение рабочих процессов разработчиков и повышение качества результатов в ChatGPT, API и Codex.
GPT‑5.4 | GPT‑5.3‑Codex | GPT‑5.2 | |
GDPval (победы или ничьи) | 83.0% | 70.9% | 70.9% |
SWE-Bench Pro (публичный) | 57.7% | 56.8% | 55.6% |
OSWorld-Verified | 75.0% | 74.0%* | 47.3% |
Toolathlon | 54.6% | 51.9% | 46.3% |
BrowseComp | 82.7% | 77.3% | 65.8% |
*Ранее сообщалось о 64.7%. GPT‑5.3‑Codex достигает 74.0% благодаря недавно представленному параметру API, который сохраняет исходное разрешение изображения.
Интеллектуальная работа
Опираясь на возможности общих рассуждений GPT‑5.2, модель GPT‑5.4 обеспечивает еще более стабильные и отточенные результаты при выполнении реальных задач, важных для профессионалов.
В бенчмарке GDPval, который проверяет способность агентов выполнять специализированную интеллектуальную работу в 44 профессиях, GPT‑5.4 устанавливает новый рекорд, соответствуя уровню профессионалов индустрии или превосходя их в 83.0% сравнений по сравнению с 70.9% у GPT‑5.2.
В бенчмарке GDPval модели выполняют специализированные задачи интеллектуальной работы, охватывающие 44 профессии из 9 основных отраслей, вносящих наибольший вклад в ВВП США. Задачи требуют создания реальных рабочих продуктов, таких как презентации по продажам, бухгалтерские электронные таблицы, графики работы неотложной помощи, производственные схемы или короткие видеоролики. Интенсивность рассуждений была установлена на уровне xhigh для GPT‑5.4 и heavy для GPT‑5.2 (немного более низкий уровень в ChatGPT).
Мы уделили особое внимание улучшению способности GPT‑5.4 создавать и редактировать электронные таблицы, презентации и документы. На внутреннем бенчмарке задач по моделированию в электронных таблицах, которые мог бы выполнять младший аналитик инвестиционного банка, модель GPT‑5.4 набирает в среднем 87.3% по сравнению с 68.4% у GPT‑5.2. В наборе промптов для оценки презентаций человеческие эксперты отдавали предпочтение презентациям от GPT‑5.4 в 68.0% случаев по сравнению с GPT‑5.2 благодаря лучшей эстетике, большему визуальному разнообразию и более эффективному использованию генерации изображений.
Вы можете опробовать эти возможности в ChatGPT, используя GPT‑5.4 Thinking или Pro. Если вы являетесь корпоративным клиентом (Enterprise), мы рекомендуем использовать наше недавно выпущенное дополнение ChatGPT для Excel, которое также было запущено сегодня. Мы также обновили навыки работы с электронными таблицами и презентациями, доступные в Codex и API.
Чтобы сделать GPT‑5.4 более приспособленной к реальной работе, мы продолжили работу по снижению количества галлюцинаций и ошибок. GPT‑5.4 — наша самая фактологически точная модель на сегодняшний день: в наборе деперсонализированных промптов, где пользователи указывали на фактические ошибки, отдельные утверждения GPT‑5.4 на 33% реже оказываются неверными, а ее полные ответы на 18% реже содержат какие-либо ошибки по сравнению с GPT‑5.2.
Управление компьютером и компьютерное зрение
GPT‑5.4 — это наша первая модель общего назначения со встроенными функциями управления компьютером, что знаменует собой важный шаг вперед как для разработчиков, так и для агентов. Это лучшая из доступных на данный момент моделей для разработчиков, создающих агентов, которые выполняют реальные задачи на веб-сайтах и в программных системах.
Мы разработали GPT‑5.4 так, чтобы она демонстрировала высокую производительность в самых разных сценариях использования компьютера. Она превосходно пишет код для управления компьютерами через такие библиотеки, как Playwright, а также отдает команды мыши и клавиатуры в ответ на скриншоты. Ее поведение настраивается с помощью сообщений для разработчиков, что позволяет адаптировать ее под конкретные варианты использования. Разработчики могут даже настраивать параметры безопасности модели в соответствии с различными уровнями толерантности к риску, задавая пользовательские правила подтверждения.
Производительность и гибкость модели отражены в бенчмарках, тестирующих работу с компьютером в различных средах. В OSWorld-Verified, измеряющем способность модели навигировать в среде рабочего стола с помощью скриншотов и действий клавиатуры/мыши, GPT‑5.4 достигает рекордного уровня успешности в 75.0%, значительно превосходя показатель GPT‑5.2 в 47.3% и обходя результаты людей-операторов, составляющие 72.4%.1
В бенчмарке WebArena-Verified, который проверяет работу с браузером, GPT‑5.4 демонстрирует ведущий показатель успешности в 67.3% при использовании взаимодействия как на основе DOM, так и на основе скриншотов, по сравнению с 65.4% у GPT‑5.2. В Online-Mind2Web, также тестирующем работу с браузером, GPT‑5.4 достигает успешности в 92.8%, используя исключительно наблюдения на основе скриншотов, что превосходит режим агента ChatGPT Atlas, чей показатель успешности составляет 70.9%.
Отказ инструмента (tool yield) происходит, когда ассистент приостанавливает работу в ожидании ответа от инструментов. Если 3 инструмента вызываются параллельно, а затем еще 3 инструмента вызываются параллельно, количество таких пауз будет равно 2. Показатель пауз инструмента лучше отражает задержку (латентность), чем количество вызовов инструментов, поскольку учитывает преимущества распараллеливания.
Улучшенные возможности управления компьютером в GPT‑5.4 основаны на усовершенствованных функциях общего визуального восприятия модели. В MMMU-Pro, тесте на визуальное понимание и рассуждение модели, GPT‑5.4 достигает успешности в 81.2% без использования инструментов, что превосходит результат GPT‑5.2 в 79.5%. Улучшенное визуальное восприятие также обеспечивает более качественный парсинг документов. В OmniDocBench модель GPT‑5.4 без задействования режима рассуждений достигает средней ошибки (измеряемой по нормированному расстоянию редактирования между предсказанием модели и эталоном) на уровне 0.109 по сравнению с 0.140 у GPT‑5.2.
Тест MMMUPro выполнялся с интенсивностью рассуждений, установленной на уровне xhigh. OmniDocBench выполнялся без задействования рассуждений (none) для демонстрации производительности с низкой стоимостью и малой задержкой.
Мы также улучшаем визуальное понимание плотных изображений высокого разрешения, где важна полная детализация. Начиная с GPT‑5.4, мы представляем уровень детализации ввода изображений original, который поддерживает восприятие с полным сохранением исходного качества до 10,24 млн пикселей или максимального размера 6000 пикселей (в зависимости от того, что меньше); уровень детализации ввода изображений high теперь поддерживает до 2,56 млн пикселей или максимальный размер 2048 пикселей. В ходе раннего тестирования с пользователями API мы отметили значительный рост точности локализации, понимания изображений и точности кликов при использовании деталей original или high.
В API разработчики могут получить доступ к этим возможностям с помощью обновленного инструмента computer. Пожалуйста, ознакомьтесь с нашей обновленной документацией для получения рекомендаций по лучшим практикам.
Программирование
GPT‑5.4 объединяет сильные стороны программирования GPT‑5.3‑Codex с передовыми возможностями интеллектуальной работы и управления компьютером, которые имеют наибольшее значение для долгосрочных задач, где модель может использовать инструменты, производить итерации и продвигать работу дальше с меньшим вмешательством человека. Она не уступает или превосходит GPT‑5.3‑Codex на SWE-Bench Pro, обладая при этом более низкой задержкой при различных уровнях интенсивности рассуждений.
Мы оцениваем задержку (латентность), анализируя производственное поведение наших моделей и симулируя его в автономном режиме. Оценка задержки учитывает длительность вызовов инструментов (время выполнения кода), сгенерированные токены и входные токены. Реальная задержка может существенно отличаться и зависит от многих факторов, не учтенных в нашей симуляции. Интенсивность рассуждений варьировалась от none до xhigh.
При включении режим /fast в Codex обеспечивает скорость генерации токенов до 1,5 раз выше с моделью GPT‑5.4. Это та же модель и тот же уровень интеллекта, просто быстрее. Это означает, что пользователи могут справляться с задачами программирования, итерациями и отладкой, не теряя концентрации. Разработчики могут получить доступ к GPT‑5.4 на такой же высокой скорости через API, используя приоритетную обработку.
В ходе оценки и внутреннего тестирования мы обнаружили, что GPT‑5.4 превосходно справляется со сложными задачами фронтенда, демонстрируя заметно более эстетичные и функциональные результаты, чем любые модели, выпущенные нами ранее.
В качестве демонстрации совместной работы усовершенствованных возможностей управления компьютером и написания кода мы также выпускаем экспериментальный навык Codex под названием »Playwright (Interactive)». Это позволяет Codex выполнять визуальную отладку веб-приложений и приложений на Electron; его даже можно использовать для тестирования создаваемого приложения прямо в процессе его разработки.
Использование инструментов
В GPT‑5.4 мы значительно улучшили работу моделей с внешними инструментами. Теперь агенты могут задействовать более крупные экосистемы инструментов, надежнее выбирать подходящие средства и выполнять многоэтапные рабочие процессы с меньшими затратами и задержками.
Поиск инструментов
В API модель GPT‑5.4 представляет функцию поиска инструментов (tool search), которая позволяет моделям эффективно работать при наличии большого количества инструментов.
Ранее, когда модели предоставлялись инструменты, все их определения предварительно включались в промпт. В системах с большим количеством инструментов это могло добавлять тысячи или даже десятки тысяч токенов к каждому запросу, увеличивая стоимость, замедчая отклики и перегружая контекст информацией, которую модель может никогда не использовать.
Благодаря поиску инструментов GPT‑5.4 вместо этого получает облегченный список доступных инструментов вместе с возможностью их поиска. Когда модели требуется использовать какой-либо инструмент, она может найти его определение и добавить его к беседе в этот же момент.
Этот подход кардинально сокращает количество токенов, необходимых для рабочих процессов с интенсивным использованием инструментов, и сохраняет кэш, делая запросы более быстрыми и дешевыми. Он также позволяет агентам надежно работать с гораздо более крупными экосистемами инструментов. Для серверов MCP, которые могут содержать десятки тысяч токенов с описаниями инструментов, прирост эффективности может быть весьма существенным.
Чтобы продемонстрировать прирост эффективности, мы оценили 250 задач из бенчмарка Scale MCP Atlas при включенных 36 серверах MCP в двух режимах: (1) предоставление каждой функции MCP напрямую в контексте модели и (2) размещение всех серверов MCP за системой поиска инструментов. Конфигурация с поиском инструментов сократила общее использование токенов на 47%, сохранив при этом ту же точность.
Примеры количества токенов получены путем усреднения 250 задач из публичного набора данных MCP-Atlas.
Агентный вызов инструментов
GPT‑5.4 также улучшает вызов инструментов, делая этот процесс более точным и эффективным при принятии решений о том, когда и как использовать инструменты во время рассуждений, особенно в API. По сравнению с GPT‑5.2 модель достигает более высокой точности за меньшее число шагов в Toolathlon — бенчмарке, который проверяет, насколько хорошо ИИ-агенты умеют использовать реальные инструменты и API для выполнения многоэтапных задач. Например, агенту требуется прочитать электронные письма, извлечь из них прикрепленные файлы заданий, загрузить их, оценить и записать результаты в электронную таблицу.
Ожидание инструмента (tool yield) — это ситуация, когда ассистент делает паузу в ожидании ответов от инструментов. Если вызываются 3 инструмента параллельно, а затем еще 3 инструмента параллельно, количество таких пауз будет равно 2. Ожидания инструментов являются более точным показателем задержки (латентности), чем количество вызовов инструментов, поскольку они отражают преимущества распараллеливания.
Для сценариев использования, чувствительных к задержкам, в которых предпочтителен уровень рассуждений «None» (Отсутствует), модель GPT‑5.4 демонстрирует еще лучшие результаты по сравнению с предшественниками.
В бенчмарке τ2-bench модель должна использовать инструменты для выполнения задачи службы поддержки, где может присутствовать смоделированный пользователь, способный общаться и совершать действия с состоянием мира. Уровень рассуждений был установлен на значение None.
Улучшенный веб-поиск
GPT‑5.4 лучше справляется с агентным веб-поиском. В BrowseComp — тесте, измеряющем способность ИИ-агентов целенаправленно просматривать веб-страницы в поисках труднодоступной информации, — модель GPT‑5.4 превосходит GPT‑5.2 на 17%абс., а версия GPT‑5.4 Pro устанавливает новый рекорд в 89.3%.
На практике это означает, что GPT‑5.4 Thinking сильнее в ответах на вопросы, требующие сбора информации из множества источников в Интернете. Она способна более упорно искать данные в течение нескольких раундов для выявления наиболее релевантных источников (особенно для вопросов типа «иголка в стоге сена») и синтезировать их в четкий, аргументированный ответ.
В BrowseComp мы использовали черный список поиска, исключающий веб-сайты, которые содержат ответы из бенчмарка в целях оценки, для предотвращения утечки данных и обеспечения справедливой оценки производительности. Тестирование GPT‑5.4 проводилось позже, чем GPT‑5.2, поэтому баллы отражают изменения в самой модели, нашей поисковой системе и состоянии Интернета. GPT‑5.4 тестировалась с использованием более длинного и обновленного черного списка. Модели используют поисковый инструмент ChatGPT, который может иметь небольшие отличия от поиска через API.
Управляемость
Подобно тому, как Codex описывает свой подход при начале работы, GPT‑5.4 Thinking в ChatGPT теперь будет обозначать ход своей работы с помощью введения для более длинных и сложных запросов. Вы также можете добавлять инструкции или корректировать направление ее работы прямо в процессе ответа. Это упрощает направление модели к нужному результату без необходимости начинать все заново или выполнять множество дополнительных итераций. Эта функция уже доступна на сайте chatgpt.com и в приложении для Android, а в скором времени появится и в iOS-приложении.
Модель также может дольше размышлять над сложными задачами, сохраняя при этом более сильное понимание ранних шагов в беседе. Это позволяет ей справляться с более продолжительными рабочими процессами и сложными промптами, сохраняя ответы логичными и релевантными на протяжении всего диалога.
Это видео было ускорено в демонстрационных целях.
Безопасность
В последние месяцы мы продолжали совершенствовать средства защиты, представленные в GPT‑5.3‑Codex, параллельно подготавливая GPT‑5.4 к развертыванию. Аналогично GPT‑5.3‑Codex, мы относим модель GPT‑5.4 к категории с высоким киберпотенциалом в рамках нашей структуры готовности (Preparedness Framework) и внедряем ее с соответствующими мерами защиты, как описано в системной карте. Сюда входят расширенный стек кибербезопасности, включая системы мониторинга, контролируемый доступ и асинхронную блокировку запросов повышенного риска для пользователей в режимах без сохранения данных (Zero Data Retention, ZDR), а также непрерывные инвестиции в более широкую экосистему безопасности.
Поскольку возможности в области кибербезопасности по своей природе имеют двойное назначение, мы придерживаемся профилактического подхода к развертыванию, продолжая калибровать наши политики и классификаторы. Для определенных клиентов в средах ZDR блокировка на уровне запросов остается частью нашего стека минимизации киберрисков; поскольку классификаторы все еще совершенствуются, по мере доработки этих механизмов защиты могут возникать отдельные ложные срабатывания. Эти обновления направлены на улучшение практической работы защитных механизмов, включая сокращение ненужных отказов и избыточных оговорок в ответах при сохранении надежных мер противодействия злоупотреблениям.
Мы продолжили исследования безопасности в области контролируемости цепочки рассуждений (Chain-of-Thought, CoT), чтобы лучше понимать логику моделей и помогать в обнаружении потенциального деструктивного поведения. В рамках этой работы мы представляем новую оценку с открытым исходным кодом — контролируемость CoT, которая измеряет, способны ли модели намеренно искажать свои рассуждения с целью обхода мониторинга. Мы выяснили, что способность модели GPT‑5.4 Thinking контролировать свой CoT находится на низком уровне, что является положительным свойством с точки зрения безопасности: это указывает на то, что модель не обладает способностью скрывать свои рассуждения, и мониторинг CoT остается эффективным инструментом обеспечения безопасности.
Доступность и стоимость
Модель GPT‑5.4 постепенно внедряется в ChatGPT и Codex начиная с сегодняшнего дня. В API модель GPT‑5.4 доступна в качестве gpt-5.4. GPT‑5.4 Pro также доступна в API как gpt-5.4-pro для разработчиков, которым требуется максимальная производительность при решении самых сложных задач.
В ChatGPT модель GPT‑5.4 Thinking становится доступна с сегодняшнего дня пользователям тарифов ChatGPT Plus, Team и Pro, заменяя GPT‑5.2 Thinking. Модель GPT‑5.2 Thinking останется доступной для платных пользователей в течение трех месяцев в селекторе моделей в разделе устаревших моделей (Legacy Models), после чего будет выведена из эксплуатации 5 июня 2026 года. Пользователи тарифных планов Enterprise и Edu могут включить ранний доступ через настройки администратора. GPT‑5.4 Pro доступна на тарифах Pro и Enterprise. Контекстные окна в ChatGPT для GPT‑5.4 Thinking остаются такими же, как и у GPT‑5.2 Thinking.
GPT‑5.4 — это наша первая основная модель рассуждений, которая объединяет передовые возможности написания кода GPT‑5.3‑codex и внедряется в ChatGPT, API и Codex. Мы называем ее GPT‑5.4, чтобы отразить этот качественный скачок и упростить выбор между моделями при использовании Codex. Со временем наши мгновенные (Instant) и мыслительные (Thinking) модели будут развиваться с разной скоростью.
Модель GPT‑5.4 в Codex включает экспериментальную поддержку контекстного окна размером 1M токенов. Разработчики могут опробовать ее, настроив model_context_window и model_auto_compact_token_limit. Запросы, превышающие стандартное контекстное окно в 272K токенов, учитываются в лимитах использования по двойному тарифу.
В API стоимость GPT‑5.4 за один токен установлена выше, чем у GPT‑5.2, в знак отражения ее улучшенных возможностей, однако ее повышенная эффективность в расходе токенов помогает сократить общее количество токенов, требуемых для многих задач. Пакетная обработка (Batch) и гибкие тарифы (Flex) доступны за половину стандартной стоимости API, в то время как приоритетная обработка (Priority) доступна по двойной стандартной цене API.
Модель API | Цена за входные данные | Цена за кэшированные входные данные | Цена за выходные данные |
gpt-5.2 | $1.75 / млн токенов | $0.175 / млн токенов | $14 / млн токенов |
gpt-5.4 | $2.50 / млн токенов | $0.25 / млн токенов | $15 / млн токенов |
gpt-5.2-pro | $21 / млн токенов | - | $168 / млн токенов |
gpt-5.4-pro | $30 / млн токенов | - | $180 / млн токенов |
Оценки
Профессиональные
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
GDPval | 83.0% | 82.0% | 70.9% | 70.9% | 74.1% |
FinanceAgent v1.1 | 56.0% | 61.5% | 54.0% | 59.5% | — |
Investment Banking Modeling Tasks (Internal) | 87.3% | 83.6% | 79.3% | 68.4% | 71.7% |
OfficeQA | 68.1% | — | 65.1% | 63.1% | — |
Программирование
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
SWE-Bench Pro (Public) | 57.7% | — | 56.8% | 55.6% | — |
Terminal-Bench 2.0 | 75.1% | — | 77.3% | 62.2% | — |
Использование компьютера и компьютерное зрение
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
OSWorld-Verified | 75.0% | — | 74.0% | 47.3% | — |
MMMU Pro (без инструментов) | 81.2% | — | — | 79.5% | — |
MMMU Pro (с инструментами) | 82.1% | — | — | 80.4% | — |
Использование инструментов
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
BrowseComp | 82.7% | 89.3% | 77.3% | 65.8% | 77.9% |
MCP Atlas | 67.2% | — | — | 60.6% | — |
Toolathlon | 54.6% | — | 51.9% | 45.7% | — |
Tau2-bench Telecom | 98.9% | — | — | 98.7% | — |
Академические
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
Frontier Science Research | 33.0% | 36.7% | — | 25.2% | — |
FrontierMath Tier 1–3 | 47.6% | 50.0% | — | 40.7% | — |
FrontierMath Tier 4 | 27.1% | 38.0% | — | 18.8% | 31.3% |
GPQA Diamond | 92.8% | 94.4% | 92.6% | 92.4% | 93.2% |
Humanity’s Last Exam (без инструментов) | 39.8% | 42.7% | — | 34.5% | 36.6% |
Humanity’s Last Exam (с инструментами) | 52.1% | 58.7% | — | 45.5% | 50.0% |
Длинный контекст
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
Graphwalks BFS 0K–128K | 93.0% | — | — | 94.0% | — |
Graphwalks BFS 256K–1M | 21.4% | — | — | — | — |
Graphwalks parents 0–128K (точность) | 89.8% | — | — | 89.0% | — |
Graphwalks parents 256K–1M (точность) | 32.4% | — | — | — | — |
OpenAI MRCR v2 8-needle 4K–8K | 97.3% | — | — | 98.2% | — |
OpenAI MRCR v2 8-needle 8K–16K | 91.4% | — | — | 89.3% | — |
OpenAI MRCR v2 8-needle 16K–32K | 97.2% | — | — | 95.3% | — |
OpenAI MRCR v2 8-needle 32K–64K | 90.5% | — | — | 92.0% | — |
OpenAI MRCR v2 8-needle 64K–128K | 86.0% | — | — | 85.6% | — |
OpenAI MRCR v2 8-needle 128K–256K | 79.3% | — | — | 77.0% | — |
OpenAI MRCR v2 8-needle 256K–512K | 57.5% | — | — | — | — |
OpenAI MRCR v2 8-needle 512K–1M | 36.6% | — | — | — | — |
Абстрактное рассуждение
Оценка | GPT‑5.4 | GPT‑5.4 | GPT‑5.3-Codex | GPT‑5.2 | GPT‑5.2 |
ARC-AGI-1 (проверенный) | 93.7% | 94.5% | — | 86.2% | 90.5% |
ARC-AGI-2 (проверенный) | 73.3% | 83.3% | — | 52.9% | 54.2% (высокий) |
Оценки без рассуждений
Оценка | GPT‑5.4 | GPT‑5.2 | GPT‑4.1 |
OmniDocBench (нормализованное расстояние редактирования) | 0.109 | 0.140 | — |
Tau2-bench Telecom | 64.3% | 57.2% | 43.6% |
Оценки проводились при уровне усилий для рассуждений (reasoning effort), установленном на значение xhigh, за исключением особо оговоренных случаев. Бенчмарки проводились в исследовательской среде, что в некоторых случаях может давать результаты, слегка отличающиеся от продакшн-версии ChatGPT.
Автор
Сноски
1 Результаты производительности человека опубликованы в работе OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments.
Полный текст статьи читайте на OpenAI
