Представляем GPT‑5.2

Самая передовая фронтирная модель для профессиональной работы и долгосрочных агентов.

Мы представляем GPT‑5.2 — нашу самую мощную серию моделей для профессиональной интеллектуальной работы.

Уже сейчас средний пользователь ChatGPT Enterprise утверждает, что ИИ экономит ему от 40 до 60 минут в день, а активные пользователи говорят об экономии более чем 10 часов в неделю. Мы создали GPT‑5.2, чтобы предоставить людям еще большую экономическую ценность: модель лучше справляется с созданием электронных таблиц, подготовкой презентаций, написанием кода, распознаванием изображений, пониманием длинных контекстов, использованием инструментов и выполнением сложных многоэтапных проектов.

GPT‑5.2 устанавливает новый технологический стандарт во многих бенчмарках, включая GDPval, где она превосходит отраслевых профессионалов в четко определенных задачах интеллектуального труда, охватывающих 44 профессии.


GPT‑5.2 Thinking 

GPT‑5.1 Thinking

GDPval (победы или ничьи)
Задачи интеллектуального труда

70.9%

38.8% (GPT‑5)

SWE-Bench Pro (публичный)
Программная инженерия

55.6%

50.8%

SWE-bench Verified
Программная инженерия

80.0%

76.3%

GPQA Diamond (без инструментов)
Вопросы по науке

92.4%

88.1%

CharXiv Reasoning (с Python)
Вопросы по научным графикам

88.7%

80.3%

AIME 2025 (без инструментов)
Олимпиадная математика

100.0%

94.0%

FrontierMath (Уровни 1–3)
Продвинутая математика

40.3%

31.0%

FrontierMath (Уровень 4)
Продвинутая математика

14.6%

12.5%

ARC-AGI-1 (проверенный)
Абстрактное мышление

86.2%

72.8%

ARC-AGI-2 (проверенный)
Абстрактное мышление

52.9%

17.6%

Notion, Box, Shopify, Harvey и Zoom отметили, что GPT‑5.2 демонстрирует передовые возможности рассуждения на длинных отрезках времени и вызова внешних инструментов. Databricks, Hex иTriple Whale обнаружили, что GPT‑5.2 исключительно эффективна в задачах агентного анализа данных и документов. Cognition, Warp, Charlie Labs, JetBrains и Augment Code заявляют, что GPT‑5.2 обеспечивает передовую производительность в агентном программировании с измеримыми улучшениями в таких областях, как интерактивное написание кода, код-ревью и поиск ошибок.

В ChatGPT модели GPT‑5.2 Instant, Thinking и Pro начинают распространяться с сегодняшнего дня, начиная с платных тарифных планов. В API они уже доступны всем разработчикам.

В целом GPT‑5.2 приносит значительные улучшения в области общего интеллекта, понимания длинного контекста, агентного вызова инструментов и работы с визуальными данными, что делает модель эффективнее любой предыдущей в сквозном выполнении сложных задач реального мира.

Производительность модели

Задачи, имеющие экономическую ценность

GPT‑5.2 Thinking — наша лучшая на сегодняшний день модель для реального профессионального использования. В GDPval, тесте для оценки четко сформулированных задач интеллектуального труда по 44 профессиям, GPT‑5.2 Thinking устанавливает новый рекорд и является нашей первой моделью, которая работает на уровне эксперта-человека или выше него. В частности, по оценкам независимых экспертов-судей, GPT‑5.2 Thinking превосходит ведущих профессионалов индустрии или выступает с ними на равных в 70,9% сравнений по задачам интеллектуального труда из GDPval. Эти задачи включают создание презентаций, электронных таблиц и других рабочих материалов. GPT‑5.2 Thinking генерировала результаты для тестов GDPval со скоростью >11x и стоимостью <1% от показателей профессиональных экспертов, что говорит о том, что при надзоре со стороны человека GPT‑5.2 может оказывать реальную помощь в профессиональной деятельности. Оценки скорости и стоимости основаны на исторических метриках; скорость в ChatGPT может отличаться.

В бенчмарке GDPval модели выполняют четко определенные задачи интеллектуального труда, охватывающие 44 профессии из 9 ведущих отраслей, вносящих наибольший вклад в ВВП США. Задачи требуют создания реальных рабочих продуктов, таких как презентации по продажам, бухгалтерские электронные таблицы, графики работы неотложной помощи, производственные схемы или короткие видеоролики. В ChatGPT модель GPT‑5.2 Thinking оснащена новыми инструментами, которых нет у GPT‑5 Thinking.

Оценивая один особенно удачный результат, судья GDPval прокомментировал: «Это захватывающий и заметный скачок в качестве результатов… [работа] выглядит так, будто ее выполнила профессиональная компания со штатом сотрудников, и имеет удивительно хорошо продуманный макет и рекомендации для обоих видов материалов, хотя в одном месте все же есть небольшие ошибки, которые нужно исправить».

Кроме того, в нашем внутреннем бенчмарке задач по финансовому моделированию в электронных таблицах для младших аналитиков инвестиционно-банковской сферы (таких как составление трех форм финансовой отчетности для компании из списка Fortune 500 с надлежащим форматированием и цитированием, или создание модели выкупа за счет заемных средств для сделки take-private) средний балл GPT‑5.2 Thinking за задачу на 9,3% выше, чем у GPT‑5.1, поднявшись с 59,1% до 68,4%.

Сравнения лицом к лицу демонстрируют возросшую проработанность и улучшенное форматирование в электронных таблицах и слайдах, созданных с помощью GPT‑5.2 Thinking:

Чтобы использовать новые возможности работы с электронными таблицами и презентациями в ChatGPT, у вас должна быть подписка Plus, Pro, Business или Enterprise, а также выбран вариант GPT‑5.2 Thinking или Pro. Генерация сложных материалов может занимать много минут.

Программирование

GPT‑5.2 Thinking устанавливает новый технологический стандарт на уровне 55,6% в SWE-Bench Pro — строгом тесте для оценки задач реальной программной инженерии. В отличие от SWE-bench Verified, который тестирует только Python, SWE-Bench Pro оценивает четыре языка программирования и задуман как более устойчивый к утечкам данных, сложный, разнообразный и актуальный для индустрии бенчмарк.

В SWE-Bench Pro модели выдается репозиторий кода, и она должна сгенерировать патч для решения реалистичной инженерной задачи.

В SWE-bench Verified (на графике не отображается) модель GPT‑5.2 Thinking показывает новый рекордный результат в 80%.

Для повседневного профессионального использования это означает появление модели, которая способна надежнее исправлять баги в продакшн-коде, реализовывать запросы на новые функции, рефакторить крупные кодовые базы и выпускать исправления в сквозном режиме с меньшим объемом ручного вмешательства.

GPT‑5.2 Thinking также превосходит GPT‑5.1 Thinking в задачах фронтенд-разработки. Первые тестировщики отметили, что она значительно сильнее в разработке интерфейсов и решении сложных или нестандартных задач UI — особенно связанных с 3D-элементами. Это делает модель мощным повседневным помощником для инженеров, работающих со всеми уровнями стека. Ниже приведены несколько примеров того, что она способна создать по одному текстовому запросу:

Первые тестировщики поделились своими отзывами о возможностях GPT‑5.2 в программировании:

Фактическая точность

GPT‑5.2 Thinking допускает галлюцинации реже, чем GPT‑5.1 Thinking. На наборе обезличенных запросов из ChatGPT количество ответов с ошибками сократилось на 30%rel. Для профессионалов это означает меньше ошибок при использовании модели для исследований, подготовки текстов, анализа и поддержки принятия решений, что делает ее более надежной для повседневного интеллектуального труда.

Усилие рассуждения было установлено на максимум, инструмент поиска был включен. Ошибки выявлялись другими моделями, которые также могут допускать ошибки. Уровень ошибок на уровне отдельных утверждений значительно ниже, чем на уровне ответов в целом, так как большинство ответов содержат множество утверждений.

Как и любые модели, GPT‑5.2 Thinking несовершенна. Для любых критически важных задач перепроверяйте ее ответы.

Длинный контекст

GPT‑5.2 Thinking устанавливает новый технологический стандарт в рассуждениях на длинных контекстах, демонстрируя ведущую производительность в тесте OpenAI MRCRv2 — оценке, которая проверяет способность модели объединять информацию, распределенную по длинным документам. В реальных задачах, таких как глубокий анализ документов, требующих сопоставления связанной информации из сотен тысяч токенов, GPT‑5.2 Thinking значительно точнее GPT‑5.1 Thinking. В частности, это первая известная нам модель, которая достигает практически 100% точности на варианте MRCR с 4 иглами (в диапазоне до 256 тыс. токенов).

Практически это позволяет профессионалам использовать GPT‑5.2 для работы с длинными документами — такими как отчеты, контракты, научные статьи, стенограммы и многофайловые проекты — сохраняя согласованность и точность на протяжении сотен тысяч токенов. Это делает GPT‑5.2 исключительно подходящей для глубокого анализа, синтеза информации и сложных рабочих процессов с несколькими источниками.

В бенчмарке OpenAI-MRCR⁠ v2 (разрешение многораундовых коференций) в длинные массивы («стога сена») из похожих запросов и ответов внедряются несколько идентичных пользовательских запросов («иголок»), после чего модель должна воспроизвести ответ на n-ю «иголку». В версии 2 этого теста исправлено около 5% задач, имевших некорректные эталонные значения. Средний коэффициент совпадения измеряет среднее отношение совпадения строк между ответом модели и правильным ответом. Точки для 256 тыс. токенов на входе представляют собой средние значения по диапазону 128–256 тыс. входных токенов и так далее. Здесь 256 тыс. означает 256×1024 = 262 144 токена. Усилие рассуждения было установлено на максимальное доступное значение.

Для задач, требующих осмысления за пределами максимального контекстного окна, модель GPT‑5.2 Thinking совместима с нашей новой конечной точкой Responses /compact, которая расширяет эффективное контекстное окно модели. Это позволяет GPT‑5.2 Thinking справляться с более трудоемкими и долго выполняющимися рабочими процессами, которые в противном случае были бы ограничены длиной контекста. Читайте подробнее в нашей документации по API.

Зрение

GPT‑5.2 Thinking — наша самая мощная визуальная модель на сегодняшний день: она примерно вдвое сокращает количество ошибок при анализе графиков и понимании интерфейсов программного обеспечения.

Для повседневного профессионального использования это означает, что модель может более точно интерпретировать информационные панели, скриншоты продуктов, технические схемы и визуальные отчёты, поддерживая рабочие процессы в финансах, операционной деятельности, инженерии, дизайне и службе поддержки, где визуальная информация играет ключевую роль.

В исследовании CharXiv Reasoning модели отвечают на вопросы по визуальным графикам из научных статей. Был включен инструмент Python, а уровень усилий рассуждения установлен на максимум.

В ScreenSpot-Pro модели должны анализировать высококачественные снимки графических интерфейсов пользователя из различных профессиональных сфер. Был включен инструмент Python, а уровень усилий рассуждения установлен на максимум. Без инструмента Python результаты оказываются значительно хуже. Мы рекомендуем включать инструмент Python для подобных визуальных задач.

По сравнению с предыдущими моделями, GPT‑5.2 Thinking лучше понимает расположение элементов на изображении, что помогает в задачах, где относительное расположение играет ключевую роль в решении проблемы. В примере ниже мы просим модель определить компоненты на входном изображении (в данном случае — на материнской плате) и вернуть метки с приблизительными рамками ограничивающих прямоугольников. Даже на изображении низкого качества GPT‑5.2 определяет основные области и расставляет рамки, которые порой точно совпадают с реальным расположением каждого компонента, в то время как GPT‑5.1 маркирует лишь несколько частей и демонстрирует гораздо более слабое понимание их пространственного расположения. Обе модели допускают явные ошибки, но GPT‑5.2 показывает лучшую способность понимать изображение.

GPT‑5.1
Example output of GPT-5.1 identifying components in an image
GPT‑5.2
Example output of GPT-5.2 identifying components in an image

Вызов инструментов

GPT‑5.2 Thinking устанавливает новый рекорд на уровне 98,7% в бенчмарке Tau2-bench Telecom, демонстрируя способность надежно использовать инструменты в долгих многораундовых задачах.

Для вариантов использования, чувствительных к задержкам, GPT‑5.2 Thinking также намного лучше справляется с рассуждениями при значении reasoning.effort='none', значительно превосходя GPT‑5.1 и GPT‑4.1.

В τ2-bench⁠ модели используют инструменты для выполнения задач службы поддержки в рамках многораундового взаимодействия с симулированным пользователем. Для телекоммуникационного домена мы включили в системный промпт короткую и общую полезную инструкцию для повышения производительности. Мы исключаем подмножество авиакомпаний (Airline) из-за более низкого качества разметки эталонных данных.

Для профессионалов это означает более надежные сквозные рабочие процессы — такие как решение вопросов службы поддержки, извлечение данных из нескольких систем, проведение анализа и создание финальных результатов с меньшим количеством сбоев между этапами.

Например, при задавании сложного вопроса клиентской службе, требующего многошагового решения, модель может более эффективно координировать весь рабочий процесс между несколькими агентами. В приведенном ниже случае путешественник сообщает о задержке рейса, пропущенной пересадке, ночевке в Нью-Йорке и необходимости предоставления места по медицинским показаниям. GPT‑5.2 управляет всей цепочкой задач — перебронированием, местами для специальной помощи и компенсацией, — обеспечивая более полный результат, чем GPT‑5.1.

Мой рейс из Парижа в Нью-Йорк задержали, и я опоздал на пересадку до Остина. Также пропал мой сдаваемый багаж, и мне нужно провести ночь в Нью-Йорке. Кроме того, по медицинским показаниям мне требуется специальное место в первом ряду. Можете мне помочь?

GPT‑5.1
Example of tool calling output in GPT-5.1
GPT‑5.2
Example of tool calling output in GPT-5.2

Наука и математика

Одна из наших надежд на искусственный интеллект заключается в том, что он ускорит научные исследования на благо каждого. Стремясь к этому, мы сотрудничали с учеными и прислушивались к их мнениям, чтобы понять, как ИИ может ускорить их работу, и в прошлом месяце поделились некоторыми первыми совместными экспериментами здесь.

Мы верим, что GPT‑5.2 Pro и GPT‑5.2 Thinking — лучшие в мире модели для помощи ученым и ускорения их работы. В GPQA Diamond, защищенном от Google бенчмарке вопросов и ответов университетского уровня, модель GPT‑5.2 Pro набирает 93,2%, за ней следует GPT‑5.2 Thinking с результатом 92,4%.

В GPQA Diamond модели отвечают на вопросы с вариантами ответов по физике, химии и биологии. Инструменты не использовались, а уровень усилий рассуждения был установлен на максимум.

В FrontierMath (уровни 1–3), оценке математических задач экспертного уровня, модель GPT‑5.2 Thinking установила новый рекорд, решив 40,3% задач.

В FrontierMath модели решают математические задачи экспертного уровня. Был запущен инструмент Python, а уровень рассуждений установлен на максимум.

Мы начинаем замечать, как модели искусственного интеллекта ощутимо и заметно ускоряют прогресс в математике и естественных науках. Например, в ходе недавней работы с GPT‑5.2 Pro исследователи изучили открытый вопрос в теории статистического обучения. В узких, четко определенных условиях модель предложила доказательство, которое впоследствии было верифицировано авторами и изучено совместно с внешними экспертами, продемонстрировав, как передовые модели могут оказывать содействие в математических исследованиях под пристальным контролем человека.

ARC-AGI 2

На бенчмарке ARC-AGI-1 (Verified), предназначенном для оценки общих способностей к рассуждению, GPT‑5.2 Pro стала первой моделью, преодолевшей порог в 90%, улучшив результат 87%, показанный o3‑preview в прошлом году, и при этом снизив стоимость достижения такой производительности примерно в 390 раз.

На ARC-AGI-2 (Verified), который повышает уровень сложности и лучше изолирует беглость рассуждений, GPT‑5.2 Thinking устанавливает новый стандарт для моделей с цепочкой рассуждений (chain-of-thought), набирая 52,9%. GPT‑5.2 Pro показывает еще более высокий результат, достигая 54,2% и дополнительно расширяя возможности модели по решению новых абстрактных задач.

Улучшения в этих оценках отражают более сильные навыки многоэтапных рассуждений GPT‑5.2, возросшую количественную точность и более надежное решение сложных технических задач.

Вот что говорят о GPT‑5.2 наши первые тестировщики:

GPT‑5.2 в ChatGPT

Пользователи ChatGPT должны заметить, что повседневное использование GPT‑5.2 стало приятнее: модель стала более структурированной, надежной и по-прежнему интересной в общении.

GPT‑5.2 Instant — это быстрая и производительная рабочая лошадка для повседневной работы и учебы, с заметными улучшениями в поисковых запросах, инструкциях и руководствах, техническом письме и переводе, опирающаяся на более теплый разговорный тон, представленный в GPT‑5.1 Instant. Первые тестировщики особенно отметили более четкие пояснения, которые сразу выводят на первый план ключевую информацию.

GPT‑5.2 Thinking предназначена для более глубокой работы, помогая пользователям справляться с более сложными задачами с большей проработкой — особенно в программировании, обобщении длинных документов, ответах на вопросы по загруженным файлам, пошаговом решении математических и логических задач, а также в поддержке планирования и принятия решений с более четкой структурой и более полезными деталями.

GPT‑5.2 Pro — это наш самый умный и надежный вариант для сложных вопросов, когда более качественный ответ стоит ожиданий. Раннее тестирование показывает меньше крупных ошибок и более высокую производительность в таких сложных областях, как программирование.

Безопасность

GPT‑5.2 опирается на исследования в области безопасных ответов (safe completions), которые мы внедрили в GPT‑5; они учат модель давать наиболее полезный ответ, оставаясь при этом в рамках стандартов безопасности.

В этом релизе мы продолжили работу над улучшением ответов наших моделей в деликатных беседах, добившись значительных успехов в том, как они реагируют на запросы, указывающие на признаки суицида или селфхарма, психологические проблемы или эмоциональную привязанность к модели. Эти целенаправленные меры привели к снижению числа нежелательных ответов как в GPT‑5.2 Instant, так и в GPT‑5.2 Thinking по сравнению с моделями GPT‑5.1 и GPT‑5 Instant и Thinking. Более подробную информацию можно найти в системной карте.

Мы находимся на начальном этапе развертывания нашей модели прогнозирования возраста, чтобы автоматически применять защитные меры для пользователей младше 18 лет и ограничивать доступ к деликатному контенту. Это дополняет наш существующий подход к пользователям, чей возраст до 18 лет нам известен, а также функции родительского контроля.

GPT‑5.2 — это лишь шаг в череде постоянных улучшений, и мы еще далеки от завершения работы. Хотя этот релиз обеспечивает значительный прирост интеллекта и производительности, мы понимаем, что есть области, где пользователи ждут большего. В ChatGPT мы работаем над известными проблемами, такими как избыточные отказы, одновременно продолжая повышать стандарты безопасности и надежности в целом. Эти изменения сложны, и мы сосредоточены на том, чтобы сделать все правильно.

Оценки в области психического здоровья


GPT‑5.2
Instant

GPT‑5.1
Instant

GPT‑5.2
Thinking

GPT‑5.1
Thinking

Психическое здоровье

0,995

0,883

0,915

0,684

Эмоциональная зависимость

0,938

0,945

0,955

0,785

Селфхарм

0,938

0,925

0,963

0,937

Доступность и цены

Мы начинаем внедрение GPT‑5.2 (Instant, Thinking и Pro) в ChatGPT сегодня, начиная с платными планов (Plus, Pro, Go, Business, Enterprise). Мы внедряем GPT‑5.2 постепенно, чтобы сделать работу ChatGPT максимально плавной и надежной; если вы не увидите модель сразу, пожалуйста, попробуйте позже. В ChatGPT модель GPT‑5.1 будет по-прежнему доступна платным пользователям в течение трех месяцев в качестве устаревшей модели, после чего мы прекратим ее поддержку.

Названия моделей в ChatGPT и API

ChatGPT

API

ChatGPT‑5.2 Instant

GPT‑5.2‑chat‑latest

ChatGPT‑5.2 Thinking

GPT‑5.2

ChatGPT‑5.2 Pro

GPT‑5.2 Pro

В нашей платформе API модель GPT‑5.2 Thinking доступна уже сегодня в Responses API и Chat Completions API как gpt-5.2, а GPT‑5.2 Instant как gpt-5.2-chat-latest. GPT‑5.2 Pro доступна в Responses API как gpt-5.2-pro. Теперь разработчики могут настраивать параметр рассуждения в GPT‑5.2 Pro, и как GPT‑5.2 Pro, так и GPT‑5.2 Thinking теперь поддерживают новый пятый уровень усилий рассуждения xhigh для задач, где качество имеет наибольшее значение.

Стоимость GPT‑5.2 составляет $1,75 за 1 млн входных токенов и $14 за 1 млн выходных токенов при скидке 90% на кэшированные входные данные. В ходе множественных агентских оценок мы выяснили, что, несмотря на более высокую стоимость GPT‑5.2 за один токен, затраты на достижение заданного уровня качества в итоге оказываются ниже благодаря более высокой токен-эффективности модели.

В то время как стоимость подписки на ChatGPT остается прежней, в API модель GPT‑5.2 стоит дороже за токен, чем GPT‑5.1, поскольку она является более мощной. Тем не менее, ее цена остается ниже по сравнению с другими передовыми моделями, поэтому пользователи могут продолжать активно использовать ее в повседневной работе и ключевых приложениях.

Цена за миллион токенов

Модель

Входные данные

Кэшированные входные данные

Выходные данные

gpt-5.2 /
gpt-5.2-chat-latest

$1,75

$0,175

$14

gpt-5.2-pro

$21

-

$168

gpt-5.1 /
gpt-5.1-chat-latest

$1,25

$0,125

$10

gpt-5-pro

$15

-

$120

У нас нет текущих планов по прекращению поддержки GPT‑5.1, GPT‑5 или GPT‑4.1 в API, и мы заблаговременно сообщим разработчикам о любых планах по выводу моделей из эксплуатации. Хотя GPT‑5.2 будет отлично работать «из коробки» в Codex, мы планируем выпустить оптимизированную для Codex версию GPT‑5.2 в ближайшие недели.

Наши партнеры

GPT‑5.2 была создана в сотрудничестве с нашими давними партнерами NVIDIA и Microsoft. Дата-центры Azure и графические процессоры NVIDIA, включая H100, H200 и GB200-NVL72, лежат в основе масштабной тренировочной инфраструктуры OpenAI, обеспечивая значительный рост интеллекта моделей. Это партнерство позволяет нам уверенно масштабировать вычислительные мощности и быстрее выводить новые модели на рынок.

Приложение

Подробные бенчмарки

Ниже мы публикуем полные результаты тестирования GPT‑5.2 Thinking, а также часть результатов для GPT‑5.2 Pro.

Профессиональные навыки
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
GDPval (допускаются ничьи, победы или ничьи)70,9%74,1%38,8% (GPT-5)
GDPval (допускаются ничьи, явные победы)49,8%60,0%35,5% (GPT-5)
GDPval (без ничьих)61,0%67,6%37,1% (GPT-5)
Задачи по электронным таблицам для инвестиционного банкинга (внутренние)68,4%71,7%59,1%
Программирование
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
SWE-Bench Pro, общедоступный55,6%-50,8%
SWE-bench Verified80,0%-76,3%
SWE-Lancer, IC Diamond*74,6%-69,7%
Фактологичность
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
Ответы ChatGPT без ошибок (с поиском)93,9%-91,2%
Ответы ChatGPT без ошибок (без поиска)88,0%-87,3%
Длинный контекст
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
OpenAI MRCRv2, 8 иголок, 4к–8к98,2%-65,3%
OpenAI MRCRv2, 8 иголок, 8к–16к89,3%-47,8%
OpenAI MRCRv2, 8 иголок, 16к–32к95,3%-44,0%
OpenAI MRCRv2, 8 иголок, 32к–64к92,0%-37,8%
OpenAI MRCRv2, 8 иголок, 64к–128к85,6%-36,0%
OpenAI MRCRv2, 8 иголок, 128к–256к77,0%-29,6%
BrowseComp Long Context 128k92,0%-90,0%
BrowseComp Long Context 256k89,8%-89,5%
GraphWalks bfs <128k94,0%-76,8%
Graphwalks parents <128k89,0%-71,5%
Зрение
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
Рассуждения CharXiv (без инструментов)82.1%-67.0%
Рассуждения CharXiv (с Python)88.7%-80.3%
MMMU Pro (без инструментов)79.5%--
MMMU Pro (с Python)80.4%-79.0%
Video MMMU (без инструментов)85.9%-82.9%
Screenspot Pro (с Python)86.3%-64.2%
Использование инструментов
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
Tau2-bench Telecom98.7%-95.6%
Tau2-bench Retail82.0%-77.9%
BrowseComp65.8%77.9%50.8%
Scale MCP-Atlas60.6%-44.5%
Toolathlon46.3%-36.1%
Академические тесты
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
GPQA Diamond (без инструментов)92.4%93.2%88.1%
HLE (без инструментов)34.5%36.6%25.7%
HLE (с поиском, Python)45.5%50.0%42.7%
MMMLU89.6%-89.5%
HMMT, фев. 2025 (без инструментов)99.4%100.0%96.3%
AIME 2025 (без инструментов)100.0%100.0%94.0%
FrontierMath, уровни 1–3 (с Python)40.3%-31.0%
FrontierMath, уровень 4 (с Python)14.6%-12.5%
Абстрактные рассуждения
GPT-5.2 ThinkingGPT-5.2 ProGPT-5.1 Thinking
ARC-AGI-1 (проверенный)86.2%90.5%72.8%
ARC-AGI-2 (проверенный)52.9%54.2% (выс.)17.6%

Модели запускались с максимальным доступным уровнем детализации рассуждений в нашем API (xhigh для GPT‑5.2 Thinking & Pro и high для GPT‑5.1 Thinking), за исключением профессиональных тестов, где GPT‑5.2 Thinking запускалась с тяжелым уровнем рассуждений (heavy) — максимальным из доступных в ChatGPT Pro. Бенчмарки проводились в исследовательской среде, что в некоторых случаях может давать результаты, слегка отличающиеся от рабочей версии ChatGPT в продакшене.

* Для SWE-Lancer мы исключили 40 задач из 237, которые не запускались на нашей инфраструктуре.

Автор

OpenAI

Полный текст статьи читайте на OpenAI