Представляем GPT‑5 для разработчиков

GPT_5_Dev_SEO.png?w=1600&h=900&fit=fill

Лучшая модель для написания кода и автономных задач (агентов).

Введение

Сегодня мы выпускаем GPT‑5 на нашей API-платформе — это наша лучшая модель для написания кода и агентных задач.

GPT‑5 демонстрирует передовые результаты (SOTA) по ключевым бенчмаркам программирования, набирая 74,9% на SWE-bench Verified и 88% на Aider polyglot. Мы обучили GPT‑5 быть настоящим помощником в разработке. Модель отлично справляется с созданием высококачественного кода, решением таких задач, как исправление ошибок, редактирование кода и ответы на вопросы по сложным кодовым базам. Моделью легко управлять, она ориентирована на совместную работу — способна следовать очень подробным инструкциям с высокой точностью и предоставлять предварительные объяснения своих действий до и между вызовами инструментов. Модель также превосходно пишет фронтенд-код, опережая OpenAI o3 в веб-разработке фронтенда в 70% случаев при внутреннем тестировании.

Мы обучили GPT‑5 на реальных задачах программирования в сотрудничестве с первыми тестерами из числа стартапов и крупных компаний. Cursor отмечает, что GPT‑5 — «самая умная модель из тех, что они использовали», и она «невероятно интеллектуальна, ей легко управлять, и у нее даже есть индивидуальность, которой [они] не видели в других моделях». Windsurf поделились, что GPT‑5 показывает уровень SOTA на их оценках и «имеет вдвое меньший процент ошибок при вызове инструментов по сравнению с другими передовыми моделями». Vercel говорит, что «это лучшая ИИ-модель для фронтенда, достигающая высших показателей как по эстетическому восприятию, так и по качеству кода, что ставит ее в совершенно особую категорию».

GPT‑5 также отлично справляется с долгосрочными агентными задачами, демонстрируя результаты уровня SOTA в телекоммуникационном бенчмарке τ2-bench (96,7%), представленном всего 2 месяца назад. Усовершенствованный интеллект работы с инструментами позволяет GPT‑5 надежно объединять в цепочки десятки вызовов инструментов — как последовательно, так и параллельно — не теряя контекста, что делает ее гораздо более эффективной при выполнении сложных реальных задач от начала до конца. Она также более точно следует инструкциям инструментов, лучше справляется с их ошибками и преуспевает в извлечении контента из длинного контекста. Manus заявляет, что GPT‑5 «достигла лучшей производительности из всех, что они когда-либо видели от одной модели в рамках своих внутренних тестов». Notion говорит, что «быстрые ответы модели, особенно в режиме низких рассуждений, делают GPT‑5 идеальным выбором, когда вам нужно решить сложные задачи за один заход». Inditex поделилась: «что действительно выделяет [GPT‑5], так это глубина ее рассуждений: тонкие, многослойные ответы, отражающие реальное понимание предметной области».

Мы представляем новые функции в нашем API, которые дают разработчикам больше контроля над ответами модели. GPT‑5 поддерживает новый параметр verbosity (значения: low, medium, high), который помогает регулировать длину ответов: будут ли они краткими и по делу или длинными и исчерпывающими. Параметр reasoning_effort для GPT‑5 теперь может принимать минимальное значение для более быстрого получения ответов без предварительного масштабного процесса рассуждений. Мы также добавили новый тип инструментов — пользовательские инструменты (custom tools), позволяющие GPT‑5 вызывать инструменты с помощью простого текста вместо JSON. Пользовательские инструменты поддерживают ограничение с помощью предоставленных разработчиком контекстно-свободных грамматик.

Мы выпускаем GPT‑5 в API в трех размерах — gpt-5, gpt-5-mini и gpt-5-nano, чтобы дать разработчикам больше гибкости в балансировке производительности, стоимости и задержки. В то время как GPT‑5 в ChatGPT представляет собой систему из моделей с рассуждениями, без рассуждений и маршрутизатора, GPT‑5 на платформе API — это именно та модель рассуждений, которая обеспечивает максимальную производительность в ChatGPT. Примечательно, что GPT‑5 с минимальным уровнем рассуждений отличается от модели без рассуждений в ChatGPT и лучше оптимизирована для разработчиков. Модель без рассуждений, используемая в ChatGPT, доступна под именем gpt-5-chat-latest.

Чтобы прочитать о GPT‑5 в ChatGPT и узнать больше о других улучшениях ChatGPT, обратитесь к нашему исследовательскому блогу. Подробнее о том, как компании стремятся использовать GPT‑5, читайте в нашем корпоративном блоге.

Программирование

GPT‑5 — это самая мощная модель для программирования из всех, что мы когда-либо выпускали. Она превосходит o3 в бенчмарках программирования и сценариях реального использования, а также была дообучена, чтобы блистать в агентных продуктах для разработки, таких как Cursor, Windsurf, GitHub Copilot и Codex CLI. GPT‑5 впечатлила наших альфа-тестеров, установив рекорды во многих их закрытых внутренних оценках.

Первые отзывы о GPT‑5 в реальных задачах программирования

В SWE-bench Verified, оценке на основе реальных задач программной инженерии, GPT‑5 набирает 74,9% по сравнению с 69,1% у o3. Примечательно, что GPT‑5 достигает высокого результата с большей эффективностью и скоростью: по сравнению с o3 при высоком уровне рассуждений, GPT‑5 использует на 22% меньше токенов вывода и на 45% меньше вызовов инструментов.

В SWE-bench Verified, модели предоставляются репозиторий кода и описание проблемы, и она должна сгенерировать патч для ее решения. Текстовые метки указывают уровень усилий на рассуждение. Наши результаты не включают 23 из 500 задач, решения которых не прошли надежную проверку в нашей инфраструктуре. GPT‑5 получила короткую подсказку с акцентом на тщательную проверку решений; аналогичная подсказка не дала преимуществ модели o3.

В Aider polyglot, оценке редактирования кода, GPT‑5 устанавливает новый рекорд в 88%, снижая частоту ошибок на треть по сравнению с o3.

В Aider polygot (diff), модели дается упражнение по программированию из Exercism, и она должна написать его решение в виде дифа кода. Модели рассуждений запускались с высоким уровнем усилий на рассуждение.

Мы также обнаружили, что GPT‑5 превосходно глубоко погружается в кодовые базы, чтобы отвечать на вопросы о том, как работают различные части или как они взаимодействуют друг с другом. На примере столь сложной кодовой базы, как стек обучения с подкреплением OpenAI, мы видим, что GPT‑5 помогает нам анализировать код и отвечать на вопросы о нем, ускоряя нашу повседневную работу.

Фронтенд-инженерия

Создавая фронтенд-код для веб-приложений, GPT‑5 демонстрирует лучший эстетический вкус, большую амбициозность и точность. При прямом сравнении с o3 тестеры отдавали предпочтение GPT‑5 в 70% случаев.

Вот несколько ярких, отобранных вручную примеров того, что GPT‑5 способна сделать по единственному запросу:

Смотрите больше примеров от GPT‑5 в нашей галерее здесь.

Совместная разработка кода

GPT‑5 — лучший напарник по разработке, особенно в агентных продуктах для программирования, таких как Cursor, Windsurf, GitHub Copilot и Codex CLI. В процессе работы GPT‑5 может выдавать планы, обновления и сводки между вызовами инструментов. По сравнению с нашими прошлыми моделями, GPT‑5 более проактивна в выполнении амбициозных задач, не останавливаясь в ожидании вашего одобрения и не пасуя перед высокой сложностью.

Вот пример того, как выглядит работа GPT‑5 над сложной задачей (в данном случае — создание веб-сайта для ресторана):

После того как пользователь попросил создать сайт для ресторана, GPT‑5 делится кратκим планом, создает каркас приложения, устанавливает зависимости, наполняет сайт контентом, запускает сборку для проверки на наличие ошибок компиляции, подводит итог своей работе и предлагает возможные дальнейшие шаги. Это видео ускорено примерно в 3 раза, чтобы сэкономить ваше время; общая продолжительность создания сайта составила около трех минут.

Агентные задачи

Помимо агентного программирования, GPT‑5 в целом лучше справляется с агентными задачами. GPT‑5 устанавливает новые рекорды в бенчмарках следования инструкциям (69,6% на Scale MultiChallenge по оценке o3‑mini) и вызова инструментов (96,7% на τ2-bench telecom). Усовершенствованный интеллект инструментов позволяет GPT‑5 более надежно объединять действия в цепочки для решения реальных задач.

Первые отзывы о GPT‑5 для агентных задач

Следование инструкциям

GPT‑5 следует инструкциям надежнее, чем любой из ее предшественников, показывая высокие результаты в COLLIE, Scale MultiChallenge и нашей внутренней оценке следования инструкциям.

В COLLIE модели должны писать текст, соответствующий различным ограничениям. В Scale MultiChallenge модели проходят проверку в многодиалоговых беседах на предмет правильного использования четырех типов информации из предыдущих сообщений. Наши оценки получены с использованием o3‑mini в качестве оценщика, что оказалось точнее, чем GPT‑4o. В нашей внутренней оценке следования инструкциям OpenAI API модели должны выполнять сложные инструкции, составленные на основе реальных отзывов разработчиков. Модели рассуждений запускались с высоким уровнем усилий на рассуждение.

Вызов инструментов

Мы проделали большую работу по улучшению вызова инструментов в аспектах, важных для разработчиков. GPT‑5 лучше следует инструкциям инструментов, лучше справляется с ошибками инструментов и проактивно совершает множество вызовов инструментов последовательно или параллельно. При соответствующей настройке GPT‑5 также может выдавать вводные сообщения до и между вызовами инструментов, чтобы держать пользователей в курсе прогресса во время более долгих агентных задач.

Два месяца назад компания Sierra.ai опубликовала τ2-bench telecom в качестве сложного бенчмарка использования инструментов, который показал, как производительность языковых моделей значительно падает при взаимодействии с состоянием среды, которое может изменяться пользователями. В их публикации ни одна модель не набрала выше 49%. GPT‑5 набирает 97%.

В τ2-bench модель должна использовать инструменты для выполнения задач службы поддержки, где может присутствовать пользователь, способный общаться и совершать действия с состоянием мира. Модели рассуждения запускались с высоким уровнем усилий на рассуждение.

GPT-5 также демонстрирует значительные улучшения в работе с длинным контекстом. В бенчмарке OpenAI-MRCR, измеряющем способность извлекать информацию из длинного контекста, GPT-5 превосходит о3 и GPT-4.1, причем отрыв существенно увеличивается при большей длине входных данных.

В OpenAI-MRCR(разрешение многораундовых кореференций) несколько одинаковых запросов-«иголок» внедряются в длинные «стога сена», состоящие из похожих запросов и ответов, после чего модель должна воспроизвести ответ на i-ю иголку. Среднее соотношение совпадений измеряет среднее соотношение совпадений строк между ответом модели и правильным ответом. Точки на отметке 256k максимальных входных токенов представляют собой средние значения для диапазона 128k–256k входных токенов и так далее. Здесь 256k означает 256×1,024 = 262,114 токенов. Модели рассуждения запускались с высоким уровнем усилий на рассуждение.

Мы также открываем исходный код BrowseComp Long Context, нового бенчмарка для оценки ответов на вопросы на основе длинного контекста. В этом бенчмарке модели предоставляется запрос пользователя и длинный список релевантных результатов поиска, на основе которых она должна ответить на вопрос. Мы создали BrowseComp Long Context реалистичным, сложным и имеющим надежно правильные эталонные ответы. На входных данных объемом 128K–256K токенов GPT-5 дает правильный ответ в 89% случаев.

В API все модели GPT-5 могут принимать максимум 272 000 входных токенов и генерировать максимум 128 000 токенов рассуждения и вывода, что составляет суммарную длину контекста в 400 000 токенов.

Фактическая точность

GPT-5 более надежна, чем наши предыдущие модели. На промптах из бенчмарков LongFact и FactScore модель GPT-5 допускает примерно на ~80% меньше фактических ошибок, чем о3. Это делает ее лучше приспособленной для сценариев использования в качестве агентов, где важна правильность — особенно в коде, работе с данными и принятии решений.

Более высокие оценки хуже. LongFact и FActScore состоят из открытых вопросов на поиск фактов. Мы используем оценщик на базе LLM с возможностью поиска в интернете для проверки ответов на промпты из этих бенчмарков и измерения доли фактически неверных утверждений. Сведения о реализации и оценке можно найти в системной карте. Модели рассуждения использовали высокий уровень усилий на рассуждение. Поиск не был включен.

В целом GPT-5 была обучена лучше осознавать собственные ограничения и эффективнее справляться с неожиданными трудностями. Мы также обучили GPT-5 намного точнее отвечать на вопросы, связанные со здоровьем (подробнее читайте в нашем исследовательском блоге). Как и в случае со всеми языковыми моделями, мы рекомендуем проверять результаты работы GPT-5, когда ставки высоки.

Новые функции

Минимальный уровень рассуждений

Разработчики могут управлять временем обдумывания GPT-5 с помощью параметра reasoning_effort в API. В дополнение к предыдущим значениям — low, medium (по умолчанию) и high — GPT-5 также поддерживает minimal, что сводит к минимуму рассуждения GPT-5 для быстрого получения ответа.

Более высокие значения reasoning_effort максимизируют качество, а более низкие — скорость. Не все задачи в равной степени выигрывают от дополнительных рассуждений, поэтому мы рекомендуем поэкспериментировать, чтобы выяснить, что лучше всего подходит для ваших сценариев использования.

Например, уровень рассуждений выше low мало что добавляет к относительно простому извлечению информации из длинного контекста, но дает вполне заметный прирост в процентах в CharXiv Reasoning, бенчмарке визуального рассуждения.

Усилия GPT-5 на рассуждение приносят различные преимущества в зависимости от задач. В CharXiv Reasoning модели GPT-5 был предоставлен доступ к инструменту Python.

Многословность

Чтобы помочь управлять длиной ответов GPT-5 по умолчанию, мы представили новый параметр API verbosity, принимающий значения low, medium (по умолчанию) и high. Если явные инструкции противоречат параметрам многословности, приоритет имеют явные инструкции. Например, если вы попросите GPT-5 «написать эссе из 5 абзацев», ответ модели всегда должен состоять из 5 абзацев независимо от уровня многословности (однако сами абзацы могут быть длиннее или короче).

Verbosity=low

Почему небо голубое?

Из-за рэлеевского рассеяния. Молекулы воздуха намного меньше длины волны видимого света, поэтому они рассеивают короткие волны (синий/фиолетовый) гораздо сильнее, чем длинные (красный). Рассеянный синий свет попадает в ваши глаза со всех сторон, из-за чего небо кажется синим. Мы не видим фиолетовый цвет так же часто, потому что Солнце излучает его меньше, наши глаза менее чувствительны к нему, а часть его поглощается в верхних слоях атмосферы. На рассвете и закате более длинный путь через воздух удаляет большую часть синего цвета, делая небо красноватым.

Verbosity=medium

Почему небо голубое?

Из-за рэлеевского рассеяния. Солнечный свет содержит все цвета, но молекулы воздуха рассеивают более короткие волны (синий/фиолетовый) гораздо сильнее, чем более длинные волны (красный). Интенсивность рассеяния примерно пропорциональна 1/(длина волны)^4, поэтому синий свет перенаправляется по всему небу и попадает в ваши глаза.

Мы не видим фиолетовое небо, потому что:

  • Солнце излучает немного меньше фиолетового цвета, чем синего.
  • Верхние слои атмосферы поглощают часть фиолетового/ультрафиолетового излучения.
  • Человеческий глаз менее чувствителен к фиолетовому цвету.

На рассвете и закате солнечный свет проходит через более плотный слой атмосферы, рассеивая большую часть синего цвета по пути и оставляя доминировать более длинные красно-оранжевые волны.

Verbosity=high

Почему небо голубое?

Небо кажется голубым, потому что солнечный свет рассеивается крошечными молекулами в атмосфере Земли. Этот процесс называется рэлеевским рассеянием.

Основные моменты:

  • Солнечный свет состоит из множества цветов (длин волн). Более короткие волны, такие как фиолетовый и синий, рассеиваются молекулами воздуха гораздо сильнее, чем более длинные волны, такие как красный. Интенсивность рассеяния резко возрастает по мере уменьшения длины волны.
  • По мере прохождения солнечного света через атмосферу свет с более короткой длиной волны (особенно синий) рассеивается во всех направлениях, поэтому, куда бы вы ни посмотрели в сторону от Солнца, вы видите этот рассеянный синий свет — «голубое небо».

Почему не фиолетовый?

  • Солнце излучает меньше фиолетового цвета, чем синего.
  • Наши глаза менее чувствительны к фиолетовому цвету.
  • Часть фиолетового/ультрафиолетового света поглощается выше озоновым слоем.

В совокупности это приводит к тому, что рассеянный свет, который мы воспринимаем, выглядит преимущественно синим.

Почему закаты красно-оранжевые?

  • Ближе к рассвету и закату солнечный свет проходит гораздо более длинный путь через атмосферу.
  • Большая часть синего света рассеивается из прямого пути до того, как он достигает ваших глаз, в результате чего оставшийся прямой солнечный свет обогащается красными и оранжевыми волнами.

Другие факторы влияния:

  • Дымка, загрязнение, дым или пыль содержат более крупные частицы, которые рассеивают свет менее избирательно (так называемое миевое рассеяние), из-за чего небо выглядит более блеклым или белесым.
  • Голубое небо частично поляризовано из-за геометрии рассеяния, поэтому поляризационные солнцезащитные очки могут затемнять его отдельные участки.
  • На мирах с другой атмосферой и размерами частиц (например, на Марсе) небо может казаться ирисковым или красноватым по схожим причинам рассеяния.

Если бы у Земли не было атмосферы, нечему было бы рассеивать солнечный свет, и небо казалось бы черным даже днем, а Солнце выглядело бы ярким диском.

Сообщения преамбулы перед вызовами инструментов

При соответствующей инструкции GPT-5 будет выводить видимые пользователю сообщения преамбулы до и между вызовами инструментов. В отличие от скрытых сообщений рассуждения, эти видимые сообщения позволяют GPT-5 сообщать планы и ход работы пользователю, помогая конечным пользователям понять ее подход и намерение, стоящие за вызовами инструментов.

Пользовательские инструменты

Мы представляем новый тип инструментов — пользовательские инструменты, — который позволяет GPT-5 вызывать инструмент с помощью простого текста вместо JSON. Чтобы заставить GPT-5 соблюдать форматы пользовательских инструментов, разработчики могут предоставить регулярное выражение или даже более детально специфицированную контекстно-свободную грамматику.

Ранее наш интерфейс для определяемых разработчиком инструментов требовал вызывать их с использованием JSON — распространенного формата, используемого веб-API и разработчиками в целом. Однако вывод валидного JSON требует от модели идеального экранирования всех кавычек, обратных слэшей, символов новой строки и других управляющих символов. Хотя наши модели хорошо обучены выводу JSON, на длинных входных данных (вроде сотен строк кода или 5-страничного отчета) вероятность ошибки возрастает. С помощью пользовательских инструментов GPT-5 может записывать аргументы инструментов в виде простого текста без необходимости экранировать все символы, требующие экранирования.

На SWE-bench Verified при использовании пользовательских инструментов вместо инструментов JSON GPT-5 показывает примерно такие же результаты.

Безопасность

GPT‑5 расширяет границы безопасности и представляет собой более надежную, стабильную и полезную модель. GPT‑5 значительно реже допускает галлюцинации по сравнению с нашими предыдущими моделями, более честно сообщает пользователю о своих действиях и возможностях, а также предоставляет максимально полезный ответ, оставаясь при этом в рамках стандартов безопасности. Вы можете узнать больше в нашем исследовательском блоге.

Доступность и цены

Модель GPT‑5 уже доступна в API-платформе в трех размерах: gpt-5, gpt-5-mini и gpt-5-nano. Она доступна через Responses API, Chat Completions API и является моделью по умолчанию в Codex CLI. Стоимость GPT‑5 составляет $1.25 за 1 млн входных токенов и $10 за 1 млн выходных токенов, GPT‑5 mini — $0.25 за 1 млн входных токенов и $2 за 1 млн выходных токенов, а GPT‑5 nano — $0.05 за 1 млн входных токенов и $0.40 за 1 млн выходных токенов.

Эти модели поддерживают параметры API reasoning_effort и verbosity, а также пользовательские инструменты. Они также поддерживают параллельный вызов инструментов, встроенные инструменты (веб-поиск, поиск по файлам, генерацию изображений и многое другое), основные функции API (потоковую передачу данных, структурированные выводы и т. д.), а также функции для оптимизации затрат, такие как кэширование промптов и Batch API.

Версия GPT‑5 без рассуждений, используемая в ChatGPT, доступна в API как gpt-5-chat-latest, ее стоимость также составляет $1.25 за 1 млн входных токенов и $10 за 1 млн выходных токенов.

GPT‑5 также запускается на платформах Microsoft, включая Microsoft 365 Copilot, Copilot, GitHub Copilot и Azure AI Foundry.

Ознакомьтесь с документацией GPT‑5, деталями ценообразования и руководством по составлению промптов, чтобы начать работу.

Подробные бенчмарки

Интеллект
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
AIME »25(без инструментов)94.6%91.1%85.2%88.9%92.7%46.4%40.2%-
FrontierMath (только с инструментом python)26.3%22.1%9.6%15.8%15.4%---
GPQA diamond (без инструментов)85.7%82.3%71.2%83.3%81.4%66.3%65.0%50.3%
HLE[1](без инструментов)24.8%16.7%8.7%20.2%14.7%5.4%3.7%-
HMMT 2025(без инструментов)93.3%87.8%75.6%81.7%85.0%28.9%35.0%-

[1] Имеются небольшие расхождения с цифрами, опубликованными в нашей предыдущей записи в блоге, поскольку те результаты были получены на более ранней версии HLE.

Мультимодальность
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
MMMU84.2%81.6%75.6%82.9%81.6%74.8%72.7%55.4%
MMMU-Pro (среднее по стандартному и визуальному наборам)78.4%74.1%62.6%76.4%73.4%60.3%58.9%33.0%
CharXiv reasoning (с поддержкой python)81.1%75.5%62.7%78.6%72.0%56.7%56.8%40.5%
VideoMMMU, макс. кадров 25684.6%82.5%66.8%83.3%79.4%60.9%55.1%30.2%
ERQA65.7%62.9%50.1%64.0%56.5%44.3%42.3%26.5%
Написание кода
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
SWE-Lancer: IC SWE Diamond Freelance Coding Tasks$112K$75K$49K$86K$66K$34K$31K$9K
SWE-bench Verified[2]74.9%71.0%54.7%69.1%68.1%54.6%23.6%-
Aider polyglot (diff)88.0%71.6%48.4%79.6%58.2%52.9%31.6%6.2%

[2] Мы исключили 23 из 500 задач, которые не удалось запустить на нашей инфраструктуре. Полный список исключенных 23 задач: 'astropy__astropy-7606', 'astropy__astropy-8707', 'astropy__astropy-8872', 'django__django-10097', 'django__django-7530', 'matplotlib__matplotlib-20488', 'matplotlib__matplotlib-20676', 'matplotlib__matplotlib-20826', 'matplotlib__matplotlib-23299', 'matplotlib__matplotlib-24970', 'matplotlib__matplotlib-25479', 'matplotlib__matplotlib-26342', 'psf__requests-6028', 'pylint-dev__pylint-6528', 'pylint-dev__pylint-7080', 'pylint-dev__pylint-7277', 'pytest-dev__pytest-5262', 'pytest-dev__pytest-7521', 'scikit-learn__scikit-learn-12973', 'sphinx-doc__sphinx-10466', 'sphinx-doc__sphinx-7462', 'sphinx-doc__sphinx-8265' и 'sphinx-doc__sphinx-9367'.

Выполнение инструкций
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
Scale multichallenge[3](оценщик o3-mini)69.6%62.3%54.9%60.4%57.5%46.2%42.2%31.1%
Internal API instruction following eval (сложно)64.0%65.8%56.1%47.4%44.7%49.1%45.1%31.6%
COLLIE99.0%98.5%96.9%98.4%96.1%65.8%54.6%42.5%

[3] Примечание: мы обнаружили, что стандартный оценщик в MultiChallenge (GPT-4o) часто неверно оценивает ответы моделей. По нашим наблюдениям, замена оценщика на модель рассуждений, такую как o3-mini, существенно повышает точность оценки на проверенных нами примерах.

Вызов функций
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
Tau2-bench airline62.6%60.0%41.0%64.8%60.2%56.0%51.0%14.0%
Tau2-bench retail81.1%78.3%62.3%80.2%70.5%74.0%66.0%21.5%
Tau2-bench telecom96.7%74.1%35.5%58.2%40.5%34.0%44.0%12.1%
Большой контекст
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
OpenAI-MRCR: 2 needle 128k95.2%84.3%43.2%55.0%56.4%57.2%47.2%36.6%
OpenAI-MRCR: 2 needle 256k86.8%58.8%34.9%--56.2%45.5%22.6%
Graphwalks bfs <128k78.3%73.4%64.0%77.3%62.3%61.7%61.7%25.0%
Graphwalks parents <128k73.3%64.3%43.8%72.9%51.1%58.0%60.5%9.4%
BrowseComp Long Context 128k90.0%89.4%80.4%88.3%80.0%85.9%89.0%89.4%
BrowseComp Long Context 256k88.8%86.0%68.4%--75.5%81.6%19.1%
VideoMME (длинный, с категорией подписей)86.7%78.5%65.7%84.9%79.5%78.7%68.4%55.2%
Галлюцинации
GPT-5(высокий)GPT-5 mini (высокий)GPT-5 nano (высокий)OpenAI o3(высокий)OpenAI o4-mini (высокий)GPT-4.1GPT-4.1 miniGPT-4.1 nano
Уровень галлюцинаций в LongFact-Concepts (без инструментов)[меньше — лучше]1.0%0.7%1.0%5.2%3.0%0.7%1.1%-
Уровень галлюцинаций в LongFact-Objects (без инструментов)[меньше — лучше]1.2%1.3%2.8%6.8%8.9%1.1%1.8%-
Уровень галлюцинаций в FActScore (без инструментов)[меньше — лучше]2.8%3.5%7.3%23.5%38.7%6.7%10.9%-

Автор

OpenAI

Полный текст статьи читайте на OpenAI