GPT‑5.6: Передовой интеллект, который масштабируется вместе с вашими амбициями

Больше интеллектуальных возможностей от каждого токена, более высокая производительность на доллар и расширенный потенциал по запросу для решения ваших самых сложных задач.

В этой публикации в 2026 году была представлена модель GPT-5.6.

Узнайте о новейшей модели OpenAI:

GPT-6
Сравнить модели

Обновление от 21 августа 2026 г.: OpenAI снизила цены на API и кредиты для GPT‑5.6 Sol более чем на 20% на следующие 3 месяца.

Обновление от 30 июля 2026 г.: OpenAI снизила стоимость GPT‑5.6 Luna на 80% и GPT‑5.6 Terra на 20%. Узнать больше можно здесь.

Мы выпускаем семейство моделей GPT‑5.6 в общий доступ после нашего ограниченного предварительного просмотра: нашу новую флагманскую модель Sol, а также Terra — сбалансированную модель для повседневной работы, и Luna — нашу самую экономичную модель.

GPT‑5.6 Sol устанавливает новый стандарт как по уровню интеллекта, так и по эффективности, демонстрируя передовые результаты в программировании, интеллектуальной работе, кибербезопасности и научных исследованиях, при этом превосходя предыдущие и конкурирующие передовые модели при меньшем расходе токенов и более низкой предполагаемой стоимости. Результатом является более высокая производительность на каждый доллар: больше успешно выполненной работы за те же деньги или сопоставимые результаты при меньших общих затратах. Мы также представляем новый способ ускорения наиболее ресурсоемких задач: ultra — это наш режим с максимальной производительностью, координирующий работу нескольких агентов в параллельных потоках для более быстрого выполнения сложных задач. Улучшенные возможности использования компьютера и дизайнерское чутье делают GPT‑5.6 Sol нашим самым совершенным соавтором, помогающим проверять, дорабатывать и предоставлять готовые к использованию результаты.

Мы обучили GPT‑5.6 извлекать максимум полезной работы из каждого токена. В тесте Agents» Last Exam, оценивающем долгосрочные профессиональные рабочие процессы в 55 областях, GPT‑5.6 Sol устанавливает новый рекорд на уровне 53,6 балла, опережая Claude Fable 5 (с адаптивным рассуждением) на 13,1 балла. Даже в режиме среднего уровня рассуждений она превосходит Fable 5 на 11,4 балла при примерно четверти от предполагаемой стоимости. Эта эффективность распространяется и на более компактные модели, которые необходимы для того, чтобы сделать искусственный интеллект более доступным и распространенным: GPT‑5.6 Terra и GPT‑5.6 Luna превосходят Fable 5 при примерно одной шестой от стоимости. В индексе Artificial Analysis Intelligence Index, представляющем собой широкую оценку интеллекта, охватывающую агентную работу, программирование, научные рассуждения и общие возможности, GPT‑5.6 Sol с максимальным уровнем рассуждений отстает от Fable 5 всего на один балл, выполняя задачи на 61% быстрее и примерно за половину предполагаемой стоимости.

GPT‑5.6 выпускается с нашими самыми надежными средствами защиты на сегодняшний день, разработанными для противодействия целенаправленному и адаптивному неправомерному использованию без чрезмерного ограничения легитимной работы. Перед общим релизом мы подвергли модели и защитные механизмы нашему самому масштабному периоду оценки, объединившему работу команды специалистов по этичному хакерству (red teaming) и крупномасштабное автоматизированное тестирование. В ходе предварительного просмотра мы тесно сотрудничали с экспертными организациями и проверенными партнерами для стресс-тестирования систем защиты и их усиления перед широким запуском. Полученная система сочетает в себе встроенные в модель защитные механизмы с проверками в реальном времени, мониторингом и доступом, откалиброванным в соответствии с уровнем доверия и риска.

Высокая эффективность по умолчанию, максимальная производительность по запросу

GPT‑5.6 Sol — наша лучшая модель для программирования на сегодняшний день. В индексе Artificial Analysis Coding Agent Index модель GPT‑5.6 Sol с максимальным уровнем рассуждений устанавливает новый рекорд на отметке 80, что на 2,8 балла выше, чем у Fable 5, при использовании менее чем половины выходных токенов, затрате менее половины времени и примерно на треть меньшей стоимости. Это преимущество распространяется на все семейство: Terra показывает результат чуть выше Fable 5, в то время как Luna превосходит Opus 4.8; каждая из них делает это примерно за треть времени, расходуя примерно вдвое меньше выходных токенов и обходясь примерно в четверть от предполагаемой стоимости. Она также устанавливает новые рекорды в тестах Terminal‑Bench 2.1 и DeepSWE, которые проверяют сложные сценарии командной строки и долгосрочную инженерную работу в реальных кодовых базах.

GPT‑5.6 способна писать и запускать легковесные программы, которые координируют инструменты, обрабатывают промежуточные результаты, отслеживают прогресс и выбирают следующее действие по мере развития работы. Это позволяет решать ресурсоемкие задачи с меньшим количеством токенов, меньшим числом обращений к модели и меньшим объемом руководства со стороны пользователя. Вместо того чтобы заставлять разработчиков прописывать каждый шаг сценария или возвращать каждый ответ инструмента обратно в модель, функция Programmatic Tool Calling (программный вызов инструментов) в Responses API может отфильтровывать большие объемы промежуточных данных, сохраняя только самое необходимое, и адаптировать свой рабочий процесс на лету.

Для задач, требующих больших затрат времени и вычислений, GPT‑5.6 может выйти за рамки этого эффективного режима по умолчанию. max предоставляет GPT‑5.6 еще больше времени, чем xhigh, для рассуждений и изучения альтернатив, запуска проверок и корректировки подхода. ultra идет еще дальше, по умолчанию координируя работу четырех агентов параллельно, жертвуя повышенным расходом токенов ради более сильных результатов и сокращения времени получения результата для сложных задач. На приведенных ниже графиках сравнивается конфигурация с четырьмя агентами по умолчанию для режима ultra с базовым вариантом с одним агентом в тестах BrowseComp, SEC-Bench Pro и Terminal-Bench 2.1; для BrowseComp и SEC-Bench Pro также показаны конфигурации с 16 агентами. Во всех трех тестах добавление параллельных агентов смещает границу соотношения «оценка — задержка» вверх и влево, позволяя добиваться лучших результатов за меньшее время. В API разработчики могут создавать функционал, аналогичный режиму ultra, используя бета-версию multi-agent в Responses API. 4, 5, 6

1 из 11
»GPT‑5.6 — одна из сильнейших моделей, протестированных нами на CursorBench, которая демонстрирует солидные результаты на ранних этапах оценки. Это захватывающий шаг вперед для разработчиков в плане стабильности, интеллекта и общей эффективности. Мы с нетерпением ждем возможности предоставить эту модель нашим пользователям Cursor.»
— Оскар Шульц (Oskar Schulz), президент Cursor

Качественный скачок в дизайне

GPT‑5.6 обеспечивает принципиально новый уровень эстетического восприятия и дизайнерского чутья. Получая лишь высокоуровневые указания, GPT‑5.6 создает стильные, эргономичные и функциональные интерфейсы. Ее улучшенные возможности использования компьютера позволяют ей инспектировать и дорабатывать визуальный результат (а не просто генерировать базовый код или контент), благодаря чему она может выявлять визуальные и функциональные недочеты и наводить финальные штрихи перед передачей работы пользователю.

Возможности GPT‑5.6 во фронтенде также позволяют преобразовывать запросы на естественном языке в качественные интерактивные пояснения и визуализации в рамках ChatGPT Work.

Комплексная интеллектуальная работа

GPT‑5.6 обеспечивает лучшие результаты при выполнении профессиональных задач. Модель берет неструктурированный контекст из ваших документов и повседневных рабочих инструментов (таких как Slack, Notion, Microsoft 365 и Google Drive) и преобразует его в экспертные материалы, готовые к совместному использованию.

Сильные стороны GPT‑5.6 в интеллектуальной работе проявляются в тестах, охватывающих долгосрочный профессиональный анализ, веб-серфинг, использование инструментов и работу с компьютером. GPT‑5.6 Sol устанавливает новые рекорды в тестах BrowseComp (92,2%) и OSWorld 2.0 (62,6%); в OSWorld она превосходит Opus 4.8, используя при этом на 85% меньше выходных токенов. Прирост производительности на доллар здесь распространяется на все семейство GPT‑5.6. Luna практически достигает пиковой производительности GPT‑5.5 при менее чем половине предполагаемой стоимости, в то время как Terra превосходит ее при меньших затратах.

GPT‑5.6 Sol повышает качество презентаций, документов и электронных таблиц, создавая более проработанные и точные материалы. Она способна создавать полностью редактируемые презентации с нуля, преобразуя текстовый запрос и исходные материалы в связное визуальное повествование с качественной версткой, иерархией и дизайном.

Улучшение особенно заметно при следовании шаблонам и справочным макетам. GPT‑5.6 способна определять дизайн-систему презентации — макеты, типографику, отступы, цвета и повторяющиеся паттерны контента, включая правила, заложенные в образце слайдов (Slide Master), — и последовательно применять эти правила к новому материалу. В данном примере при попытке обновить цифры на основе справочного файла в выводе GPT‑5.5 отсутствуют ключевые элементы из мастер-слайда, в то время как GPT‑5.6 более точно следует исходной структуре.

Справочный файл
Input slide for GPT-5.6 style matching
Результат GPT‑5.5
GPT-5.5 output slide for style matching
Результат GPT‑5.6
GPT-5.6 output slide for style matching

GPT‑5.6 также создает более визуально выверенные документы и электронные таблицы. Модель точнее следует сложным форматам для справок, что важно для повторяющихся задач в сфере интеллектуального труда. Она с большей точностью обрабатывает уравнения и финансовые модели, а также эффективнее использует типографику, интервалы, иерархию и макеты страниц или рабочих листов.

Первые клиенты, тестировавшие GPT‑5.6, отметили повышение эффективности результатов интеллектуального труда в различных областях.

1 из 9
»GPT‑5.6 отличается заметной эффективностью в долгих и сложных рабочих процессах, стоящих за созданием приложений производственного уровня. Будучи одной из моделей, используемых платформой Lovable, она помогает пользователям, выполняя примерно на 25% меньше шагов и на 35–48% меньше вызовов инструментов по сравнению с предыдущей моделью, при этом повышая успешность проектов и сокращая количество зависших процессов на 15%. Это существенная разница для каждого, кто стремится пройти путь от идеи до работающего приложения.»
— Фабиан Хедин (Fabian Hedin), сооснователь Lovable

Расширение границ в сфере кибербезопасности и науки

GPT‑5.6 — наша самая мощная модель в области кибербезопасности, демонстрирующая передовые результаты при значительно меньшем расходе токенов. В бенчмарке ExploitBench2, оценивающем прогресс от обнаружения уязвимого кода до произвольного выполнения кода, модель набирает 73,5% по сравнению с 47,9% у GPT‑5.5 при сопоставимом бюджете выходных токенов. В бенчмарке ExploitGym3, в котором агентам предлагается превратить реальные уязвимости в работающие эксплойты, она почти вдвое превосходит пиковый показатель успешности GPT‑5.5, поднимая его с 15,1% до 24,9% при двухчасовом лимите, а при лимите в шесть часов этот показатель достигает 33,7%. В SEC-Bench Pro, где проверяется генерация доказательств концепции (PoC) для сложного программного обеспечения, модель показывает результат в 71,2% против 45,8% у GPT‑5.5 при улучшенной задержке. 1

GPT‑5.6 поддерживает важные защитные задачи, такие как безопасный анализ кода, создание патчей, моделирование угроз и действия команды защиты (blue teaming). Квалифицированные специалисты и организации, участвующие в программе OpenAI Daybreak«s Trusted Access for Cyber, могут получить доступ к расширенным возможностям защиты через более точные механизмы контроля для проверенной работы в авторизованных средах, включая триаж и валидацию уязвимостей, анализ вредоносного ПО, проектирование средств обнаружения и проверку патчей.

Частные лица могут подтвердить свою личность и запросить доверенный доступ, а организации — подать заявку для своих команд. Отдельным участникам необходимо включить расширенную безопасность аккаунта с аппаратными ключами доступа (passkeys) до 1 сентября, чтобы сохранить доступ к нашим передовым моделям с наибольшими возможностями в сфере кибербезопасности; те, кто этого не сделает, вернутся к стандартному доступу. Пользователи, у которых еще нет аппаратных ключей доступа, могут получить льготные условия ценообразования от нашего партнера Yubico. Мы также предпринимаем дополнительные шаги по ограничению доступа для высокорисковых юридических лиц и в юрисдикциях с повышенным уровнем риска.

GPT‑5.6 Sol также демонстрирует масштабные улучшения в области научных исследований. В оценках биологических наук GPT‑5.6 показывает улучшения по Парето по сравнению с GPT‑5.5 в реальных биологических задачах, рабочих процессах биомедицинских исследований и химии.

GPT‑5.6 ускоряет работу OpenAI

GPT‑5.6 — наша самая мощная модель для ускорения исследований в области искусственного интеллекта. Внутри OpenAI исследователи используют ее на всех этапах цикла разработки: для диагностики сбоев, оптимизации систем обучения, запуска экспериментов и интерпретации результатов. Мы уже наблюдали такое ускорение и рост уровня внедрения в период внутреннего тестирования GPT‑5.6, когда среднее количество генерируемых за день токенов на одного активного исследователя более чем в два раза превышало максимальный показатель, зафиксированный для GPT‑5.5.

Такой подход к работе быстро становится стандартным. За последние шесть месяцев доля вычислительных ресурсов для исследований, выделяемая на внутренний инференс кода, выросла в 100 раз, в то время как использование токенов внутренними агентами увеличилось примерно в 22 раза. Сами по себе эти метрики внедрения не измеряют прогресс в исследованиях, но они показывают, насколько быстро растет доля ИИ-помощи в исследовательских задачах и в других отделах, таких как продажи, маркетинг, поддержка пользователей, финансы и т. д.

Чтобы напрямую измерить эту способность, мы разработали внутренний набор тестов на основе реальных задач ИИ-исследований, включая отладку исследовательских систем, оптимизацию ядер и рецептов обучения, проведение экспериментов по машинному обучению и улучшение других моделей.

Масштабирование мер безопасности параллельно с ростом возможностей 

По мере расширения возможностей моделей мы укрепляем наш стек безопасности, чтобы передовой интеллект оставался широко полезным и при этом обеспечивал более тщательную проверку сценариев наибольшего риска. Для GPT‑5.6 мы создали нашу самую надежную систему безопасности на сегодняшний день, откалиброванную под возможности каждой модели и работающую на базе беспрецедентного объема вычислительных ресурсов.

Модели GPT‑5.6 превосходят наши предыдущие модели как в биологии, так и в кибербезопасности, однако ни в одной из категорий они не преодолевают критический порог (Critical threshold). В сфере кибербезопасности наше тестирование показывает, что GPT‑5.6 лучше справляется с поиском и устранением уязвимостей, чем с надежным проведением автономных комплексных атак на укрепленные цели, что дает защитникам возможность усилить системы до того, как уязвимости будут использованы. В области биологии тестирование показывает, что GPT‑5.6 может поддерживать легитимные исследования, но не обладает возможностями, необходимыми для создания, проектирования или синтеза высоко опасной новой угрозы.

Обе эти сферы по своей природе имеют двойное назначение. В кибербезопасности те же способности, которые могут помочь злоумышленнику использовать уязвимость, могут помочь защитнику найти ее, воспроизвести и создать надежное исправление. Чрезмерная блокировка создает самостоятельный риск для безопасности: она может помешать защитникам тестировать системы и развертывать патчи, в то время как злоумышленники продолжают использовать другие модели (включая все более мощные модели с открытым исходным кодом), а также традиционные инструменты. Эффективные меры защиты учитывают контекст и вероятные последствия запроса, сохраняя легитимную работу по обеспечению безопасности и применяя более строгие меры контроля там, где есть данные о серьезном риске причинения вреда.

Средства защиты GPT‑5.6 имеют многоуровневую структуру для обеспечения большей точности и избыточности и спроектированы так, чтобы быстро адаптироваться по мере появления новых атак. Встроенные в модель механизмы защиты работают в связке с проверками в реальном времени, непрерывным мониторингом и применением правил на уровне аккаунта, что помогает системе оставаться безопасной, даже если какой-то отдельный уровень работает не так, как задумывалось. Во многих системах решения о блокировке принимаются только на основе классификаторов, опирающихся на менее интеллектуальные модели, которые сложнее изменять для предотвращения вреда. Наш подход добавляет монитор рассуждений (reasoning monitor), который анализирует диалог на предмет потенциального вреда. Такая архитектура призвана разрешать выполнение защитных задач и пресекать серьезные злоумышленники, причем самые чувствительные функции зарезервированы для проверенных пользователей через Trusted Access. Поскольку некоторые защитные механизмы используют рассуждения во время тестирования (test-time reasoning), мы можем оперативно обновлять их для устранения пробелов без переобучения классификаторов с нуля.

Мы придерживаемся более консервативного подхода по мере дальнейшего укрепления системы против адаптивных атак. По сравнению с предыдущими моделями, наши средства кибербезопасности для GPT‑5.6 Sol блокируют примерно в десять раз больше потенциально вредоносной активности. Поскольку эти меры могут создавать неудобства для добросовестного использования, мы предоставляем в ChatGPT и Codex возможность легко повторить запросы на моделях с меньшими возможностями, а также продолжим снижать влияние защитных мер на легитимное использование, сохраняя при этом высокую планку надежности. Это отражает наш подход итеративного развертывания: начинать с консервативных мер и улучшать систему на основе опыта реального использования.

Перед общим запуском мы провели самые интенсивные оценки безопасности за всю историю, включая масштабный ред-теминг (red teaming), тщательное тестирование возможностей и средств защиты с привлечением внешних экспертов, а также около 700 000 часов автоматизированного «черного ящика» ред-теминга в эквиваленте работы графических процессоров NVIDIA A100 Tensor Core GPU. Это позволило нам систематически исследовать вероятные слабые места, выявлять обходы защиты (jailbreaks) и укреплять систему перед релизом.

Идеальной безопасности не существует, и наша работа по защите все более мощных моделей продолжается. Будут обнаружены новые уязвимости, равно как и новые способы обхода защиты, преодолевающие существующие барьеры. Каждое новое поколение моделей также будет открывать новые направления для атак и злоупотреблений. Мы закладываем эту реальность в основу с помощью многоуровневой защиты, непрерывного мониторинга, быстрого устранения уязвимостей и сотрудничества со всем сообществом специалистов по безопасности. Для GPT‑5.6 мы объединили наши существующие программы по поиску уязвимостей в безопасности и биологических баунти-программы с новым процессом быстрого реагирования и нашей самой мощной системой мониторинга на сегодняшний день. Выводы исследователей, данные мониторинга и примеры реальных злоупотреблений будут постоянно использоваться для создания новых тестов и более надежных средств защиты.

Подробнее о наших мерах безопасности читайте в обновленной системной карте GPT‑5.6.

Доступность и цены

GPT‑5.6 включает три уровня моделей: Sol (наш флагман), Terra (более экономичная модель с производительностью, конкурентоспособной с GPT‑5.5) и Luna (наша самая быстрая и доступная модель). Цифра обозначает поколение, в то время как Sol, Terra и Luna являются постоянными уровнями возможностей, которые могут развиваться в собственном темпе.

GPT‑5.6 становится доступна начиная с сегодняшнего дня в ChatGPT, Codex и через OpenAI API. Развертывание начинается по всему миру и будет постепенно продолжаться до полной доступности в течение следующих 24 часов.

  • Чат: пользователи Plus, Pro, Business и Enterprise получают доступ к GPT‑5.6 Sol при настройках среднего и повышенного уровня усилий (effort settings). Пользователи Pro и Enterprise также могут выбрать GPT‑5.6 Sol Pro для получения наилучшего качества результатов в сложных задачах.
  • ChatGPT Work и Codex: пользователи Free и Go получают доступ к GPT‑5.6 Terra. Пользователи Plus, Pro, Business и Enterprise могут выбирать между GPT‑5.6 Sol, Terra и Luna, а также задавать уровень усилий для каждой модели. max доступно всем пользователям с доступом к GPT‑5.6 в ChatGPT Work и Codex, эту функцию можно включить в настройках. В ChatGPT Work функция ultra доступна для пользователей Pro и Enterprise. В Codex она доступна в тарифных планах Plus и выше.
  • API: разработчики могут получить доступ к Sol, Terra и Luna через OpenAI API. В Responses API функция программного вызова инструментов (Programmatic Tool Calling) позволяет GPT‑5.6 писать и запускать программы в оперативной памяти, которые координируют работу инструментов и обрабатывают промежуточные результаты, обеспечивая совместимость с нулевым сохранением данных (Zero Data Retention, ZDR). Многоагентный режим (Multi-agent), изначально доступный в бета-версии, позволяет GPT‑5.6 запускать одновременно работающие субагенты и синтезировать их результаты в рамках одного запроса.

Ценообразование GPT‑5.6 рассчитывается за 1 млн токенов для трех размеров моделей: Sol — $5 за входящие / $30 за исходящие токены; Terra — $2,50 за входящие / $15 за исходящие токены; Luna — $1 за входящие / $6 за исходящие токены. GPT‑5.6 также представляет более предсказуемое кэширование промптов, включая поддержку явных точек останова кэша и минимальное время жизни кэша в 30 минут. Для GPT‑5.6 и последующих моделей запись в кэш тарифицируется по коэффициенту 1,25x от базовой стоимости входящих токенов модели без кэширования, в то время как чтение из кэша продолжает получать 90-процентную скидку на кэшированные входящие данные.

7, 8

Профессиональная деятельность

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
Agents' Last Exam52,7%50,4%50,3%46,9%40,5%45,2%32,1%
GDPval-AA v21 747,8 Elo1 593 Elo1 591,8 Elo1 493,7 Elo1 759,6 Elo1 600,1 Elo962,3 Elo1 348,8 Elo
Задачи управленческого консалтинга (внутренние)43,2%37,2%35,4%31,3%35,5%31,6%13,2%
Big Finance Bench53%51%36%49%44%
Интеллектуальный индекс Artificial Analysis v4.158,9 балла55 баллов51,2 балла54,8 балла59,9 балла55,7 балла46,5 балла50,2 балла

Программирование

ТестGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
Индекс агентов программирования Artificial Analysis v1.180 баллов77,4 балла74,6 балла76,4 балла77,2 балла72,5 балла42,7 балла
SWE-Bench Pro64,6%63,4%62,7%59,4%80,3%77,8%80%69,2%54,2%
DeepSWE v1.172,7%69,6%67,2%67%69,7%59%11,8%
Terminal-Bench 2.188,8%91,9%87,4%84,7%85,6%88%83,1%78,9%70,7%

Наука и здравоохранение

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
GeneBench Pro28,7%23,3%10,8%12%16%3,1%8,14%
LifeSciBench59,9%56%51,2%50,4%53,6%
MedChemBench (внутренний)48,3%35%30,4%35,5%
HealthBench Professional⁶60,5%57,7%55,7%49,5%60,9%53%

Использование компьютера

ТестGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8Gemini 3.1 Pro Preview
OSWorld 2.062,6%50,2%45,6%47,5%54,8%
BrowseComp90,4%92,2%87,5%83,3%84,4%88%87,9%84,3%85,9%
BenchCAD70,6%62,3%63,1%44,4%38,4%35,5%27,3%
BenchCAD (инструмент python)83,4%78,2%73,9%55,8%65%61%51,8%

Кибербезопасность

ТестGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8
Соревнования Capture-the-Flag96,7%91,8%85,2%88,1%
SEC-Bench Pro71,2%74,3%57,7%48,9%45,8%
ExploitBench73,5%52,9%33,2%47,9%78%74,2%40%
ExploitGym33,7%23,2%12,4%15,1%

Самосовершенствование

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5
Внутренняя оценка отладки исследований68,3%67,8%50,8%50%
KernelGen 1P61,1%49,2%22,4%29,3%
NanoGPT9,69%14,5%1,66%2,65%
PostTrainBench Lite50,3%51,5%29,6%38,8%
Индекс RSI57,9%56,3%41,9%41,7%

Мультимодальность

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
MMMU Pro (без инструментов)83%80,7%78,4%81,2%80,5%
MMMU Pro (с инструментами)84,6%82%79,5%83,2%
gdp.pdf30,7%24,7%22,7%26%29,8%22,5%16,7%

Академические тесты

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
GPQA Diamond94,6%92,9%92,3%93,6%94,1%94,6%92,6%92%94,3%
FrontierMath Tier 1–3 (v2)89%84,9%78,6%85,3%87%80%59,6%
FrontierMath Tier 4 (v2)83%68,3%58,5%72,5%87,8%56,1%

Использование инструментов

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash
AutomationBench18.1%15.2%14.9%12.9%17.4%15.5%14.5%
Toolathlon58%53.1%53.4%55.6%61.7%61.1%61.7%59.9%48.8%

Длинный контекст

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8
OpenAI MRCR v2 8-needle 256K-512K91.5%89.6%41.3%81.5%
OpenAI MRCR v2 8-needle 512K-1M73.8%72.5%41.3%74%
GraphWalks BFS 256k f190.7%76.9%81.3%73.7%91.1%85.7%85.9%
GraphWalks BFS 1mil f177.1%71.2%51.2%45.4%79.4%74.3%68.1%

Абстрактные рассуждения

ТестGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Gemini 3.1 Pro Preview
ARC-AGI-3⁷7.78%0.8%0.18%0.43%1.5%0.42%

Автор

OpenAI

Сноски

  1. 1

    Кибеpвозможности оцениваются со сниженными мерами безопасности. Пользователи могут присоединиться к программе OpenAI Daybreak«s Trusted Access for Cyber для получения расширенного доступа к возможностям защиты в киберсфере.

  2. 2

    Все модели оцениваются с использованием тестового набора ExploitBench API с 5 случайными сидами и непрерывностью рассуждений.

  3. 3

    Мы запускали ExploitGym на нашем альфа-API, который выдает ответы быстрее, чем наш публичный API, а затем выполнили пересчет для соответствия публичному API. При пересчете задержек до скоростей, ожидаемых для нашего публичного API, это приводит к тому, что некоторые расчетные задержки превышают двух- и шестичасовые лимиты времени, несмотря на то, что они корректно соблюдались во время оценочного прогона. Для получения более высокой скорости при работе, чувствительной ко времени, мы предлагаем приоритетную обработку⁠ в API и быстрый режим⁠ в Codex.

  4. 4

    Мы оцениваем задержку и стоимость API на основе производственного поведения наших моделей и моделирования в автономном режиме. Эти оценки учитывают детали вызовов инструментов, выбранные токены и входные токены. Реальные результаты могут существенно отличаться и зависят от многих факторов, не учтенных в нашей симуляции. Мы симулируем задержку на высоких скоростях API и стоимость по стандартным расценкам API.

  5. 5

    Модели без указанных выходных токенов, задержки или стоимости отображаются в виде горизонтальных пунктирных линий.

  6. 6

    Для многоагентных систем задержка определяется по корневому агенту, в то время как общие показатели выходных токенов и стоимости API включают все токены. Ultra запускается с 4 агентами.

  7. 7

    Мы вычисляем баллы с помощью официального подхода к оценке, описанного в статье HealthBench Professional, который несравним с результатами, указанными в системных карточках Anthropic.

  8. 8

    Тест ARC-AGI-3 для Opus 4.8 запускался с высоким, а не максимальным уровнем рассуждений, так как это единственный опубликованный результат ARC-AGI-3.

Полный текст статьи читайте на OpenAI