Представляем GPT‑5.3‑Codex

Расширение возможностей Codex на весь спектр профессиональной работы за компьютером.
Мы представляем новую модель, которая раскрывает еще больше возможностей Codex: GPT‑5.3‑Codex, самую совершенную модель для автономного написания кода на сегодняшний день. Модель объединяет в себе передовые показатели производительности программирования GPT‑5.2‑Codex, а также возможности рассуждения и профессиональных знаний GPT‑5.2, причем работает на 25% быстрее. Это позволяет ей справляться с долгосрочными задачами, требующими проведения исследований, использования инструментов и сложного выполнения. Подобно коллеге, вы можете направлять GPT‑5.3‑Codex и взаимодействовать с ней в процессе работы без потери контекста.
GPT‑5.3‑Codex — наша первая модель, которая сыграла ключевую роль в собственном создании. Команда разработчиков Codex использовала ранние версии для отладки собственного обучения, управления развертыванием, а также для анализа результатов тестирования и оценок — наша команда была поражена тем, насколько сильно Codex смогла ускорить собственную разработку.
С появлением GPT‑5.3‑Codex платформа Codex превращается из агента, способного писать и рецензировать код, в агента, способного выполнять практически любые задачи, которые разработчики и профессионалы могут решить за компьютером.
Передовые возможности агентов
GPT‑5.3‑Codex устанавливает новые отраслевые рекорды на бенчмарках SWE-Bench Pro и Terminal-Bench, а также демонстрирует высокие результаты на OSWorld и GDPval — четырех бенчмарках, которые мы используем для оценки навыков программирования, работы агентов и решения реальных задач.
Программирование
GPT‑5.3‑Codex достигает передовых результатов в SWE-Bench Pro — строгом тесте для оценки задач реальной программной инженерии. Если SWE‑bench Verified тестирует только Python, то SWE‑Bench Pro охватывает четыре языка программирования и является более устойчивым к утечкам данных, сложным, разнообразным и актуальным для индустрии. Она также значительно превосходит предыдущие лучшие результаты на Terminal-Bench 2.0, измеряющем навыки работы с терминалом, необходимые для такого агента программирования, как Codex. Примечательно, что GPT‑5.3‑Codex добивается этого, используя меньше токенов, чем любая предыдущая модель, что позволяет пользователям создавать еще больше.
Веб-разработка
Сочетание передовых возможностей написания кода, улучшенной эстетики и компрессии данных позволяет создать модель, способную выполнять впечатляющую работу и создавать высокофункциональные сложные игры и приложения с нуля в течение нескольких дней. Чтобы протестировать веб-разработку и долгосрочные автономные возможности модели, мы попросили GPT‑5.3‑Codex создать две игры: вторую версию гоночной игры из запуска приложения Codex и игру про дайвинг. Используя навык разработки веб-игр и предварительно выбранные общие последующие запросы вроде «исправь баг» или «улучши игру», GPT‑5.3‑Codex автономно дорабатывала игры на протяжении миллионов токенов. Посмотрите трейлеры и сыграйте в игры сами, чтобы оценить возможности Codex.
Гоночная игра с различными гонщиками, восемью картами и даже предметами, используемыми по нажатию клавиши пробела. Поиграйте в нее здесь!
Игра о дайвинге, в которой вы исследуете различные рифы, собираете их все, чтобы заполнить свой кодекс рыб, и при этом следите за запасом кислорода, давлением и опасностями. Поиграйте в нее здесь!
GPT‑5.3‑Codex также лучше понимает ваши намерения при создании повседневных веб-сайтов по сравнению с GPT‑5.2‑Codex. Простые или недостаточно конкретные запросы теперь по умолчанию создают сайты с большим функционалом и разумными настройками по умолчанию, предоставляя вам более надежную отправную точку для воплощения ваших идей в жизнь.
Например, мы попросили GPT‑5.3‑Codex и GPT‑5.2‑Codex создать два нижеприведенных лендинга. GPT‑5.3‑Codex автоматически отобразила годовой тарифный план в виде сниженной месячной стоимости, сделав скидку понятной и обоснованной, а не просто умножив годовую сумму. Она также создала автоматически сменяющуюся карусель отзывов с тремя уникальными цитатами пользователей вместо одной, в результате чего страница изначально выглядит более завершенной и готовой к продакшену.
За пределами написания кода
Инженеры-программисты, дизайнеры, продакт-менеджеры и специалисты по работе с данными делают гораздо больше, чем просто пишут код. GPT‑5.3‑Codex создана для поддержки всех этапов жизненного цикла программного обеспечения — отладки, развертывания, мониторинга, написания PRD (требований к продукту), редактирования текстов, пользовательских исследований, тестирования, работы с метриками и многого другого. Ее агентские возможности выходят за рамки программного обеспечения, помогая вам создавать все, что вы захотите — будь то презентации или анализ данных в таблицах.
Обладая специализированными навыками, аналогичными тем, что использовались для наших предыдущих результатов GDPval, модель GPT‑5.3‑Codex также демонстрирует высокие показатели в профессиональной интеллектуальной работе, измеряемые с помощью GDPval, не уступая GPT‑5.2. GDPval — это тест, представленный OpenAI в 2025 году, который оценивает производительность модели при выполнении четко сформулированных задач интеллектуального труда в 44 профессиях. К таким задачам относятся создание презентаций, электронных таблиц и других рабочих продуктов.
Ниже приведены несколько примеров работы, созданной агентом.
OSWorld — это бенчмарк для оценки использования компьютера агентами, в котором агент должен выполнять задачи по повышению производительности в визуальной среде настольного компьютера. GPT‑5.3‑Codex демонстрирует значительно более мощные возможности использования компьютера по сравнению с предыдущими моделями GPT.
В OSWorld-Verified модели используют компьютерное зрение для выполнения различных компьютерных задач. Результат людей составляет ~72%.
В совокупности эти результаты в области программирования, фронтенда, использования компьютера и реальных задач показывают, что GPT‑5.3‑Codex не просто лучше справляется с отдельными задачами, но знаменует собой качественный скачок в сторону создания единого универсального агента, способного рассуждать, создавать и выполнять работу во всем спектре реальных технических задач.
Интерактивный помощник
По мере того как возможности моделей становятся все мощнее, фокус смещается с того, на что способны агенты, на то, насколько легко люди могут взаимодействовать, управлять и контролировать множество таких агентов, работающих параллельно. Приложение Codex делает управление агентами гораздо проще, а с появлением GPT‑5.3‑Codex этот процесс стал еще более интерактивным. Новая модель предоставляет частые обновления, чтобы вы были в курсе ключевых решений и прогресса по мере выполнения работы. Вместо того чтобы ждать финального результата, вы можете взаимодействовать в режиме реального времени — задавать вопросы, обсуждать подходы и направлять процесс к решению. GPT‑5.3‑Codex проговаривает свои действия, реагирует на отзывы и держит вас в курсе от начала и до конца.
Включите управление моделью во время ее работы в приложении через Настройки > Основные > Поведение при последующих запросах (Settings > General > Follow-up behavior).
Как мы использовали Codex для обучения и развертывания GPT‑5.3‑Codex
Недавнее стремительное усовершенствование Codex опирается на результаты исследовательских проектов, длившихся месяцами или годами по всей компании OpenAI. Эти исследовательские проекты ускоряются с помощью Codex: многие исследователи и инженеры в OpenAI описывают свою сегодняшнюю работу как кардинально отличающуюся от того, какой она была всего два месяца назад. Даже ранние версии GPT‑5.3‑Codex продемонстрировали исключительные возможности, позволив нашей команде работать с ними для улучшения процесса обучения и поддержки развертывания последующих версий.
Codex полезна для очень широкого спектра задач, из-за чего трудно полностью перечислить все способы, которыми она помогает нашим командам. В качестве примеров можно привести то, что исследовательская команда использовала Codex для мониторинга и отладки процесса обучения для этого релиза. Модель ускорила исследования не только за счет устранения проблем с инфраструктурой: она помогла отслеживать закономерности в ходе обучения, предоставила глубокий анализ качества взаимодействия, предложила исправления и создала удобные приложения, позволившие исследователям-людям точно понять, чем поведение модели отличается от предыдущих версий.
Инженерная команда использовала Codex для оптимизации и адаптации среды для GPT‑5.3‑Codex. Когда мы начали замечать странные граничные случаи, влияющие на пользователей, члены команды использовали Codex для выявления багов рендеринга контекста и поиска первопричин низкой частоты попаданий в кэш. GPT‑5.3‑Codex продолжает помогать команде на протяжении всего запуска, динамически масштабируя кластеры графических процессоров для адаптации к всплескам трафика и поддерживая стабильную задержку.
В ходе альфа-тестирования один из исследователей захотел выяснить, какой объем дополнительной работы GPT‑5.3‑Codex выполняла за один цикл взаимодействия и как это отражалось на росте производительности. GPT‑5.3‑Codex предложила несколько простых регулярных классификаторов для оценки частоты уточнений, положительных и отрицательных ответов пользователей, а также прогресса в выполнении задач, после чего масштабируемо прогнала их по всем логам сеансов и подготовила отчет со своими выводами. Пользователи, работающие с Codex, были более довольны, так как агент лучше понимал их намерения и быстрее продвигался за один цикл, задавая меньше уточняющих вопросов.
Поскольку GPT‑5.3‑Codex сильно отличается от своих предшественников, данные альфа-тестирования продемонстрировали множество необычных и контринтуитивных результатов. Специалист по данным в команде работал с GPT‑5.3‑Codex над созданием новых конвейеров данных и визуализацией результатов гораздо нагляднее, чем позволяли наши стандартные инструменты создания дашбордов. Результаты анализировались совместно с Codex, которая менее чем за три минуты лаконично обобщила ключевые инсайты по тысячам точек данных.
Каждая из этих задач по отдельности представляет собой интересный пример того, как Codex может помочь исследователям и разработчикам продуктов. В совокупности мы обнаружили, что эти новые возможности привели к мощному ускорению работы наших исследовательских, инженерных и продуктовых команд.
Обеспечение кибербезопасности
В последние месяцы мы наблюдаем значительный рост производительности моделей в задачах кибербезопасности, что приносит пользу как разработчикам, так и специалистам по безопасности. Параллельно мы занимаемся подготовкой усиленных средств защиты в сфере кибербезопасности для поддержки защитного использования и повышения общей устойчивости экосистемы.
GPT‑5.3‑Codex — это первая модель, которую мы классифицируем как высокопроизводительную для задач, связанных с кибербезопасностью, в рамках нашей Методологии обеспечения готовности (Preparedness Framework), и первая модель, которую мы напрямую обучили выявлению уязвимостей в ПО. Хотя у нас нет окончательных доказательств того, что она способна полностью автоматизировать кибератаки от начала до конца, мы придерживаемся профилактического подхода и развертываем наш самый комплексный набор мер безопасности в области кибербезопасности на сегодняшний день. Наши меры по снижению рисков включают обучение безопасности, автоматизированный мониторинг, доверенный доступ к передовым возможностям и конвейеры обеспечения соблюдения норм, включая аналитику угроз.
Поскольку кибербезопасность по своей природе имеет двойное назначение, мы применяем основанный на фактах и итеративный подход, который ускоряет способность защитников находить и устранять уязвимости, одновременно препятствуя их злонамеренному использованию. В рамках этого мы запускаем пилотную программу Доверенный доступ для кибербезопасности (Trusted Access for Cyber), призванную ускорить исследования в области киберзащиты.
Чтобы предотвратить злоупотребления, некоторые запросы, в которых наши системы обнаруживают повышенный киберриск, могут автоматически перенаправляться с GPT‑5.3‑Codex на GPT‑5.2. Мы продолжаем совершенствовать эти защитные механизмы. Разработчики, проводящие исследования в области безопасности или считающие, что их запросы были ошибочно классифицированы, могут подать заявку на полный доступ через нашу программу Trusted Access for Cyber или сообщить о проблеме с помощью команды /feedback.
Мы инвестируем в средства защиты экосистемы, такие как расширение закрытой бета-версии Aardvark — нашего агента для исследований в области безопасности, который стал первым продуктом в линейке наших инструментов и продуктов безопасности Codex, а также сотрудничаем с разработчиками открытого исходного кода для предоставления бесплатного сканирования кодовой базы для широко используемых проектов, таких как Next.js, где исследователь безопасности использовал Codex для обнаружения уязвимостей, о которых стало известно на прошлой неделе.
Опираясь на нашу программу грантов на кибербезопасность в размере 1 миллиона долларов, запущенную в 2023 году, мы также выделяем 10 миллионов долларов в виде кредитов API для ускорения киберзащиты с помощью наших самых мощных моделей, особенно для систем с открытым исходнымходом и критической инфраструктуры. Организации, занимающиеся добросовестными исследованиями в области безопасности, могут подать заявку на получение кредитов API и поддержки через нашу программу грантов на кибербезопасность.
Доступность и детали
GPT‑5.3‑Codex доступен в рамках платных тарифов ChatGPT везде, где вы можете использовать Codex: в приложении, интерфейсе командной строки (CLI), расширении для IDE и в веб-версии. Мы работаем над тем, чтобы в скором времени безопасно открыть доступ к API.
Благодаря этому обновлению мы также ускорили работу GPT‑5.3‑Codex для пользователей Codex на 25% благодаря усовершенствованиям нашей инфраструктуры и стека инференса, что привело к более быстрому взаимодействию и получению результатов.
Модель GPT‑5.3‑Codex была совместно спроектирована, обучена и развернута на системах NVIDIA GB200 NVL72. Мы признательны NVIDIA за партнерство.
Что дальше
С выходом GPT‑5.3‑Codex инструмент Codex выходит за рамки простого написания кода, превращаясь в средство управления компьютером и выполнения работы от начала и до конца. Раздвигая границы возможностей агента по написанию кода, мы также открываем путь к более широкому спектру интеллектуальных задач — от создания и развертывания программного обеспечения до исследований, анализа и выполнения сложных поручений. То, что начиналось как стремление создать лучшего агента для программирования, стало основой для более универсального помощника за компьютером, расширяющего круг тех, кто может создавать продукт, и возможности самого Codex.
Приложение
GPT‑5.3‑Codex (xhigh) | GPT‑5.2‑Codex (xhigh) | GPT‑5.2 (xhigh) | |
SWE-Bench Pro (Public) | 56.8% | 56.4% | 55.6% |
Terminal-Bench 2.0 | 77.3% | 64.0% | 62.2% |
OSWorld-Verified | 64.7% | 38.2% | 37.9% |
GDPval (победы или ничьи) | 70.9% | - | 70.9% (high) |
Cybersecurity Capture The Flag Challenges | 77.6% | 67.4% | 67.7% |
SWE-Lancer IC Diamond | 81.4% | 76.0% | 74.6% |
Автор
Сноска
Все оценки в блоге были получены на модели GPT-5.3-Codex с уровнем рассуждения xhigh.
Полный текст статьи читайте на OpenAI
