Создание ПО с помощью GPT‑5.1‑Codex‑Max

Rapidash_Blog_SEO_Art_Card_1920x1080.png
$ npm i -g @openai/codex

Введение

Мы представляем GPT‑5.1‑Codex‑Max — нашу новую передовую агентную модель для написания кода, которая уже сегодня доступна в Codex. GPT‑5.1‑Codex‑Max создана на базе обновленной фундаментальной модели рассуждений, обученной для решения задач агентов в области разработки ПО, математики, исследований и других сфер. GPT‑5.1‑Codex‑Max работает быстрее, обладает более высоким уровнем интеллекта и эффективнее расходует токены на каждом этапе цикла разработки, являясь новым шагом на пути к созданию надежного партнера по программированию.

Модель GPT‑5.1‑Codex‑Max разработана для выполнения долгосрочных и детализированных задач. Это наша первая модель, изначально обученная работе с несколькими контекстными окнами посредством процесса, называемого компактированием (compaction), что позволяет ей последовательно обрабатывать миллионы токенов в рамках одной задачи. Это открывает возможности для рефакторинга в масштабах проектов, глубоких сеансов отладки и многочасовых циклов работы агентов.

Модель GPT‑5.1‑Codex‑Max уже сегодня доступна в Codex для использования в интерфейсе командной строки (CLI), расширении IDE, облаке и при проверке кода, а поддержка API появится в ближайшее время.

Передовые возможности программирования

Модель GPT‑5.1‑Codex‑Max была обучена на реальных задачах программной инженерии, таких как создание пулл-реквестов (PR), код-ревью, фронтенд-разработка, а также ответы на вопросы, и превосходит наши предыдущие модели во многих передовых тестах по программированию. Рост производительности модели на бенчмарках также сопровождается улучшениями в реальном использовании: GPT‑5.1‑Codex‑Max — это первая модель, которую мы обучили работать в средах Windows, а ее обучение теперь включает задачи, призванные сделать ее более эффективным соавтором в интерфейсе Codex CLI.

* Все тесты проводились с включенным компактированием при сверхинтенсивном режиме рассуждений (Extra High).
* Тестирование Terminal-Bench2.0 выполнялось с помощью Codex CLI в среде Laude Institute Harbor

Скорость и стоимость

GPT‑5.1‑Codex‑Max демонстрирует значительное улучшение эффективности использования токенов за счет более результативных рассуждений. В бенчмарке SWE-bench Verified модель GPT‑5.1‑Codex‑Max со «средним» (medium) уровнем усилий рассуждения достигает лучших результатов, чем GPT‑5.1‑Codex с тем же уровнем усилий, при этом расходуя на 30% меньше токенов размышления. Для задач, не критичных ко времени отклика, мы также представляем новый сверхинтенсивный режим рассуждений («xhigh»), который думает в течение еще более длительного времени ради получения лучшего ответа. Тем не менее, для большинства задач мы по-прежнему рекомендуем использовать средний режим в качестве основного.

Мы ожидаем, что повышение эффективности токенов обернется реальной экономией для разработчиков.

Например, GPT‑5.1‑Codex‑Max способна создавать высококачественные фронтенд-дизайны с сопоставимым функционалом и эстетикой, но при значительно меньших затратах по сравнению с GPT‑5.1‑Codex.

Долгосрочные задачи

Компактирование позволяет GPT‑5.1‑Codex‑Max выполнять задачи, которые ранее завершались бы неудачей из-за ограничений контекстного окна (например, сложный рефакторинг и длительные циклы работы агента), путем сокращения истории и сохранения наиболее важного контекста на протяжении долгого времени. В приложениях Codex модель GPT‑5.1‑Codex‑Max автоматически компактирует свою сессию при приближении к лимиту контекстного окна, предоставляя ей новое контекстное окно. Этот процесс повторяется до тех пор, пока задача не будет выполнена.

Способность поддерживать согласованную работу на протяжении долгого времени — это фундаментальная возможность на пути к созданию более универсальных и надежных систем ИИ. GPT‑5.1‑Codex‑Max может работать автономно в течение многих часов. В ходе внутренних оценок мы наблюдали, как GPT‑5.1‑Codex‑Max выполняла задачи более 24 часов подряд. Она настойчиво итеративно совершенствует свою реализацию, исправляет ошибки в тестах и в конечном итоге добивается успешного результата.

В этом примере GPT‑5.1‑Codex‑Max самостоятельно выполняет рефакторинг репозитория с открытым исходным кодом Codex CLI.

По мере того как длина сеанса приближается к размеру контекстного окна модели, она автоматически сжимает сеанс, чтобы освободить место для продолжения работы над задачей без потери прогресса.

Видео было обрезано и ускорено для наглядности.

Создание безопасных и надежных ИИ-агентов

GPT‑5.1‑Codex‑Max демонстрирует значительно лучшие результаты в тестах, требующих непрерывных рассуждений на длинных дистанциях. Поскольку она может согласованно работать с несколькими контекстными окнами благодаря компактированию, модель обеспечивает улучшенные результаты при решении задач в таких областях, как долгосрочное программирование и кибербезопасность. Мы проанализировали результаты производительности этой модели по результатам внутренних и сторонних оценок в системной карте GPT‑5.1‑Codex‑Max.

GPT‑5.1‑Codex‑Max не достигает высокого уровня возможностей (High capability) в области кибербезопасности согласно нашей структуре готовности (Preparedness Framework), однако это наиболее способная модель в сфере кибербезопасности из всех, что мы развертывали на сегодняшний день, при этом агентные возможности в кибербезопасности стремительно развиваются. В результате мы принимаем меры по подготовке к достижению высокого уровня возможностей в области кибербезопасности, совершенствуем наши средства защиты в кибердомене и работаем над тем, чтобы защитники могли воспользоваться этими улучшенными возможностями с помощью таких программ, как Aardvark.

Когда мы запустили GPT‑5‑Codex, мы внедрили специализированный мониторинг кибербезопасности для обнаружения и пресечения вредоносной активности. Хотя мы не наблюдаем значительного роста масштабных злоупотреблений, мы готовим дополнительные средства смягчения для продвинутых возможностей. Наши команды уже пресекали кибероперации, пытавшиеся неправомерно использовать наши модели, а подозрительная активность направляется на рассмотрение через наши системы мониторинга политик.

Codex по умолчанию настроен на работу в безопасной «песочнице»: запись файлов ограничена его рабочей областью, а сетевой доступ отключен, если разработчик не включит его вручную. Мы рекомендуем оставлять Codex в этом режиме с ограниченным доступом, так как включение интернета или веб-поиска может создавать риски промпт-инъекций (prompt-injection) из ненадежного контента.

По мере того как Codex приобретает все больше возможностей для выполнения долгосрочных задач, разработчикам становится все важнее проверять работу агента перед внесением изменений или развертыванием в продакшн. Чтобы помочь в этом, Codex формирует журналы терминала и ссылается на вызовы своих инструментов и результаты тестов. Хотя код-ревью снижают риск развертывания багов (произведенных как моделью, так и человеком) в продакшн, Codex следует рассматривать как дополнительного проверяющего, а не как замену человеческому ревью.

Возможности кибербезопасности могут использоваться как для защиты, так и для нападения, поэтому мы применяем подход итеративного развертывания: учимся на реальном опыте использования, обновляем средства защиты и сохраняем важные защитные инструменты, такие как автоматическое сканирование уязвимостей и помощь в их устранении.

Доступность

Модель GPT‑5.1‑Codex‑Max доступна в Codex в рамках планов ChatGPT Plus, Pro, Business, Edu и Enterprise. Подробную информацию о том, как работают лимиты использования для вашего тарифа, можно найти в нашей документации.

Для разработчиков, использующих Codex CLI через API-ключ, мы планируем сделать GPT‑5.1‑Codex‑Max доступной через API в ближайшее время.

Начиная с сегодняшнего дня, GPT‑5.1‑Codex‑Max заменит GPT‑5.1‑Codex в качестве модели по умолчанию в интерфейсах Codex. В отличие от GPT‑5.1, которая является универсальной моделью, мы рекомендуем использовать GPT‑5.1‑Codex‑Max и семейство моделей Codex исключительно для задач агентного программирования в Codex или аналогичных средах.

Заключение

GPT‑5.1‑Codex‑Max демонстрирует, насколько далеко продвинулись модели в решении долгосрочных задач по программированию, управлении сложными рабочими процессами и создании высококачественных реализаций с гораздо меньшим количеством токенов. Мы видим, что сочетание этой модели с постоянными обновлениями нашего CLI, расширения IDE, облачной интеграции и инструментов проверки кода приводит к многократному росту инженерной производительности: внутри компании 95% инженеров OpenAI используют Codex еженедельно, и после внедрения Codex эти инженеры выпускают примерно на 70% больше пулл-реквестов. Раздвигая границы возможностей агентов, мы с нетерпением ждем того, что вы сможете создать с их помощью.

Приложение: Оценки моделей

GPT‑5.1‑Codex (high)

GPT‑5.1‑Codex‑Max (xhigh)

SWE-bench Verified (n=500)

73.7%

77.9%

SWE-Lancer IC SWE

66.3%

79.9%

Terminal-Bench 2.0

52.8%

58.1%

Автор

OpenAI

Полный текст статьи читайте на OpenAI