Представляем GPT‑4.1 в API
Новая серия моделей GPT с серьезными улучшениями в написании кода, следовании инструкциям и работе с длинным контекстом —, а также наша первая нано-модель.
Сегодня мы запускаем три новые модели в API: GPT‑4.1, GPT‑4.1 mini и GPT‑4.1 nano. Эти модели превосходят GPT‑4o и GPT‑4o mini по всем направлениям, демонстрируя значительный прирост в написании кода и следовании инструкциям. Они также обладают увеличенным контекстным окном (поддерживающим до 1 миллиона токенов контекста) и способны лучше использовать этот контекст благодаря улучшенному пониманию длинных текстов. Кроме того, в них обновлена база знаний по июнь 2024 года.
GPT‑4.1 превосходит аналоги по следующим отраслевым стандартным метрикам:
- Написание кода: GPT‑4.1 набирает 54,6% в тесте SWE-bench Verified, демонстрируя прирост на 21,4%абс. по сравнению с GPT‑4o и на 26,6%абс. по сравнению с GPT‑4.5, что делает ее ведущей моделью для программирования.
- Следование инструкциям: В бенчмарке Scale«s MultiChallenge, оценивающем способность следовать инструкциям, GPT‑4.1 набирает 38,3%, что на 10,5%абс. выше результата GPT‑4o.
- Длинный контекст: В Video-MME, бенчмарке для мультимодального понимания длинного контекста, GPT‑4.1 устанавливает новый рекорд — 72,0% в категории длинных видео без субтитров, что на 6,7%абс. превосходит показатели GPT‑4o.
Хотя бенчмарки дают ценные ориентиры, мы обучали эти модели с акцентом на практическую пользу в реальных условиях. Тесное сотрудничество и партнерство с сообществом разработчиков позволили нам оптимизировать эти модели для задач, которые наиболее важны в их приложениях.
В результате семейство моделей GPT‑4.1 предлагает исключительную производительность при более низкой стоимости. Эти модели выводят производительность на новый уровень в любой точке графика задержки.
GPT‑4.1 mini представляет собой значительный шаг вперед в производительности малых моделей, превосходя даже GPT‑4o во многих бенчмарках. Она соответствует или превосходит GPT‑4o по показателям интеллектуальных тестов, сокращая при этом задержку почти вдвое и снижая стоимость на 83%.
Для задач, требующих минимальной задержки, мы предлагаем GPT‑4.1 nano — нашу самую быстрые и дешевую модель. Она обеспечивает исключительную производительность при компактном размере, поддерживая контекстное окно в 1 миллион токенов, и набирает 80,1% в MMLU, 50,3% в GPQA и 9,8% в полиглотом программировании Aider, что даже выше показателей GPT‑4o mini. Она идеально подходит для таких задач, как классификация или автодополнение.
Эти улучшения в надежности следования инструкциям и понимании длинного контекста также делают модели GPT‑4.1 значительно более эффективными для работы в качестве агентов или систем, способных самостоятельно выполнять задачи от имени пользователей. В сочетании с такими примитивами, как Responses API, разработчики теперь могут создавать агентов, которые более эффективны и надежны в задачах реальной разработки ПО, извлечения инсайтов из крупных документов, решения клиентских запросов с минимальным участием человека и других сложных задачах.
Обратите внимание, что GPT‑4.1 будет доступна исключительно через API. В ChatGPT многие улучшения в следовании инструкциям, написании кода и интеллектуальных возможностях были постепенно интегрированы в последнюю версию GPT‑4o, и мы продолжим внедрять новые функции в будущих релизах.
Мы также начинаем вывод из эксплуатации GPT‑4.5 Preview в API, поскольку GPT‑4.1 предлагает улучшенную или сопоставимую производительность по многим ключевым возможностям при значительно меньшей стоимости и задержке. GPT‑4.5 Preview будет отключена через три месяца, 14 июля 2025 года, чтобы дать разработчикам время на переход. Модель GPT‑4.5 была представлена в качестве исследовательской предварительной версии для изучения крупномасштабной ресурсоемкой модели, и мы извлекли много полезного из отзывов разработчиков. Мы продолжим переносить творческий потенциал, качество письма, юмор и нюансы, которые вы оценили в GPT‑4.5, в будущие модели API.
Ниже мы подробно рассказываем о том, как GPT‑4.1 показывает себя в различных бенчмарках, а также приводим примеры от альфа-тестеров, таких как Windsurf, Qodo, Hex, Blue J, Thomson Reuters и Carlyle, демонстрирующие ее работу в продакшене для специализированных задач.
Программирование
GPT‑4.1 значительно превосходит GPT‑4o в самых разных задачах программирования, включая автономное решение задач кодинга, разработку интерфейсов, создание меньшего количества лишних правок, точное следование форматам diff, обеспечение стабильного использования инструментов и многое другое.
В бенчмарке SWE-bench Verified, оценивающем навыки программной инженерии в реальных условиях, GPT‑4.1 успешно справляется с 54,6% задач по сравнению с 33,2% у GPT‑4o (по состоянию на 20.11.2024). Это отражает улучшение способности модели исследовать репозиторий кода, завершать задачу и создавать код, который успешно запускается и проходит тесты.
В бенчмарке SWE-bench Verified модели предоставляется репозиторий кода и описание проблемы, после чего она должна сгенерировать патч для ее решения. Производительность напрямую зависит от используемых промптов и инструментов. Чтобы помочь воспроизвести и понять наши результаты, мы описали нашу настройку для GPT‑4.1 здесь. Наши результаты не включают 23 из 500 задач, решения которых не смогли запуститься на нашей инфраструктуре; если оценить их консервативно как 0, результат в 54,6% составит 52,1%.
Для API-разработчиков, работающих с редактированием крупных файлов, GPT‑4.1 демонстрирует гораздо большую надежность при создании diff-файлов кода в самых разных форматах. GPT‑4.1 более чем в два раза превосходит результат GPT‑4o в полиглотом бенчмарке diff-файлов от Aider и даже обходит GPT‑4.5 на 8%абс.Эта оценка является одновременно мерой возможностей программирования на различных языках и мерой способности модели производить изменения в полном формате и в формате diff. Мы специально обучили GPT‑4.1 более надежно следовать форматам diff, что позволяет разработчикам экономить затраты и время отклика, заставляя модель выводить только измененные строки, а не переписывать файл целиком. Для достижения наилучшей производительности при создании diff-файлов ознакомьтесь с нашим руководством по составлению промптов. Для разработчиков, предпочитающих перезапись файлов целиком, мы увеличили лимит токенов вывода для GPT‑4.1 до 32 768 токенов (по сравнению с 16 384 токенами у GPT‑4o). Мы также рекомендуем использовать прогнозируемые выводы (Predicted Outputs), чтобы снизить задержку при полном перезаписывании файлов.
В полиглотом бенчмарке Aider модели решают задачи по программированию из Exercism путем редактирования исходных файлов с разрешением на одну попытку повтора. Полный формат («whole») требует от модели перезаписи всего файла, что может быть медленным и затратным. Формат diff («diff») требует от модели написания серии блоков поиска и замены.
GPT‑4.1 также существенно превосходит GPT‑4o в фронтенд-разработке и способен создавать более функциональные и эстетичные веб-приложения. В наших прямых сравнениях платные эксперты-оценщики отдавали предпочтение сайтам GPT‑4.1 в 80% случаев по сравнению с сайтами на базе GPT‑4o.
Промпт: Создайте веб-приложение для карточек с заданиями (flashcards). Пользователь должен иметь возможность создавать карточки, искать среди существующих карточек, просматривать их и видеть статистику по просмотренным карточкам. Предварительно загрузите десять карточек, содержащих слово или фразу на хинди и их перевод на английский язык. Интерфейс просмотра: в интерфейсе просмотра клик или нажатие клавиши «Пробел» должны переворачивать карточку с плавной 3D-анимацией, показывая перевод. Нажатие клавиш со стрелками должно осуществлять навигацию между карточками. Интерфейс поиска: строка поиска должна динамически выдавать список результатов по мере ввода запроса пользователем. Интерфейс статистики: на странице статистики должен отображаться график количества просмотренных пользователем карточек и процент правильных ответов. Интерфейс создания карточек: страница создания карточек должна позволять пользователю указывать лицевую и обратную стороны карточки и добавлять ее в коллекцию пользователя. Каждый из этих интерфейсов должен быть доступен на боковой панели. Сгенерируйте одностраничное приложение на React (все стили инлайновые).
GPT‑4o
GPT‑4.1
Помимо описанных выше бенчмарков, GPT‑4.1 лучше и стабильнее следует форматам и реже допускает лишние правки. По результатам наших внутренних оценок, количество посторонних правок в коде снизилось с 9% у GPT‑4o до 2% у GPT‑4.1.
Примеры из реального мира
Windsurf: GPT‑4.1 набирает на 60% больше баллов, чем GPT‑4o, в внутреннем бенчмарке программирования Windsurf, что тесно коррелирует с тем, как часто изменения кода принимаются при первом же ревью. Их пользователи отметили, что модель на 30% эффективнее вызывает инструменты и примерно на 50% реже повторяет ненужные правки или считывает код излишне узкими, пошаговыми порциями. Эти улучшения обеспечивают более быстрые итерации и плавные рабочие процессы для инженерных команд.
Qodo: Qodo протестировала GPT‑4.1 в сравнении с другими ведущими моделями при генерации высококачественных ревью кода из пулл-реквестов GitHub, используя методологию, вдохновленную их бенчмарком тонкой настройки (fine-tuning). Проанализировав 200 значимых реальных пулл-реквестов при одинаковых промптах и условиях, они выяснили, что GPT‑4.1 выдавала лучшие предложения в 55% случаев. Примечательно, что GPT‑4.1 преуспевает как в точности (понимая, когда не стоит вносить предложения), так и в полноте (обеспечивая тщательный анализ, когда это необходимо), сохраняя при этом фокус на действительно критических проблемах.
Следование инструкциям
GPT‑4.1 следует инструкциям значительно надежнее, и мы зафиксировали существенные улучшения в самых разных тестах на следование инструкциям.
Мы разработали внутренний бенчмарк для оценки следования инструкциям, чтобы отслеживать производительность модели по ряду параметров и в нескольких ключевых категориях, включая:
- Следование формату. Предоставление инструкций, определяющих пользовательский формат для ответа модели, такой как XML, YAML, Markdown и т. д.
- Запрещающие инструкции. Указание поведения, которого модель должна избегать. (Пример: «Не просите пользователя обращаться в службу поддержки»).
- Упорядоченные инструкции. Предоставление набора инструкций, которым модель должна следовать в определенном порядке. (Пример: «Сначала спросите имя пользователя, затем его электронную почту»).
- Требования к контенту. Вывод контента, содержащего определенную информацию. (Пример: «Всегда указывайте количество белка при составлении плана питания»).
- Ранжирование. Упорядочивание результатов определенным образом. (Пример: «Отсортируйте ответ по численности населения»).
- Избыточная уверенность. Указание модели отвечать «Я не знаю» или аналогичным образом, если запрашиваемая информация недоступна или запрос не попадает в заданную категорию. (Пример: «Если вы не знаете ответа, укажите адрес электронной почты службы поддержки»).
Эти категории стали результатом отзывов разработчиков о том, какие аспекты следования инструкциям являются для них наиболее актуальными и важными. Внутри каждой категории мы разделили промпты на простые, средние и сложные. GPT‑4.1 демонстрирует значительный прогресс по сравнению с GPT‑4o, особенно на сложных промптах.
Наш внутренний тест на следование инструкциям основан на реальных сценариях использования и отзывах разработчиков и охватывает задачи разной сложности в сочетании с инструкциями по форматированию, многословию, длине и т. д.
Следование инструкциям в многошаговых диалогах имеет решающее значение для многих разработчиков: модели важно сохранять логическую связность на протяжении долгой беседы и отслеживать то, о чем пользователь сообщал ранее. Мы обучили GPT‑4.1 лучше извлекать информацию из прошлых сообщений в диалоге, что делает общение более естественным. Бенчмарк MultiChallenge от Scale является полезным инструментом для оценки этой возможности, и в нем GPT‑4.1 показывает результат на 10,5%abs лучше, чем GPT‑4o.
В MultiChallenge модели проверяются на способность правильно использовать четыре типа информации из предыдущих сообщений в многошаговых диалогах.
GPT‑4.1 также набирает 87,4% в IFEval по сравнению с 81,0% у GPT‑4o. В IFEval используются промпты с проверяемыми инструкциями (например, указание длины контента или избежание определенных терминов и форматов).
В IFEval модели должны генерировать ответы, соответствующие различным инструкциям.
Более качественное следование инструкциям повышает надежность существующих приложений и открывает возможности для новых, ранее ограниченных недостаточной надежностью. Ранние тестировщики отметили, что GPT‑4.1 может быть более буквальным, поэтому мы рекомендуем формулировать промпты предельно четко и конкретно. Подробнее о передовых методах составления промптов для GPT‑4.1 см. в руководстве по промптингу.
Примеры из реального мира
Blue J: GPT‑4.1 оказалась на 53% точнее GPT‑4o на внутреннем бенчмарке Blue J, состоящем из наиболее сложных реальных налоговых сценариев. Такой скачок в точности, имеющий ключевое значение как для производительности системы, так и для удовлетворенности пользователей, подчеркивает улучшенное понимание сложных нормативных актов моделью GPT‑4.1 и ее способность следовать тонким инструкциям в условиях длинного контекста. Для пользователей Blue J это означает более быстрые и надежные налоговые исследования и больше времени для высококлассной консультационной работы.
Hex: GPT‑4.1 продемонстрировала почти двукратное улучшение на самом сложном наборе тестов SQL от Hex, продемонстрировав значительный прирост в следовании инструкциям и семантическом понимании. Модель оказалась надежнее при выборе правильных таблиц из больших и неоднозначных схем — это критическая точка принятия решений на раннем этапе, которая напрямую влияет на общую точность и которую трудно настроить только с помощью промптов. Для Hex это привело к измеримому сокращению объема ручной отладки и более быстрому переходу к рабочим процессам производственного уровня.
Длинный контекст
GPT‑4.1, GPT‑4.1 mini и GPT‑4.1 nano могут обрабатывать до 1 миллиона токенов контекста — по сравнению со 128 000 у предыдущих моделей GPT‑4o. 1 миллион токенов — это более 8 копий всей кодовой базы React, поэтому длинный контекст отлично подходит для обработки крупных кодовых баз или больших объемов длинных документов.
Мы обучили GPT‑4.1 надежно удерживать в фокусе информацию во всем диапазоне контекста длиной в 1 миллион токенов. Мы также сделали модель гораздо более эффективной по сравнению с GPT‑4o в обнаружении релевантного текста и игнорировании отвлекающих факторов как при большой, так и при малой длине контекста. Понимание длинного контекста — важнейшая способность для приложений в сфере права, программирования, службы поддержки и во многих других областях.
Ниже мы демонстрируем способность GPT‑4.1 находить небольшую скрытую частицу информации («иголку»), расположенную в различных точках контекстного окна. GPT‑4.1 стабильно и точно находит иголку в любых позициях и при любой длине контекста, вплоть до 1 миллиона токенов. Модель эффективно извлекает нужные детали для текущей задачи независимо от их позиции во входных данных.
В нашей внутренней оценке «иголка в стоге сена» GPT‑4.1, GPT‑4.1 mini и GPT 4.1 nano способны находить иголку в любых позициях контекста объемом до 1M.
Однако немногие задачи из реального мира столь же просты, как извлечение одного очевидного ответа-«иголки». Мы видим, что пользователям часто требуется, чтобы наши модели извлекали и понимали несколько фрагментов информации, а также осознавали их взаимосвязь. Чтобы продемонстрировать эту возможность, мы открываем исходный код нового бенчмарка: OpenAI-MRCR (Multi-Round Coreference).
OpenAI-MRCR проверяет способность модели находить и различать несколько хорошо спрятанных в контексте «иголок». Оценка состоит из многошаговых синтетических диалогов между пользователем и ассистентом, в которых пользователь просит написать текст на определенную тему, например «напиши стихотворение о тапирах» или «напиши пост в блог о камнях». Затем мы внедряем два, четыре или восемь идентичных запросов по всему контексту. Модель должна извлечь ответ, соответствующий конкретному экземпляру (например, «дай мне третье стихотворение о тапирах»).
Сложность заключается в сходстве между этими запросами и остальным контекстом — модели легко могут ввести в заблуждение тонкие различия, такие как короткий рассказ о тапирах вместо стихотворения или стихотворение о лягушках вместо тапиров. Мы обнаружили, что GPT‑4.1 превосходит GPT‑4o при длине контекста до 128 тыс. токенов и сохраняет высокие показатели даже при 1 миллионе токенов.
Но задача остается сложной даже для продвинутых моделей рассуждения. Мы публикуем набор данных для оценки, чтобы стимулировать дальнейшую работу над поиском в длинном контексте для реальных задач.
Мы также выпускаем Graphwalks — набор данных для оценки многошаговых рассуждений в длинном контексте. Многие сценарии использования длинного контекста разработчиками требуют выполнения нескольких логических переходов внутри контекста, таких как переключение между несколькими файлами при написании кода или перекрестные ссылки на документы при ответе на сложные юридические вопросы.
Модель (или даже человек) теоретически могла бы решить проблему OpenAI-MRCR за один проход или прочтение промпта, но Graphwalks разработан так, чтобы требовать рассуждений по нескольким позициям в контексте, и не может быть решен последовательно.
Graphwalks заполняет контекстное окно ориентированным графом, состоящим из шестнадцатеричных хэшей, а затем просит модель выполнить поиск в ширину (BFS), начиная со случайного узла в графе. После этого мы просим ее вернуть все узлы на определенной глубине. GPT‑4.1 достигает 61,7% точности на этом бенчмарке, не уступая производительности o1 и уверенно превосходя GPT‑4o.
В Graphwalks моделям предлагается выполнить поиск в ширину, начиная со случайного узла в большом графе.
Бенчмарки не отражают всей полноты картины, поэтому мы работали с альфа-партнерами, чтобы протестировать производительность GPT‑4.1 на их реальных задачах с длинным контекстом.
Примеры из реального мира
Thomson Reuters: Thomson Reuters протестировала GPT‑4.1 с помощью CoCounsel — своего профессионального ИИ-ассистента для юридической работы. По сравнению с GPT‑4o, им удалось повысить точность проверки нескольких документов на 17% при использовании GPT‑4.1 в рамках внутренних бенчмарков длинного контекста. Это важнейший показатель способности CoCounsel справляться со сложными юридическими процессами, включающими множество объемных документов. В частности, они выяснили, что модель крайне надежно удерживает контекст из различных источников и точно выявляет тонкие взаимосвязи между документами — такие как противоречащие друг другу пункты или дополнительный контекст, что критически важно для юридического анализа и принятия решений.
Carlyle: Carlyle использовала GPT‑4.1 для точного извлечения детальных финансовых данных из множества объемных документов, включая PDF-файлы, таблицы Excel и другие сложные форматы. Согласно их внутренним оценкам, модель продемонстрировала на 50% лучшие результаты при извлечении данных из очень крупных документов с высокой плотностью информации и стала первой моделью, успешно преодолевшей ключевые ограничения других доступных решений, включая поиск «иголки в стоге сена», ошибки в середине контекста (lost-in-the-middle) и многошаговые рассуждения по документам.
Помимо производительности и точности модели, разработчикам также необходимы быстрые ответы, чтобы успевать за потребностями пользователей. Мы улучшили наш стек инференса, чтобы сократить время до получения первого токена, а с помощью кэширования промптов вы можете еще сильнее снизить задержку и сэкономить средства. В ходе нашего первоначального тестирования задержка до появления первого токена для GPT‑4.1 составляла приблизительно пятнадцать секунд при контексте в 128 000 токенов и одну минуту при контексте в миллион токенов. Модели GPT‑4.1 mini и nano работают еще быстрее: например, GPT‑4.1 nano чаще всего возвращает первый токен менее чем за пять секунд для запросов со 128 000 входных токенов.
Видение
Семейство моделей GPT‑4.1 демонстрирует исключительные возможности понимания изображений, причем GPT‑4.1 mini представляет собой значительный шаг вперед, часто превосходя GPT‑4o в бенчмарках по работе с изображениями.
В MMMU модель отвечает на вопросы, содержащие графики, диаграммы, карты и т. д. (Примечание: даже когда изображение не включено, многие ответы все равно можно вывести или угадать по контексту.)
В MathVista модель решает визуальные математические задачи.
В CharXiv-Reasoning модель отвечает на вопросы о графиках из научных статей.
Производительность при работе с длинным контекстом также важна для мультимодальных сценариев использования, таких как обработка длинных видео. В Video-MME (длинные видео без субтитров) модель отвечает на вопросы с множественным выбором на основе видео продолжительностью 30–60 минут без субтитров. GPT‑4.1 достигает лучших в отрасли результатов, набирая 72.0% по сравнению с 65.3% у GPT‑4o.
В Video-MME модель отвечает на вопросы с множественным выбором на основе видео продолжительностью 30–60 минут без субтитров.
Цены
Модели GPT‑4.1, GPT‑4.1 mini и GPT‑4.1 nano уже доступны всем разработчикам.
Благодаря оптимизации эффективности наших систем инференса мы смогли предложить более низкие цены на серию GPT‑4.1. GPT‑4.1 стоит на 26% дешевле, чем GPT‑4o для медианных запросов, а GPT‑4.1 nano — наша самая дешевая и быстрая модель на сегодняшний день. Для запросов, которые многократно передают один и тот же контекст, мы увеличиваем скидку на кэширование промптов до 75% (по сравнению с 50% ранее) для этих новых моделей. Наконец, мы предлагаем запросы с длинным контекстом без дополнительной платы сверх стандартных тарифов за токен.
Модель | Входные данные | Кэшированный ввод | Выходные данные | Смешанная цена* |
gpt-4.1 | $2.00 | $0.50 | $8.00 | $1.84 |
gpt-4.1-mini | $0.40 | $0.10 | $1.60 | $0.42 |
gpt-4.1-nano | $0.10 | $0.025 | $0.40 | $0.12 |
*На основе типичных соотношений ввода/вывода и кэша.
Эти модели доступны для использования в нашем Batch API со скидкой 50%.
Заключение
GPT‑4.1 — это значительный шаг вперед в практическом применении искусственного интеллекта. Уделяя пристальное внимание реальным потребностям разработчиков — от написания кода до следования инструкциям и понимания длинного контекста, — эти модели открывают новые возможности для создания интеллектуальных систем и сложных агентных приложений. Мы постоянно вдохновляемся креативностью сообщества разработчиков и с нетерпением ждем возможности увидеть, что вы создадите с помощью GPT‑4.1.
Приложение
Полный список результатов тестов по академическим дисциплинам, программированию, следованию инструкциям, работе с большим контекстом, визуальным данным и вызову функций представлен ниже.
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| AIME '24 | 48.1% | 49.6% | 29.4% | 13.1% | 8.6% | 74.3% | 87.3% | 36.7% |
| GPQA Diamond1 | 66.3% | 65.0% | 50.3% | 46.0% | 40.2% | 75.7% | 77.2% | 69.5% |
| MMLU | 90.2% | 87.5% | 80.1% | 85.7% | 82.0% | 91.8% | 86.9% | 90.8% |
| Multilingual MMLU | 87.3% | 78.5% | 66.9% | 81.4% | 70.5% | 87.7% | 80.7% | 85.1% |
[1] Наша реализация GPQA использует модель для извлечения ответа вместо регулярных выражений. Для GPT-4.1 разница составила <1% (не статистически значимо), но для модели GPT-4o извлечение с помощью модели значительно улучшает результаты (~46% -> 54%).
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| SWE-bench Verified2 | 54.6% | 23.6% | - | 33.2% | 8.7% | 41.0% | 49.3% | 38.0% |
| SWE-Lancer | $176K (35.1%) | $165K (33.0%) | $77K (15.3%) | $163K (32.6%) | $116K (23.1%) | $160K (32.1%) | $90K (18.0%) | $186K (37.3%) |
| SWE-Lancer (IC-Diamond subset) | $34K (14.4%) | $31K (13.1%) | $9K (3.7%) | $29K (12.4%) | $11K (4.8%) | $29K (9.7%) | $17K (7.4%) | $41K (17.4%) |
| Aider«s polyglot: whole | 51.6% | 34.7% | 9.8% | 30.7% | 3.6% | 64.6% | 66.7% | - |
| Aider«s polyglot: diff | 52.9% | 31.6% | 6.2% | 18.2% | 2.7% | 61.7% | 60.4% | 44.9% |
[2] Мы исключаем 23 из 500 задач, которые не смогли запуститься на нашей инфраструктуре. Полный список из 23 исключенных задач: 'astropy__astropy-7606', 'astropy__astropy-8707', 'astropy__astropy-8872', 'django__django-10097', 'django__django-7530', 'matplotlib__matplotlib-20488', 'matplotlib__matplotlib-20676', 'matplotlib__matplotlib-20826', 'matplotlib__matplotlib-23299', 'matplotlib__matplotlib-24970', 'matplotlib__matplotlib-25479', 'matplotlib__matplotlib-26342', 'psf__requests-6028', 'pylint-dev__pylint-6528', 'pylint-dev__pylint-7080', 'pylint-dev__pylint-7277', 'pytest-dev__pytest-5262', 'pytest-dev__pytest-7521', 'scikit-learn__scikit-learn-12973', 'sphinx-doc__sphinx-10466', 'sphinx-doc__sphinx-7462', 'sphinx-doc__sphinx-8265' и 'sphinx-doc__sphinx-9367'.
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| Следование внутренним инструкциям API (сложно) | 49.1% | 45.1% | 31.6% | 29.2% | 27.2% | 51.3% | 50.0% | 54.0% |
| MultiChallenge | 38.3% | 35.8% | 15.0% | 27.8% | 20.3% | 44.9% | 39.9% | 43.8% |
| MultiChallenge (оценщик o3-mini)3 | 46.2% | 42.2% | 31.1% | 39.9% | 25.6% | 52.9% | 50.2% | 50.1% |
| COLLIE | 65.8% | 54.6% | 42.5% | 50.2% | 52.7% | 95.3% | 98.7% | 72.3% |
| IFEval | 87.4% | 84.1% | 74.5% | 81.0% | 78.4% | 92.2% | 93.9% | 88.2% |
| Multi-IF | 70.8% | 67.0% | 57.2% | 60.9% | 57.9% | 77.9% | 79.5% | 70.8% |
[3] Примечание: мы обнаружили, что стандартный оценщик в MultiChallenge (GPT-4o) часто неверно оценивает ответы моделей. Замена оценщика на модель рассуждений, такую как o3-mini, существенно повышает точность оценивания на проверенных нами выборках. В целях поддержания согласованности с таблицей лидеров мы публикуем оба набора результатов…Примечание: мы обнаружили, что стандартный оценщик в MultiChallenge (GPT-4o) часто неверно оценивает ответы моделей. Замена оценщика на модель рассуждений, такую как o3-mini, существенно повышает точность оценивания на проверенных нами выборках. В целях поддержания согласованности с таблицей лидеров мы публикуем оба набора результатов.
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| OpenAI-MRCR: 2 иголки 128k | 57.2% | 47.2% | 36.6% | 31.9% | 24.5% | 22.1% | 18.7% | 38.5% |
| OpenAI-MRCR: 2 иголки 1M | 46.3% | 33.3% | 12.0% | - | - | - | - | - |
| Graphwalks bfs <128k | 61.7% | 61.7% | 25.0% | 41.7% | 29.0% | 62.0% | 51.0% | 72.3% |
| Graphwalks bfs >128k | 19.0% | 15.0% | 2.9% | - | - | - | - | - |
| Graphwalks parents <128k | 58.0% | 60.5% | 9.4% | 35.4% | 12.6% | 50.9% | 58.3% | 72.6% |
| Graphwalks parents >128k | 25.0% | 11.0% | 5.6% | - | - | - | - | - |
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| MMMU | 74.8% | 72.7% | 55.4% | 68.7% | 56.3% | 77.6% | - | 75.2% |
| MathVista | 72.2% | 73.1% | 56.2% | 61.4% | 56.5% | 71.8% | - | 72.3% |
| CharXiv-R | 56.7% | 56.8% | 40.5% | 52.7% | 36.8% | 55.1% | - | 55.4% |
| CharXiv-D | 87.9% | 88.4% | 73.9% | 85.3% | 76.6% | 88.9% | - | 90.0% |
| Категория | GPT-4.1 | GPT-4.1 mini | GPT-4.1 nano | GPT-4o (2024–11–20) | GPT-4o mini | OpenAI o1(high) | OpenAI o3-mini (high) | GPT-4.5 |
|---|---|---|---|---|---|---|---|---|
| ComplexFuncBench | 65.5% | 49.3% | 5.7% | 66.5% | 38.6% | 47.6% | 17.6% | 63.0% |
| Taubench airline4 | 49.4% | 36.0% | 14.0% | 42.8% | 22.0% | 50.0% | 32.4% | 50.0% |
| Taubench retail4, 5 | 68.0% (73.6%) | 55.8% (65.4%) | 22.6% (23.5%) | 60.3% | 44.0% | 70.8% | 57.6% | 68.4% |
[4] Показатели оценки tau-bench усреднены по 5 запускам для снижения дисперсии и получены без использования каких-либо пользовательских инструментов или подсказок.
[5] Числа в скобках представляют результаты Tau-bench при использовании GPT-4.1 в качестве модели пользователя, а не GPT-4o. Мы обнаружили, что, поскольку GPT-4.1 лучше справляется с выполнением инструкций, он эффективнее исполняет роль пользователя, что приводит к более успешным траекториям. Мы считаем, что это отражает истинную производительность оцениваемой модели на бенчмарке.
Запись прямой трансляции
Автор
Руководители исследования
Ананья Кумар (Ananya Kumar), Цзяхуэй Юй (Jiahui Yu), Джон Холлман (John Hallman), Мишель Покрасс (Michelle Pokrass)
Основные участники исследования
Адам Гоучер (Adam Goucher), Ади Ганеш (Adi Ganesh), Боуэнь Чэн (Bowen Cheng), Брэндон МакКинзи (Brandon McKinzie), Брайан Чжан (Brian Zhang), Крис Кох (Chris Koch), Колин Вей (Colin Wei), Дэвид Медина (David Medina), Эдмунд Вонг (Edmund Wong), Эрин Кавана (Erin Kavanaugh), Флоран Бекерман (Florent Bekerman), Хайтан Ху (Haitang Hu), Хунюй Жэнь (Hongyu Ren), Ишан Сингал (Ishaan Singal), Джейми Кирос (Jamie Kiros), Джейсон Ай (Jason Ai), Цзи Линь (Ji Lin), Джонатан Чен (Jonathan Chien), Джош МакГрат (Josh McGrath), Джулиан Ли (Julian Lee), Джули Ван (Julie Wang), Кевин Лу (Kevin Lu), Кристиан Георгиев (Kristian Georgiev), Кайл Лютер (Kyle Luther), Ли Цзин (Li Jing), Макс Шварцер (Max Schwarzer), Мигель Кастро (Miguel Castro), Нитиш Кескар (Nitish Keskar), Рафа Гонтижу Лопес (Rapha Gontijo Lopes), Шэнцзя Чжао (Shengjia Zhao), Салли Чен (Sully Chen), Суванш Санджив (Suvansh Sanjeev), Тейлор Гордон (Taylor Gordon), Тед Сандерс (Ted Sanders), Венда Чжоу (Wenda Zhou), Ян Сун (Yang Song), Юцзя Се (Yujia Xie), Юцзя Цзинь (Yujia Jin), Чжишуай Чжан (Zhishuai Zhang)
Участники исследования
Адитья Рамеш (Aditya Ramesh), Эйден Лоу (Aiden Low), Алекс Никол (Alex Nichol), Андрей Георге (Andrei Gheorghe), Эндрю Таллок (Andrew Tulloch), Бехруз Горбани (Behrooz Ghorbani), Борис Минаев (Borys Minaiev), Брэндон Хоoughton (Brandon Houghton), Шарлотта Коул (Charlotte Cole), Крис Лу (Chris Lu), Эдмунд Вонг (Edmund Wong), Ханна Шихан (Hannah Sheahan), Джейкоб Ху (Jacob Huh), Джеймс Цинь (James Qin), Цзяньфэн Ван (Jianfeng Wang), Джонатан Уорд (Jonathan Ward), Джозеф Мо (Joseph Mo), Джойс Раффэлл (Joyce Ruffell), Кай Чен (Kai Chen), Каран Сингал (Karan Singhal), Карина Нгуен (Karina Nguyen), Кэндзи Хата (Kenji Hata), Кевин Лю (Kevin Liu), Майя Требач (Maja Trębacz), Мэтт Лим (Matt Lim), Михаил Павлов (Mikhail Pavlov), Мин Чен (Ming Chen), Морган Гриффитс (Morgan Griffiths), Нат МакАлис (Nat McAleese), Ник Статас (Nick Stathas), Раджкумар Самуэль (Rajkumar Samuel), Рави Теджа Муллапуди (Ravi Teja Mullapudi), Роуэн Зеллерс (Rowan Zellers), Шэнли Ху (Shengli Hu), Шучао Би (Shuchao Bi), Спенсер Папай (Spencer Papay), Сю-цзе Юй (Szi‑chieh Yu), Яш Патил (Yash Patil), Юфэн Чжан (Yufeng Zhang)
Участники по внедрению и масштабированию
Адам Уокер (Adam Walker), Али Камали (Ali Kamali), Элвин Ван (Alvin Wan), Энди Ван (Andy Wang), Ангад Сингх (Angad Singh), Бен Леймбергер (Ben Leimberger), Бет Гувер (Beth Hoover), Брайан Ю (Brian Yu), Чарли Джат (Charlie Jatt), Чен Дин (Chen Ding), Чэн Чан (Cheng Chang), Даниэль Капплер (Daniel Kappler), Динхуа Ли (Dinghua Li), Фелипе Петроски Сух (Felipe Petroski Such), Джанарданан Вембунараянан (Janardhanan Vembunarayanan), Джозеф Флоренсио (Joseph Florencio), Кевин Кинг (Kevin King), Ларри Лю (Larry Lv), Лин Ян (Lin Yang), Линден Ли (Linden Li), Маноли Лиодакис (Manoli Liodakis), Марк Хадналл (Mark Hudnall), Никунд Ханда (Nikunj Handa), Оливье Годеман (Olivier Godement), Рышард Мадей (Ryszard Madej), Шон Чанг (Sean Chang), Шон Фицджеральд (Sean Fitzgerald), Шервин Ву (Sherwin Wu), Сиюань Фу (Siyuan Fu), Стэнли Се (Stanley Hsieh), Тибо Сотто (Thibault Sottiaux), Юньсин Дай (Yunxing Dai), Ютянь Лю (Yutian Liu)
Продажи, маркетинг, коммуникации и дизайн
Энди Вуд (Andy Wood), Эшли Тайра (Ashley Tyra), Кэри Хадсон (Cary Hudson), Дана Палми (Dana Palmie), Джессика Ши (Jessica Shieh), Джастин Ван (Justin Wang), Каран Секхри (Karan Sekhri), Кэти Ким (Katie Kim), Кендал Саймон (Kendal Simon), Лаура Пэн (Laura Peng), Лехер Патак (Leher Pathak), Линдси МакКаллум (Lindsay McCallum), Мэтт Николс (Matt Nichols), Ник Пайн (Nick Pyne), Ноа МакКаллум (Noah MacCallum), Уна Глисон (Oona Gleeson), Пранав Дешпанде (Pranav Deshpande), Ришаб Аггарвал (Rishabh Aggarwal), Скотт Этерсмит (Scott Ethersmith), Шаоцзи Амдо (Shaokyi Amdo), Стивен Гутьеррес (Stephen Gutierrez), Табарак Хан (Tabarak Khan), Терри Ли (Terry Lee), Томас Дегри (Thomas Degry), Вейт Меллер (Veit Moeller), Яра Какбаз (Yara Khakbaz)
Полный текст статьи читайте на OpenAI
