Оценка производительности наших моделей в реальных задачах

GDPval__Art_Card.png?w=1600&h=900&fit=fi

Мы представляем GDPval — новый метод оценки, который измеряет производительность моделей на экономически ценных реальных задачах в 44 профессиях.

Читать научную статьюПосетить evals.openai.com

Наша миссия — гарантировать, что общий искусственный интеллект принесет пользу всему человечеству. В рамках нашей миссии мы хотим открыто рассказывать о том, как модели ИИ могут помогать людям в реальном мире. Именно поэтому мы представляем GDPval — новый инструмент оценки, созданный для отслеживания эффективности работы наших и чужих моделей в экономически ценных задачах реального мира. Мы назвали эту оценку GDPval, потому что за основу был взят концепт валового внутреннего продукта (ВВП) в качестве ключевого экономического индикатора, а задачи были отобраны из основных профессий в отраслях, вносящих наибольший вклад в ВВП.

Люди часто рассуждают о более масштабном влиянии ИИ на общество, но самый наглядный способ понять его потенциал — посмотреть на то, с чем модели уже способны справляться. История показывает, что крупным технологиям — от интернета до смартфонов — требуется больше десятилетия от изобретения до повсеместного внедрения. Инструменты оценки вроде GDPval помогают строить обсуждения будущих улучшений ИИ на фактах, а не на догадках, и позволяют отслеживать прогресс моделей с течением времени.

Предыдущие методы оценки ИИ, такие как сложные академические тесты и соревновательные задачи по программированию, сыграли важнейшую роль в расширении возможностей моделей к рассуждениям, но они часто не дотягивают до тех задач, с которыми многие люди сталкиваются в своей повседневной работе.

Чтобы преодолеть этот разрыв, мы разрабатываем оценки, которые измеряют все более реалистичные и экономически значимые возможности. Этот эволюционный путь прошел от классических академических бенчмарков, таких как MMLU (экзаменационные вопросы по самым разным предметам), до более прикладных тестов, таких как SWE-Bench (задачи по исправлению ошибок в программном обеспечении), MLE-Bench (задачи инженерии машинного обучения, такие как обучение и анализ моделей) и Paper-Bench (научные рассуждения и критический анализ исследовательских работ), а в последнее время — до рыночных оценок, таких как SWE-Lancer (фриланс-проекты по разработке ПО на основе реальных выплат).

GDPval — следующий шаг в этом развитии. Он измеряет эффективность моделей на задачах, взятых непосредственно из реальной интеллектуальной работы опытных профессионалов в самых разных профессиях и секторах, предоставляя более четкое представление о том, как модели справляются с экономически ценными задачами. Оценка моделей на реалистичных профессиональных задачах помогает нам понять не только то, насколько хорошо они показывают себя в лаборатории, но и то, как они могут помогать людям в их повседневной работе.

Что измеряет GDPval

GDPval, первая версия этой оценки, охватывает 44 профессии, выбранные из 9 ведущих отраслей, вносящих наибольший вклад в ВВП США. Полный набор GDPval включает 1320 специализированных задач (220 в открытом золотом наборе), каждая из которых тщательно создана и проверена опытными профессионалами со стажем работы в среднем более 14 лет в этих областях. Каждая задача основана на реальных рабочих продуктах, таких как юридическая записка, инженерный чертеж, диалог со службой поддержки или план сестринского ухода.

GDPval отличается как своей реалистичностью, так и разнообразием оцениваемых задач. В отличие от других оценок, привязанных к экономической ценности и сосредоточенных на конкретных областях (например, SWE-Lancer), GDPval охватывает множество задач и профессий. И в отличие от бенчмарков, которые предполагают создание синтетических задач в стиле академического экзамена или теста (например, Humanity«s Last Exam или MMLU), GDPval фокусируется на задачах, основанных на результатах, которые представляют собой реальную работу или продукт, существующие на сегодняшний день, либо аналогично созданный рабочий продукт.

В отличие от традиционных бенчмарков, задачи GDPval — это не простые текстовые запросы. К ним прилагаются справочные файлы и контекст, а ожидаемые результаты охватывают документы, презентации, схемы, электронные таблицы и мультимедиа. Такая реалистичность делает GDPval более надежным тестом того, как модели могут помогать профессионалам.

GDPval — это ранний шаг, который пока не отражает всю полноту нюансов многих экономических задач. Хотя он охватывает 44 профессии и сотни задач интеллектуального труда, он ограничен одноразовыми (one-shot) оценками и поэтому не учитывает ситуации, когда модели необходимо выстраивать контекст или улучшать результат через множество черновиков. Будущие версии будут расширены за счет более интерактивных рабочих процессов и задач, богатых контекстом, чтобы лучше отражать сложность реальной интеллектуальной работы (подробнее см. в разделе «Ограничения» ниже).

Как мы выбирали профессии

GDPval охватывает задачи в 9 отраслях и 44 профессиях, и в будущих версиях этот охрод будет расширяться. Первоначальные 9 отраслей были выбраны на основе тех, которые обеспечивают более 5% ВВП США, согласно данным Федерального резервного банка Сент-Луиса. Затем мы выбрали 5 профессий в каждой отрасли, которые вносят наибольший вклад в общую заработную плату и компенсации и преимущественно относятся к интеллектуальному труду, используя данные о заработной плате и занятости из отчета Бюро статистики труда США (BLS) за май 2024 года. Чтобы определить, являются ли профессии преимущественно интеллектуальными, мы использовали данные о задачах из O*NET — базы данных информации о профессиях в США, спонсируемой Министерством труда США. Мы классифицировали каждую задачу для каждой профессии в O*NET как интеллектуальный труд либо физический труд / ручную работу (требующую действий в физическом мире). Профессия в целом квалифицировалась как «преимущественно интеллектуальный труд», если по меньшей мере 60% составляющих ее задач были классифицированы как не предполагающие физического труда или ручной работы. Мы выбрали этот порог в 60% в качестве отправной точки для первой версии GDPval, сосредоточившись на профессиях, где ИИ может оказать наибольшее влияние на реальную производительность труда.

В результате этого процесса для включения в список было отобрано 44 профессии.

Операции с недвижимостью, аренда и лизинг

  • Консьержи

  • Управляющие недвижимостью и ассоциациями жильцов

  • Агенты по продаже недвижимости

  • Брокеры по недвижимости

  • Работники пунктов выдачи и проката

Государственное управление

  • Специалисты по организации досуга и рекреации

  • Инспекторы по соблюдению нормативных требований

  • Младшие руководители полиции и детективов

  • Менеджеры по административно-хозяйственной деятельности

  • Социальные работники по работе с детьми, семьями и в школах

Обрабатывающая промышленность

  • Инженеры-механики

  • Инженеры-промышленники

  • Специалисты по закупкам

  • Кладовщики по отправке, приемке и учету запасов

  • Младшие руководители на производстве и оперативного персонала

Профессиональные, научные и технические услуги

  • Разработчики программного обеспечения

  • Юристы

  • Бухгалтеры и аудиторы

  • Менеджеры по компьютерным и информационным системам

  • Специалисты по управлению проектами

Здравоохранение и социальная помощь

  • Дипломированные медсестры

  • Медсестры широкого профиля (Nurse practitioners)

  • Менеджеры в сфере медицинских и оздоровительных услуг

  • Младшие руководители офисных и административно-вспомогательных работников

  • Медицинские секретари и административные ассистенты

Финансы и страхование

  • Специалисты по работе с клиентами

  • Финансовые и инвестиционные аналитики

  • Финансовые менеджеры

  • Личные финансовые консультанты

  • Агенты по продаже ценных бумаг, биржевых товаров и финансовых услуг

Розничная торговля

  • Фармацевты

  • Младшие руководители работников розничной торговли

  • Генеральные и операционные директоры

  • Частные детективы и следователи

Оптовая торговля

  • Менеджеры по продажам

  • Специалисты по обработке заказов

  • Младшие руководители работников нерозничной торговли

  • Торговые представители (оптовая и производственная торговля, кроме технической и научной продукции)

  • Торговые представители (оптовая и производственная торговля, техническая и научная продукция)

Информация

  • Аудио- и видеотехники

  • Продюсеры и режиссеры

  • Аналитики новостей, репортеры и журналисты

  • Редакторы кино и видео

  • Редакторы

GDPval охватывает 44 профессии умственного труда в 9 секторах: от разработчиков ПО и юристов до дипломированных медсестер и инженеров-механиков. Эти профессии были выбраны из-за их экономической значимости и представляют те виды повседневной работы, где ИИ может существенно помочь профессионалам.

Как мы создавали датасет

Для каждой профессии мы работали с опытными специалистами над созданием репрезентативных задач, отражающих их повседневную работу. Стаж этих профессионалов в среднем составлял 14 лет, при этом они имели серьезные достижения в карьере. Мы специально привлекли широкий круг экспертов — например, юристов из разных областей практики и компаний разного размера, — чтобы максимизировать репрезентативность.

Каждая задача прошла многоэтапный процесс проверки, чтобы убедиться в ее репрезентативности для реальной работы, осуществимости для выполнения другим профессионалом и ясности для оценки. В среднем каждая задача проходила 5 раундов экспертной оценки, включая проверки другими авторами задач, дополнительными профильными рецензентами и валидацию на основе моделей.

Полученный датасет включает 30 полностью проверенных задач на каждую профессию (полный набор) с 5 задачами на профессию в нашем открытом золотом наборе, обеспечивая надежную основу для оценки производительности моделей на задачах реального интеллектуального труда.

Примеры задач GDPval

Как мы оцениваем производительность моделей

Чтобы оценить производительность моделей на задачах GDPval, мы полагаемся на экспертов-«оценивающих» (graders) — группу опытных профессионалов из тех же профессий, которые представлены в датасете. Эти эксперты вслепую сравнивают созданные моделью результаты с результатами, полученными от авторов задач (не зная, что было сгенерировано ИИ, а что — человеком), и дают свои критические замечания и оценки. Затем эксперты ранжируют результаты людей и ИИ и классифицируют каждый результат ИИ как «лучше», «так же хорошо» или «хуже» по сравнению с другими.

Авторы задач также создали подробные критерии оценки (рубрики) для своих профессий, что добавляет последовательности и прозрачности в процесс оценки. Мы также создали »автоматизированный оценщик» — систему ИИ, обученную оценивать то, как человеческие эксперты судят о том или ином результате. Другими словами, вместо проведения полноценной экспертной оценки каждый раз, автоматизированный оценщик может быстро предсказать, какому выводу люди, скорее всего, отдадут предпочтение. Мы выпускаем этот инструмент через evals.openai.com в качестве экспериментальной исследовательской службы, но он пока не так надежен, как эксперты-люди, поэтому мы не используем его для их замены.

Первые результаты

Мы обнаружили, что лучшие современные передовые модели уже приближаются по качеству работы к отраслевым экспертам. Чтобы проверить это, мы провели слепые тестирования, в ходе которых отраслевые эксперты сравнивали результаты нескольких ведущих моделей — GPT‑4o, o4-mini, OpenAI o3, GPT‑5, Claude Opus 4.1, Gemini 2.5 Pro и Grok 4 — с работой, выполненной людьми. По результатам 220 задач из золотого набора GDPval мы зафиксировали случаи, когда результаты моделей оценивались как лучшие («победы») или на уровне («ничьи») с результатами отраслевых экспертов, как показано на гистограмме ниже. Claude Opus 4.1 оказалась лучшей моделью в наборе, преуспев в особенности в эстетике (например, форматирование документов, макет презентаций), а GPT‑5 особенно отличилась в точности (например, поиск специализированных знаний). Мы также видим четкий прогресс со временем при выполнении этих задач. Производительность выросла более чем в два раза от GPT‑4o (выпущенной весной 2024 года) до GPT‑5 (выпущенной летом 2025 года), следуя четкому линейному тренду.

Кроме того, мы обнаружили, что передовые модели способны выполнять задачи GDPval примерно в 100 раз быстрее и в 100 раз дешевле, чем отраслевые эксперты. Тем не менее, эти показатели отражают чистое время вывода модели и расценки API-биллинга и поэтому не учитывают человеческий надзор, итерации и шаги по интеграции, необходимые в реальной рабочей обстановке при использовании наших моделей. Тем не менее, особенно на подмножестве задач, где модели особенно сильны, мы ожидаем, что передача задачи модели перед обращением к человеку сэкономит время и деньги.

Эксперты-оценщики сравнили результаты ведущих моделей с работой человеческих экспертов. Современные передовые модели уже приближаются по качеству работы к результатам отраслевых специалистов. Модель Claude Opus 4.1 выдавала результаты, оцененные как столь же хорошие или лучшие, чем у людей, в чуть менее чем половине задач.

За год с момента выхода GPT‑4o и до появления GPT‑5 производительность на задачах GDPval выросла более чем в три раза.

Наконец, мы поэтапно обучили внутреннюю экспериментальную версию GPT‑5, чтобы оценить, сможем ли мы улучшить производительность на GDPval. Мы выяснили, что этот процесс улучшает результаты, создавая путь для дальнейшего потенциального роста. Другие контролируемые эксперименты подтверждают это: увеличение размера модели, побуждение к большему количеству шагов рассуждения и предоставление более богатого контекста задачи приводят к измеримым улучшениям.

Полные результаты вы можете прочитать в нашей научной работе. Мы также выпускаем золотое подмножество задач GDPval и публичный сервис оценки, чтобы другие исследователи могли продолжить эту работу.

Будущее работы и ИИ

По мере того как ИИ становится более способным, он, вероятно, вызовет изменения на рынке труда. Первые результаты GDPval показывают, что модели уже могут брать на себя некоторые рутинные, четко описанные задачи быстрее и с меньшими затратами, чем эксперты. Однако большинство профессий — это больше, чем просто набор задач, которые можно записать на бумаге. GDPval подчеркивает те области, где ИИ может справляться с рутинными обязанностями, чтобы люди могли уделять больше времени творческой, требующей суждений части работы. Когда ИИ дополняет работников подобным образом, это может привести к значительному экономическому росту. наша цель — помочь каждому оказаться на «восходящем эскалаторе» ИИ, обеспечивая демократичный доступ к этим инструментам, поддерживая работников в период перемен и создавая системы, которые поощряют широкий вклад в общее дело.

Ограничения и что дальше

GDPval — это лишь первый шаг. Хотя он охватывает 44 профессии и сотни задач, мы продолжаем совершенствовать наш подход, чтобы расширить область тестирования и сделать результаты более значимыми. Текущая версия оценки также является одномоментной (one-shot), поэтому она не учитывает ситуации, когда модели необходимо выстраивать контекст или совершенствоваться в ходе работы над несколькими версиями — например, дорабатывать юридическое заключение на основе отзывов клиента или итерировать анализ данных после выявления аномалии. Кроме того, в реальном мире задачи не всегда четко определены с помощью промпта и справочных файлов: например, юристу может потребоваться разобраться в неопределенности и пообщаться с клиентом, прежде чем решить, что создание юридического заключения является правильным подходом для помощи ему. Мы планируем расширить GDPval, включив в него больше профессий, отраслей и типов задач с повышенной интерактивностью, а также больше задач, связанных с преодолением неопределенности, с долгосрочной целью более качественного измерения прогресса в различных видах интеллектуального труда.

Принять участие

  • Если вы — эксперт в отрасли, желающий внести свой вклад в GDPval, пожалуйста, сообщите о своем интересе здесь.
  • Если вы — клиент, работающий с OpenAI, и хотите внести свой вклад в будущий этап GDPval, пожалуйста, выразите свой интерес здесь.

Участие сообщества имеет решающее значение — мы рады создавать GDPval совместно с исследователями, практикующими специалистами и организациями, которые разделяют нашу цель сделать искусственный интеллект общего назначения (AGI) более полезным для людей на рабочем месте.

Автор

OpenAI

Полный текст статьи читайте на OpenAI