Оценка способности ИИ решать задачи научных исследований

Мы представляем FrontierScience — новый бенчмарк для оценки возможностей ИИ в экспертных научных рассуждениях в области физики, химии и биологии.

Читать документ
Partial graphic with a soft green-and-yellow gradient background, a large cropped word starting with

Умение рассуждать лежит в основе научной работы. Помимо простого воспроизведения фактов, ученые генерируют гипотезы, тестируют и дорабатывают их, а также синтезируют идеи из разных областей. По мере того как наши модели становятся все более способными, главный вопрос заключается в том, как они могут применять глубокие рассуждения для внесения вклада в научные исследования.

За последний год наши модели достигли важнейших рубежей, включая завоевание медалей высшей пробы на Международной математической олимпиаде и Международной олимпиаде по информатике. Параллельно мы начинаем замечать, как наши самые мощные модели, такие как GPT‑5, существенно ускоряют реальные научные рабочие процессы. Исследователи используют эти системы для таких задач, как поиск литературы по разным дисциплинам и языкам, а также для проработки сложных математических доказательств. Во многих случаях модель сокращает работу, которая могла бы занять дни или недели, до нескольких часов. Этот прогресс задокументирован в нашей статье Ранние эксперименты по ускорению науки с помощью GPT‑5, опубликованной в ноябре 2025 года, которая представляет первые свидетельства того, что GPT‑5 способна заметно ускорить научные рабочие процессы.

Представляем FrontierScience

Поскольку ускорение научного прогресса — одна из наиболее перспективных возможностей применения ИИ на благо человечества, мы совершенствуем наши модели в решении сложных математических и научных задач, а также работаем над инструментами, которые помогут ученым извлекать из них максимум пользы.

Когда в ноябре 2023 года был выпущен GPQA — «защищенный от Google» научный бенчмарк, состоящий из вопросов, составленных экспертами со степенями PhD, — GPT‑4 набрала 39%, что ниже экспертного базового уровня в 70%. Два года спустя GPT‑5.2 набрала 92%. По мере того как возможности моделей в области рассуждений и работы со знаниями продолжают расти, создание более сложных бенчмарков становится критически важным для измерения и прогнозирования способности моделей ускорять научные исследования. Предыдущие научные бенчмарки в основном сфокусированы на вопросах с выбором ответа, уже насыщены или не имеют четкого фокуса на науке.

Чтобы преодолеть этот разрыв, мы представляем FrontierScience — новый бенчмарк, созданный для измерения научных возможностей экспертного уровня. Бенчмарк FrontierScience написан и проверен экспертами в области физики, химии и биологии и состоит из сотен сложных, оригинальных и значимых вопросов. FrontierScience включает два направления вопросов: «Олимпиада» (Olympiad), оценивающая навыки научного рассуждения олимпиадного типа, и «Исследования» (Research), измеряющие способности к реальным научным исследованиям. Предоставление более глубокого понимания научных возможностей моделей помогает нам отслеживать прогресс и продвигать науку, ускоренную с помощью ИИ.

В наших первичных оценках GPT‑5.2 оказалась нашей лучшей моделью в тестах FrontierScience-Olympiad (набрав 77%) и Research (набрав 25%), опередив другие передовые модели. Мы наблюдаем значительный прогресс в решении экспертных задач, при этом сохраняется потенциал для дальнейшего роста, особенно в открытых задачах исследовательского типа. Для ученых это означает, что текущие модели уже способны поддерживать те части исследований, которые требуют структурированных рассуждений, но в то же время подчеркивает, что предстоит проделать значительную работу по улучшению их способности к творческому мышлению открытого типа. Эти результаты согласуются с тем, как ученые уже используют современные модели: для ускорения рабочих процессов, полагаясь при этом на человеческое суждение при постановке задач и валидации, а также все чаще для поиска идей и связей, на обнаружение которых в противном случае ушло бы гораздо больше времени, включая в некоторых случаях генерацию новых инсайтов, которые эксперты затем оценивают и проверяют.

В конечном счете, важнейшим бенчмарком научных возможностей ИИ являются новые открытия, которым он помогает способствовать; именно это имеет решающее значение для науки и общества. FrontierScience находится на более раннем этапе цепочки. Этот бенчмарк служит ориентиром для научных рассуждений экспертного уровня, позволяя тестировать модели на стандартизированном наборе вопросов, видеть их сильные и слабые стороны и определять направления для улучшений. FrontierScience носит специализированный характер и имеет ограничения в ключевых аспектах (например, ориентация на ограниченные проблемы, написанные экспертами), поэтому он не охватывает всего, что ученые делают в своей повседневной работе. Тем не менее, научному сообществу нужны более сложные, оригинальные и содержательные научные бенчмарки, и FrontierScience делает шаг вперед в этом направлении.

Что измеряет FrontierScience и как он создавался

Полная оценка FrontierScience охватывает более 700 текстовых вопросов (включая 160 в золотом наборе), охватывающих поддисциплины в области физики, химии и биологии. Бенчмарк состоит из олимпиадной (Olympiad) и исследовательской (Research) частей. FrontierScience-Olympiad содержит 100 вопросов, разработанных международными олимпиадными медалистами для оценки научных рассуждений в формате ограниченного краткого ответа. Олимпиадный набор был спроектирован так, чтобы содержать теоретические вопросы, не уступающие по сложности задачам на международных олимпиадах. FrontierScience-Research состоит из 60 оригинальных исследовательских подзадач, созданных учеными со степенями PhD (кандидатами наук, профессорами или постдоками) и оцениваемых по 10-балльной шкале критериев. Исследовательский набор создан для того, чтобы включать автономные многоэтапные подзадачи уровня сложности, с которыми ученый со степенью PhD может столкнуться в ходе своих исследований.

Примеры вопросов

Олимпиадные вопросы были созданы в сотрудничестве с 42 бывшими международными медалистами или тренерами национальных сборных по соответствующим дисциплинам, на счету которых в общей сложности 109 олимпиадных медалей. Исследовательские вопросы были созданы в сотрудничестве с 45 квалифицированными учеными и экспертами в предметной области. Все ученые являлись соискателями ученой степени PhD, исследователями уровня постдока или профессорами. Сферы их компетенции охватывают широкий спектр специализированных и важных научных дисциплин: от квантовой электродинамики до синтетической органической химии и эволюционной биологии.

Процесс создания задач для обоих наборов включал определенный отбор против внутренних моделей OpenAI (например, отбраковывались задачи, с которыми модели успешно справлялись, поэтому мы ожидаем, что оценка будет в некоторой степени смещена против этих моделей по сравнению с другими). Мы выкладываем в открытый доступ золотой олимпиадный набор из 100 вопросов и золотой исследовательский набор из 60 вопросов, сохраняя остальные вопросы в секрете для отслеживания утечки данных.

Flowchart showing four stages of a task development pipeline—Creation, Review, Resolution, and Revision—with brief descriptions of each step and checkmarks for factual, gradable, objective, and difficult criteria.

Задачи проходят четыре стадии: Создание, Рецензирование, Решение, Доработка. Независимые эксперты рецензируют задачи друг друга, чтобы убедиться в их соответствии критериям.

Как мы оцениваем производительность моделей

Олимпиадный набор поддается оценке с помощью краткого ответа: либо числа, либо выражения, либо нечеткого сопоставления строк (fuzzy string match), что помогает проверить правильность. Однако такая проверка часто вступает в компромисс с выразительностью и открытым характером проблемы. Для исследовательского набора мы внедряем архитектуру оценки на основе критериев (рубрик) для более творческих задач открытого типа. Каждый вопрос включает шкалу оценки с несколькими независимыми и объективно оцениваемыми пунктами на общую сумму 10 баллов. Рубрика оценки оценивает не только точность финального ответа, но и правильность промежуточных этапов рассуждения, что позволяет проводить детальный анализ производительности и ошибок модели. Решение считается «верным», если оно набирает не менее 7 из 10 баллов по рубрике.

Ответы оцениваются моделью-экзаменатором (GPT‑5) на основе либо короткого ответа, либо критериев рубрики. И хотя в идеале мы бы хотели привлекать экспертов-людей для оценки каждого ответа, такой подход не масштабируем, поэтому мы разработали рубрику так, чтобы ее мог проверять оценщик на базе модели. Мы разработали пайплайн верификации, чтобы гарантировать хорошую калибровку рубрик и вопросов по уровню сложности и правильности.

Пример исследовательской задачи по химии

Фталоцианины представляют собой важные макроциклические соединения, широко используемые в материаловедении и науках о жизни благодаря своим выдающимся физико-химическим свойствам, включая интенсивное поглощение в видимой и ближней инфракрасной области, а также высокую способность акцептировать электроны. Однако, в отличие от порфиринов, структурное разнообразие фталоцианинов было ограничено традиционными синтетическими методами, основанными на одностадийной конденсации изоиндолиновых фрагментов. Разработка методологий, позволяющих осуществлять контролируемую модификацию каркаса фталоцианинов, особенно в мезо-положениях, представляет собой значительный шаг вперед в расширении структурного и электронного разнообразия этих соединений.

Проанализируйте, как модификация мезо-атомов азота в фталоцианине никеля (II) влияет на электронную структуру, ароматичность, спектроскопические свойства и реакционную способность получаемых макроциклов. Объясните синтетическую методологию, которая делает возможными такие модификации, взаимосвязь между количеством π-электронов и наблюдаемыми свойствами, а также то, как эти системы соотносятся с традиционными фталоцианинами и родственными порфириноидами.

Пример ответа

1. Введение: зачем модифицировать мезо-атомы азота фталоцианинов?

Фталоцианины (Pc) представляют собой класс макроциклических красителей, известных своими замечательными химическими, электронными и оптическими свойствами. Их широкое применение в материаловедении, катализе и биологии проистекает из сильного поглощения в видимой/ближней ИК-области, исключительных окислительно-восстановительных характеристик (т.е. высокого сродства к электрону) и жесткой π-сопряженной системы. Однако традиционные синтетические методы обычно формируют макроцикл в одну стадию из фталонитрильных или изоиндолиновых предшественников, что ограничивает возможность селективного введения заместителей в ключевые положения кольца, особенно в «мезо» (мостиковые) атомы азота. В последнее время появились методологии, позволяющие осуществлять целенаправленную модификацию мезо-атомов азота в фталоцианинах Ni (II), став мощным средством расширения структурного и электронного разнообразия этих макроциклов.

2. Влияние на электронную структуру и ароматичность

  1. Количество π-электронов и кольцевые токи

    Фталоцианины являются классическими 18-электронными ароматическими системами, что обеспечивает их высокую стабильность и планарность. Изменение мезо-атомов азота посредством замещения или расширения кольца может сместить эффективное количество π-электронов. Например, введение дополнительных ненасыщенных фрагментов или гетероатомов может расширить цикличное сопряжение до 20 или 22 электронов, переводя молекулу между ароматичностью по Хюккелю и другими режимами, которые влияют на кольцевые токи и магнитные свойства.

  2. Распределение заряда и граничные орбитали

    Мезо-замещение позволяет настраивать распределение электронной плотности вокруг макроцикла. Электронодонорные группы могут смещать электронную плотность к центру кольца, понижая энергию низшей свободной молекулярной орбитали (НСМО). Электроноакцепторные группы, напротив, стабилизируют высшую занятую молекулярную орбиталь (ВЗМО) и сдвигают окислительно-восстановительные потенциалы в сторону более положительных значений, изменяя как электрохимический профиль, так и положения Q- и B-полос в УФ-видимом спектре.

3. Спектроскопические последствия

  1. УФ-видимое поглощение (Q- и B-полосы)

    Основные особенности поглощения фталоцианинов лежат в видимой (Q-полоса, обычно 600–700 нм) и ближней УФ-области (B-полоса, обычно 300–400 нм).

    Замещение, которое расширяет сопряжение кольца или вводит сильные электронодонорные/акцепторные группы, может:

    • Смещать Q-полосу в сторону больших длин волн (батохромный сдвиг), проникая в ближнюю ИК-область, что весьма желательно для оптоэлектронных и фотодинамических применений.
    • Изменять относительные интенсивности этих полос, а также объединять или расщеплять их, отражая изменения в симметрии и энергиях орбиталей.
  2. ЯМР-спектроскопия и ароматические кольцевые токи

    Модификации количества и распределения π-электронов напрямую наблюдаются в химических сдвигах в спектрах ЯМР 1H и 13C.

    Более сопряженные (или расширенные) ароматические кольца демонстрируют четкие сдвиги в слабое поле для протонов, находящихся внутри индуцированных кольцевых токов, в то время как любая частичная потеря ароматичности или включение антиароматических сегментов может вызывать нетипичные паттерны экранирования/деэкранирования.

4. Реакционная способность и координационная химия

Поскольку фталоцианины часто используются в качестве окислительно-восстановительных катализаторов или сенсоров, модификации мезо-атомов азота могут существенно влиять на реакционную способность:

  • Электронобогатые мезо-заместители облегчают нуклеофильные или электрофильные атаки на периферии кольца, обеспечивая региоселективную функционализацию, которая в противном случае была бы затруднена.

(… сокращено для целей данного рисунка)

Пример критериев оценки
Анализ ограничений традиционного синтеза фталоцианинов (1 балл)
1,0 балл: Корректно объясняет, что традиционный синтез фталоцианинов включает одностадийную конденсацию с одновременным образованием всех мезо-азотных мостиков, что обеспечивает ограниченный контроль над характером замещения в этих положениях.

0,5 балла: Упоминает ограничения традиционных методов, но без особого акцента на проблемах контроля мезо-положений.

0,0 балла: Не может определить ключевые ограничения традиционных подходов к синтезу или дает неверный анализ.

Процесс тетрамеризации с участием тиолятов (1 балл)

1,0 балл: Корректно описывает восстановительную тетрамеризацию с участием тиолятов и объясняет, как размер противоена (K+ или Cs+ против Na+) влияет на селективность между образованием тетрамера и прямой макроциклизацией.

0,5 балла: Упоминает тетрамеризацию с участием тиолятов, но без объяснения факторов, контролирующих селективность.

0,0 балла: Неправильно описывает процесс олигомеризации или опускает критические детали контроля селективности.
Анализ особенностей ЯМР-спектроскопии (1 балл)

1,0 балл: Корректно объясняет, что сдвиги в сильное поле в 16π-системе указывают на паратропный кольцевой ток (антиароматичность), противопоставляет это уширенным сигналам в 17π-системах из-за парамагнетизма и связывает эти наблюдения с лежащими в их основе электронными структурами.

0,5 балла: Определяет базовые паттерны ЯМР, но без чёткой связи с кольцевыми токами или электронной структурой.

0,0 балла: Неправильно интерпретирует данные ЯМР или не связывает спектральные особенности с электронными свойствами.

Анализ электрохимических свойств (1 балл)

1,0 балл: Корректно объясняет, что 16π-система показывает два обратимых восстановления, отражающих переход в 17π-радикальное и 18π-ароматическое состояния, в то время как 17π-системы показывают узкие редокс-зазоры из-за легкого взаимопревращения между 16π-, 17π- и 18π-состояниями, и соотносит эти паттерны с лежащими в их основе электронными структурами.

0,5 балла: Описывает окислительно-восстановительные паттерны без четкой связи с конкретными изменениями электронного состояния.

0,0 балла: Неправильно интерпретирует электрохимические данные или не связывает редокс-поведение с электронными свойствами.

Анализ спектроскопии поглощения (1 балл)

1,0 балл: Корректно объясняет, что 16π-система показывает слабое/широкое поглощение из-за запрещенных по симметрии переходов ВЗМО-НСМО в антиароматических системах, в то время как 17π-системы показывают Q-подобные полосы плюс поглощения в NIR-II, характерные для радикальных частиц, и противопоставляет это типичным спектральным особенностям фталоцианинов.

0,5 балла: Описывает особенности поглощения, но дает ограниченную связь с лежащими в их основе электронными структурами.

0,0 балла: Неправильно интерпретирует данные поглощения или не связывает спектральные особенности с электронными свойствами.

Анализ реакционной способности антиароматической системы (1 балл)

1,0 балл: Корректно объясняет высокую реакционную способность 16π-системы по отношению к нуклеофилам, детализирует специфические реакции с гидроксидом (раскрытие кольца) и гидразином (расширение кольца) и объясняет, как эти превращения снимают антиароматическую дестабилизацию.

0,5 балла: Упоминает реакционную способность, но дает ограниченный анализ конкретных превращений или движущих сил за ними.

0,0 балла: Неправильно анализирует паттерны реакционной способности или не связывает их с антиароматическим характером 16π-системы.

(… и многое другое)

Каждая задача в исследовательском наборе оценивается по критериям, общая сумма которых составляет 10 баллов, и может использоваться экспертом или моделью-оценщиком. Чтобы масштабировать нашу способность оценивать модели, мы используем другую модель для оценки ответов.

Производительность моделей

Мы оценили несколько передовых моделей: GPT‑5.2, Claude Opus 4.5, Gemini 3 Pro, GPT‑4o, OpenAI o4-mini и OpenAI o3 на бенчмарках FrontierScience-Olympiad и FrontierScience-Research. Все рассуждающие модели оценивались при «высоком» уровне усилий рассуждения, за исключением GPT‑5.2 на уровне «xhigh». В наших первоначальных оценках GPT‑5.2 является нашей моделью с наилучшими результатами на FrontierScience-Olympiad (набрав 77%) и Research (набрав 25%), опережая другие передовые модели. Gemini 3 Pro сопоставима с GPT‑5.2 на олимпиадном наборе (набрав 76%).

Мы наблюдаем существенный прогресс в решении вопросов экспертного уровня, особенно в открытых задачах исследовательского типа. Есть еще куда расти: при анализе стенограмм на предмет сбоев передовые модели иногда допускали ошибки в рассуждениях, логике и вычислениях, не понимали нишевые научные концепции и допускали фактические неточности.

Мы сравниваем точность среди нескольких передовых моделей. GPT‑5.2 является нашей наиболее эффективной моделью в наборах FrontierScience-Research и Olympiad.

Мы сравниваем точность в зависимости от усилий рассуждения для GPT‑5.2 и o3. Большее время размышлений приводит к повышению точности.

Ограничения и что дальше

Хотя FrontierScience представляет собой шаг вперед в сложности научных бенчмарков, он по-прежнему имеет множество ограничений. FrontierScience состоит из вопросов с ограниченной постановкой задачи, которая фокусируется на оценке финального ответа (Olympiad) или оценке рассуждений для выполнения исследовательской задачи (Research). Кроме того, использование критериев с несколькими компонентами для более длительных задач менее объективно, чем проверка окончательного ответа. 

FrontierScience предлагает снимок с более высоким разрешением рассуждений моделей по сложным вопросам, написанным экспертами, но не дает полной картины того, как наука делается на практике. В частности, он не оценивает значительную часть научных исследований: то, как модели генерируют подлинно новые гипотезы или взаимодействуют с несколькими модальностями, включая видеоданные и реальные экспериментальные системы в физическом мире.

Заглядывая в будущее, мы ожидаем, что прогресс в научных рассуждениях будет происходить как за счет улучшения систем рассуждений общего назначения, так и за счет целенаправленных усилий по улучшению научных возможностей. FrontierScience — это лишь один из многих инструментов, и по мере совершенствования моделей мы планируем итеративно улучшать этот бенчмарк, расширять его на новые домены и дополнять более реальными оценками, которые смотрят на то, что эти системы действительно позволяют делать ученым. Такие бенчмарки, как FrontierScience, помогают нам понять слабые стороны сегодняшних систем ИИ, чтобы сосредоточить нашу работу на том, чтобы сделать модели надежными партнерами в научных открытиях.

Автор

OpenAI

Полный текст статьи читайте на OpenAI