Представляем LifeSciBench

Бенчмарк, созданный и проверенный экспертами на основе реальных исследований в области наук о жизни

Читать документ

Агентные системы искусственного интеллекта (ИИ) становятся всё более способными выполнять научные задачи. Однако их полезность для исследователей в области наук о жизни зависит от того, насколько успешно они справляются со сложностью реальных исследований. Такая работа редко сводится к простому вопросу на воспроизведение фактов или аккуратной задаче на предсказание. Исследователи интерпретируют неполные данные, согласовывают противоречивые результаты, проектируют сложные эксперименты, устраняют неполадки в анализах, оценивают трансляционные риски и принимают решения о дальнейших действиях в условиях неопределенности.

Существующие бенчмарки не в полной мере отражают эти возможности. Многие оценки в сфере наук о жизни сосредоточены на узких областях или изолированных навыках, что приводит к вопросам с фиксированной структурой и четкими эталонными ответами. Несмотря на их ценность, они часто не позволяют по-настоящему оценить, способна ли модель внести свой вклад во всем спектре исследовательской работы.

Мы разработали LifeSciBench, чтобы помочь устранить этот пробел. Каждая задача опирается на экспертное мнение практикующих специалистов в области наук о жизни со степенью кандидата наук (Ph.D.) и непосредственным опытом продвижения программ разработки лекарств в биотехнологической и фармацевтической отраслях.

LifeSciBench включает 750 задач, созданных экспертами и охватывающих семь рабочих процессов и семь биологических областей.

1,062

Артефактов задач

173

Ученых-авторов

19,020

Критериев оценки

453

Эксперта-рецензента

Что измеряет LifeSciBench

LifeSciBench оценивает, способны ли системы ИИ поддерживать реалистичные научные исследования в области наук о жизни, а не просто отвечать на вопросы по биологии. Чтобы определить таксономию бенчмарка, мы опросили практикующих ученых о рабочих процессах, которые они чаще всего используют в прикладных исследованиях. Затем мы объединили их ответы в семь повторяющихся категорий: работа с доказательствами, анализ, проектирование и оптимизация, научное обоснование, валидация и операции, трансляция и научные коммуникации.

Каждая задача структурирована как запрос, который ученый мог бы дать знающему коллеге: научный промпт, любые сопутствующие контексты или артефакты, а также ответ в свободной форме. Разработанные экспертами критерии оценивают, способна ли модель выдать правильный ответ на конкретную проблему с нужным уровнем детализации, обоснования, оговорок и форматирования, которого ожидает ученый.

Формирование набора данных

LifeSciBench оценивает научное мышление наряду с менее формализованными практическими навыками, необходимыми для реальной научной работы. Задачи предлагают моделям прорабатывать реалистичные исследовательские проблемы: интерпретировать доказательства, принимать обоснованные в рамках предметной области решения и формулировать выводы, которые были бы полезны экспертам-рецензентам. Многие задачи также требуют от моделей работы с неопределенностью и анализа вспомогательных файлов данных, а не опоры исключительно на текст промпта.

Бенчмарк разработан так, чтобы отражать сложность работы в области наук о жизни. В целом 79% задач требуют нескольких шагов логического рассуждения или принятия решений (в среднем четыре шага на задачу). LifeSciBench включает 1,062 прикрепленных артефакта, включая рисунки, PDF-файлы, таблицы, файлы последовательностей, файлы структур или химических соединений, а также веб-ссылки. Более половины задач (53%) требуют от моделей интерпретации или синтеза информации как минимум из одного артефакта.

Задачи были созданы 173 учеными-экспертами из различных дисциплин наук о жизни. Каждый ученый имел степень кандидата наук (Ph.D.) и опыт работы в биотехнологической или фармацевтической промышленности. Задачи проходили столько циклов доработки, сколько требовалось до их принятия, без фиксированного ограничения на количество раундов; принятые задачи в среднем проходили шесть самостоятельных автоматизированных циклов рецензирования и завершили по меньшей мере два раунда экспертной оценки. Рецензирование опиралось либо на проверяемый правильный ответ, либо на сильный экспертный консенсус при согласии не менее 90% рецензентов в соответствующей области. Этот процесс помог гарантировать, что принятые задачи имеют научное обоснование, достаточно четки для оценивания и репрезентативны для прикладных исследований.

Diagram showing LifeSciBench tasks that combine life-science data sources such as genomic sequences, molecular structures, figures, documents, spreadsheets, and web links with multi-step reasoning and expert review.

Система оценивания и детализация критериев

Задачи LifeSciBench оцениваются с помощью детальной системы критериев для конкретной задачи, которая разбивает ожидаемый ответ на конкретные научные утверждения, расчеты, решения, обоснования и т. д. В рамках бенчмарка разработанные экспертами критерии включают 19 020 параметров — в среднем 25 на задачу — для оценки как научной правильности, так и полезности для принятия исследовательских решений.

Этот подход отражает то, как научная работа оценивается на практике: многие задачи в области наук о жизни не могут быть оценены простой проверкой финального ответа. Ответ может прийти к верному общему выводу, но все равно считаться неполным, если, например, он упускает ключевое ограничение анализа или не учитывает важные биологические нюансы. И наоборот, частичный ответ может содержать высококачественные рассуждения, даже если он не полностью решает задачу.

Детализированные критерии учитывают эти нюансы. LifeSciBench оценивает не только точность конечного ответа, но и то, приходит ли модель к своему ответу научно обоснованным и практически полезным путем.

Валидация LifeSciBench

Мы проверили LifeSciBench посредством независимой экспертной оценки. Отзывы поступили от 453 рецензентов, которые не участвовали в написании задач. Из этих рецензентов 97% имели степень кандидата наук (Ph.D.) или эквивалентную докторскую степень, в среднем 12 лет опыта работы в данной сфере и 14 публикаций в рецензируемых журналах; 88% сообщили, что получили хотя бы одну награду или грант.

Рецензенты оценивали, насколько каждая задача отражает качества, необходимые для сильного вопроса бенчмарка: соответствие реальной исследовательской работе, надлежащая проверка научных рассуждений и экспертных знаний в предметной области, опора на доказательства или экспертный консенсус, а также общая полезность для оценки производительности моделей. Согласие превысило 96% в каждой категории.

Релевантность реальному миру

Отражает ли эта задача реалистичную работу в области наук о жизни?

Полностью согласны90.4%
В целом согласны98.3%

Научные рассуждения / навыки в предметной области

Проверяет и оценивает ли эта задача правильные навыки научного мышления и знания в области наук о жизни?

Полностью согласны86.4%
В целом согласны98.1%

Научное обоснование

Имеет ли эта задача научное обоснование, допускает ли она решение и опирается ли на соответствующие доказательства, данные, артефакты или экспертный консенсус?

Полностью согласны77.1%
В целом согласны96.5%

Общая полезность

В целом, является ли это сильной задачей для оценки в области наук о жизни?

Полностью согласны79.1%
В целом согласны96.6%

Комментарии рецензентов подтвердили количественные оценки:

1 из 3
»В целом это сильная задача, так как у нее есть одна правильная основная интерпретация, и при этом остается возможность различать лучшие ответы по тому, насколько тщательно они ограничивают неопределенность.»

Результаты

Мы приводим две взаимодополняющие метрики. Процент успешного прохождения (pass rate) — это доля задач, по которым модель достигает порогового значения успеха на уровне задачи в 70%. Оценка (score) представляет собой средний балл по критериям, дающий частичные баллы за отдельные критерии, даже если вся задача не решена полностью. Обе метрики важны, поскольку ответ на научную задачу может быть частично правильным или полезным без удовлетворения каждого требования для полного ответа.

Производительность моделей существенно различается в зависимости от типа задачи, рабочего процесса и формата ответа.

В каких областях системы ИИ демонстрируют первые успехи

LifeSciBench показывает, что передовые модели относительно сильнее всего справляются с задачами, связанными с научным синтезом, коммуникацией и структурированной интерпретацией. Абсолютные показатели успешности все еще скромны, поэтому эти области бенчмарка далеки от насыщения, однако GPT‑Rosalind демонстрирует значительный прогресс по сравнению с GPT‑5.5, повышая общий показатель точного прохождения с 25.7% до 36.1%.

Наиболее заметные направления развития возможностей моделей наблюдаются в научных коммуникациях и трансляции (переносе разработок). Например, процент успешного прохождения для научных коммуникаций увеличивается с 56.3% у GPT‑5.5 до 71.1% у GPT‑Rosalind; эта категория мала (n=9), поэтому к результату следует относиться с осторожностью, но он говорит о том, что передовые модели быстро совершенствуют свою способность организовывать данные и производить убедительные объяснения, ориентированные на экспертов. Трансляция (процесс разработки лекарств по схеме «из лаборатории в клинику») демонстрирует аналогичную тенденцию: показатель вырастает с 36.8% для GPT‑5.5 до 57.7% для GPT‑Rosalind, что указывает на быстрое улучшение способности моделей связывать доклинические данные с клиническими последствиями.

Результаты на уровне критериев указывают в том же направлении. По задачам, требующим полезных для экспертов или применимых на практике результатов, GPT‑Rosalind набирает 44.7% по сравнению с 29.1% у GPT‑5.5. По задачам, требующим работы с неопределенностью и оговорками, модель набирает 44.8% по сравнению с 29.3%. Эта закономерность предполагает, что модели наиболее полезны, когда задача имеет четкие границы доказательств и требует структурированного научного суждения.

GPT‑Rosalind лидирует по производительности в научно ценных задачах, определенных экспертами из промышленности и академических кругов.

GPT‑Rosalind превосходит GPT‑5.5 в ключевых рабочих процессах наук о жизни, демонстрируя наибольший прирост в области перевода и научной коммуникации.

В чем системы ИИ по-прежнему уступают

Производительность остается значительно ниже в научной работе, насыщенной артефактами, требующей сложного проектирования и имеющей операционные ограничения. А именно: задачи проектирования, оптимизации и прогнозирования (Design, Optimization, & Prediction) остаются одними из самых сложных рабочих процессов, где доля успешных решений GPT‑Rosalind составляет 30,7%; анализ (Analysis) дается с трудом в равной степени — 30,3%.

Работа с артефактами представляет собой особенно заметный пробел. Хотя GPT‑Rosalind работает лучше, чем GPT‑5.5, в условиях высокой насыщенности артефактами, ее доля успешных решений все же падает с 45,1% на задачах, содержащих только текст, до 28,1% на задачах с артефактами или URL-адресами. GPT‑5.5 демонстрирует ту же тенденцию: показатель снижается с 29,9% до 21.9%. Более детальный анализ подтверждает, что передовые модели испытывают трудности с извлечением информации из сложных схем или больших файлов последовательностей и интеграцией этой информации в итоговый ответ.

Доля успешных решений снижается, когда задачи требуют обоснования на основе источников или работы с артефактами

Формат ответа также имеет значение. Задачи, требующие точных результатов на уровне последовательностей, структур или генетических конструктов, показывают более низкие показатели успешности: GPT‑Rosalind достигает лишь 14,8% в числовых задачах и 24,0% при выводе последовательностей или структур. Задачи на создание конструктов также оказываются сложными для выполнения: у GPT‑Rosalind этот показатель составляет 27,3%, что демонстрирует лишь незначительное улучшение по сравнению с GPT‑5.5. Частично этот разрыв может отражать более строгие критерии оценки для задач с точным ответом, где небольшие расхождения в вычислениях или форматировании могут привести к тому, что ответ не пройдет пороговое значение. Тем не менее, эти сбои имеют важное научное значение, поскольку многие рабочие процессы в науках о жизни требуют результатов, достаточно точных для их непосредственного использования, например, при разработке доноров для CRISPR/HDR или проектировании сиРНК.

Модели также часто справляются с задачей лишь частично, не решая ее полностью. Примерно в 14% задач модели получили существенные баллы по критериям оценки, несмотря на то, что не преодолели порог полного прохождения. У GPT‑Rosalind было 109 задач с долей успешных решений ниже 20%, при этом они заработали как минимум 50% баллов по рубрике. На практике это означает, что модели могут определить релевантные доказательства или выдать правдоподобный частичный ответ, но все равно потерпеть неудачу из-за упущения ключевого ограничения, использования неверных данных, неполного расчета или неумения связать свои рассуждения с научно применимым окончательным решением.

Ограничения и дальнейшие шаги

LifeSciBench — это шаг на пути к оценке полезности систем ИИ для исследований в области наук о жизни, однако он не заменяет изучение моделей в условиях реальных исследований. Бенчмарк сосредоточен на автономных задачах, отражающих повторяющиеся рабочие процессы индустрии, в то время как многие научные специализации и типы задач остаются за пределами его текущей сферы применения. Реальные исследования носят итеративный характер: ученые собирают новые данные, пересматривают гипотезы, планируют дополнительные эксперименты и корректируют свои планы по мере появления результатов.

Высокие показатели на LifeSciBench следует расценивать как свидетельство реалистичных возможностей на уровне отдельных задач, а не как прямую мера влияния на исследования в перспективе. Бенчмарк опирается на промышленные рабочие процессы, но он не отражает все многообразие или динамику реальных исследовательских программ, где прогресс зависит от факторов, развивающихся во времени.

Следующим шагом станет увязка результатов бенчмарка с исследованиями внедрения в реальные рабочие процессы. Хотя LifeSciBench создавался при участии практикующих ученых, для оценки того, ускоряют ли системы ИИ открытия или улучшают результаты R&D, потребуется изучить использование и производительность моделей в реальных исследовательских условиях — на более длительных временных горизонтов и через множество циклов рассуждений, обратной связи и экспериментальной доработки.

Присоединяйтесь

Помогите сформировать следующее поколение бенчмарков ИИ для наук о жизни или запросите доступ к GPT-Rosalind.
Присоединиться в качестве участникаЗапросить доступ

Автор

OpenAI

Полный текст статьи читайте на OpenAI