Представляем GeneBench-Pro

Бенчмарк исследовательского уровня для оценки того, как ИИ-агенты преодолевают неопределенность и принимают важные решения в области вычислительной биологии.

Читать научную статью

Научные данные редко сопровождаются инструкциями. Исследователи должны решать, отражает ли паттерн биологические особенности или случайный шум, могут ли данные подтвердить поставленный вопрос и как каждый результат должен повлиять на их дальнейшие действия. ИИ-агенты все лучше справляются с выполнением сложного анализа, однако реальные научные исследования зависят не только от способности воспроизводить факты или следовать заранее определенному рабочему процессу, но и от принятия решений более высокого порядка.

Сегодня мы представляем GeneBench-Pro — сложный бенчмарк исследовательского уровня, предназначенный для проверки того, способны ли модели справляться с анализом, требующим экспертных суждений, которые необходимы в реальной вычислительной биологии. Он расширяет возможности GeneBench, охватывая более сложные и реалистичные задачи в области геномики, количественной биологии и трансляционной медицины, отражая всю сложность, итеративный характер и неоднозначность научных исследований в вычислительной биологии. 

На сегодняшний день проводилось мало убедительных оценок способности ИИ принимать системные экспертные решения, которые и делают реальные вычислительные исследования сложными. К ним относятся работа с неопределенностью, пересмотр предположений, выбор правильного пути анализа и понимание того, когда результат готов к принятию решений. Поскольку эти навыки трудно формализовать, их также сложно строго оценить, несмотря на то, что слабость в этих аспектах все сильнее ограничивает общую производительность ИИ.

Diagram titled

GeneBench-Pro разработан для точного измерения этих способностей более высокого порядка. В рамках GeneBench-Pro мы определяем «исследовательский вкус» как цепочки экспертных решений, которые формируют анализ: какие вопросы могут быть подкреплены данными, как ранняя диагностика должна изменить модель или оцениваемый параметр (эстиманд) и когда первоначальный план нуждается в пересмотре. Каждая задача GeneBench-Pro предоставляет модели реалистичный и несовершенный набор данных, краткий экспериментальный контекст и целевой эстиманд, привязанный к принятию дальнейших решений. Чтобы ответить правильно, модель должна исследовать данные, выбрать подходящий подход к анализу, пройти через итеративный процесс экспериментирования и выдать окончательный ответ.

Создание датасета

В биологии стоимость генерации данных (например, секвенирования генома) резко снизилась, и некоторые исследователи утверждают, что ограничивающим фактором теперь является не сбор образцов, а последующие вычисления и анализ. GeneBench-Pro создан для оценки прогресса в преодолении этого узкого места и включает 129 вопросов, охватывающих широкий спектр задач и методов вычислительной биологии.

Атлас доменов: 129 задач в 10 доменах и 21 поддомене

Нажмите на точку выше, чтобы узнать о задаче из бенчмарка.

Этот атлас дает представление о масштабах GeneBench-Pro. Посетите страницу с примерами из практики, чтобы подробнее изучить 10 показательных вопросов.

GeneBench-Pro также создан с учетом предотвращения распространенных ошибок бенчмарков. Во многих долгосрочных биологических бенчмарках многоэтапные вопросы строятся на основе «сырых» исторических датасетов, где может не быть единственно верного пути анализа. Один агент может выбрать один обоснованный порог отсечения, а другой — иной, но столь же обоснованный вариант, что отражает произвольные решения создателя бенчмарка в большей степени, чем любые фундаментальные различия в производительности моделей. Может произойти и обратное: если проблема слишком нечувствительна к числовым значениям, агент может совершить фундаментальные ошибки в анализе и все равно получить проходной результат.

Чтобы избежать подобных проблем, каждая задача в GeneBench-Pro создается синтетически: мы знаем всю причинно-следственную структуру и напрямую симулируем процесс генерации данных. Это позволяет нам настраивать сложность каждой задачи, гарантировать, что разумные различия в субъективных аналитических решениях все равно приводят к принятым числовым результатам, и проверять (с помощью абляционных исследований), что правдоподобные, но неверные варианты анализа терпят неудачу. Затем мы проверяем черновые варианты задач с помощью детального анализа последовательностей (трассировки), чтобы выявить утечки информации и непредусмотренные пути решения. Это дает нам уверенность в том, что правильный ответ зависит от выбора верного аналитического пути, а не от использования обходных путей или подгонки под субъективные предпочтения автора.

Diagram titled

Мы направили 82 из 129 вопросов GeneBench-Pro внешним профильным экспертам, включая аспирантов, постдоков, ученых из индустрии и профессоров. Рецензенты оценили каждую задачу на реалистичность, определимость целевого ответа, а также корректность методов и оценок. Полученные отзывы были использованы для доработки задач.

»Задачи, которые я рецензировал, оказались бы сложными для аспиранта без регулярной обратной связи от опытного научного руководителя. Данные содержали технические проблемы и проблемы контроля качества, которые требовали вдумчивого и рефлексивного анализа данных с пониманием потенциальных подводных камней для успешного завершения; это было не просто применение готового метода к чистым и хорошо отлаженным данным.»
Александр Срудвик Янг, доцент кафедры генетики человека в Калифорнийском университете в Лос-Анджелесе (UCLA)
»Даже если современные модели пока не способны надежно выполнять независимый анализ от начала до конца, те из них, которые хорошо справляются с задачами GeneBench-Pro, несомненно, смогли бы помочь исследователям в определении правильных рабочих процессов и исследовании данных. Я вижу, что это способно существенно повысить скорость, тщательность и воспроизводимость исследований.»
Дженнифер Грундман, кандидат наук (PhD) по генетике человека в UCLA
1 из 2
»Задачи, которые я рецензировал, оказались бы сложными для аспиранта без регулярной обратной связи от опытного научного руководителя. Данные содержали технические проблемы и проблемы контроля качества, которые требовали вдумчивого и рефлексивного анализа данных с пониманием потенциальных подводных камней для успешного завершения; это было не просто применение готового метода к чистым и хорошо отлаженным данным.»
Александр Срудвик Янг, доцент кафедры генетики человека в UCLA

Оценка и грейдинг

Каждая задача в GeneBench-Pro представляет собой самостоятельный научный анализ. Агенты получают доступ к изолированной рабочей среде с короткой подсказкой (промптом), файлами данных и стандартным набором биоинформатических инструментов, включая Python, библиотеки для научных вычислений и базовые геномные пакеты вроде PLINK 2.0 (хотя задачи не требуют применения узкоспециализированного софта).

Поскольку мы контролируем весь процесс генерации данных, мы можем оценивать правильность детерминированно по известным целевым значениям, избегая вариативности выбора моделей и эффектов многословности, характерных для стандартной оценки по критериям (рубрикам).

Каждая задача также сопровождается подробными метаданными, включая предполагаемую структуру анализа, приложенные файлы данных, детальный многостраничный анализ конкретного кейса и результаты экспертной оценки. Мы полностью открываем исходный код 10 показательных вопросов GeneBench-Pro на платформе Hugging Face, а также предоставляем интерактивный веб-интерфейс для их просмотра. Наконец, в ближайшем будущем мы предоставим подмножество из 50 вопросов компании Artificial Analysis для независимого стороннего бенчмаркинга.

Результаты

Наша сильнейшая модель на момент тестирования, GPT‑5.6 Sol, демонстрирует процент успешного прохождения на уровне 28,7% при максимальном уровне рассуждений (31,5% с включенным режимом Pro). Это резкий рост по сравнению с тем моментом, когда мы только начали создавать оригинальный GeneBench; тогда наша лучшая передовая модель, GPT‑5, набирала менее 5%. Прогресс в этом бенчмарке говорит о том, что передовые модели быстро совершенствуются даже в менее осязаемых научных рассуждениях на системном уровне. При текущих темпах этот бенчмарк может быть исчерпан к концу года.

Результаты также демонстрируют влияние масштабирования вычислений во время тестирования (test-time compute). На самом низком уровне рассуждений GPT‑5.6 Sol показывает лишь однозначный процент успешных ответов. На самом высоком уровне рассуждений GPT‑5.6 Sol решает почти в шесть раз больше вопросов, чем GPT‑5.2, используя при этом примерно на треть меньше токенов.

Сравнение различных семейств моделей показывает, что модели GPT входят в число сильнейших систем в области научных рассуждений высокого уровня в условиях количественной неопределенности. Разрыв в производительности между GPT‑5.6, GPT‑5.5 и ведущими моделями с открытым исходным кодом, такими как GLM 5.2, значительно больше, чем можно было бы ожидать при экстраполяции на основе бенчмарков по программированию, что указывает на большую специализированность моделей с открытым исходным кодом на кодинге, а не на общих способностях к рассуждениям.

Мы использовали передовые модели GPT для оценки и доработки задач в процессе разработки. Из-за этого мы подозревали, что GeneBench-Pro может быть предвзят по отношению к моделям GPT по сравнению с другими семействами моделей. Тем не менее, модели конкурентов в лучшем случае соответствовали производительности соответствующей модели GPT на момент выпуска, а зачастую значительно отставали.

Эти результаты оценки — достигающие 31.5% на GPT‑5.6 Sol (Pro) — поразительны, учитывая сложность вопросов GeneBench-Pro. В ходе опроса наши рецензенты оценили, что на решение типичной задачи GeneBench-Pro у эксперта-человека ушло бы около 20–40 часов. При консервативной оценке в 200 долларов в час затраты на человеческий труд для решения одной задачи исчисляются тысячами долларов. Существующие ИИ-агентные системы все еще слишком ненадежны, чтобы заменить экспертов-людей, но разница в стоимости огромна: затраты на вывод составляют всего несколько долларов на задачу. Это означает, что даже частичная автоматизация при текущих возможностях может создать существенную экономическую и научную ценность.

»Бенчмарки мотивированы самыми разными биологическими вопросами, но… реальная сложность заключается ввеличине и глубине разведочного анализа данных и рассуждениях на основе этих открытий: выявлении закономерностей и артефактов, а также принятии решений о том, следует ли исключить или скорректировать данные. Это напоминает хаотичную природу реальных биологических наборов данных. Анализ этих оценок подчеркивает, насколько важны четкие контракты для решателей при решении научных задач на основе агентов. Различная формулировка подсказок (промптов) или спецификация задач могут сильно повлиять на то, какие виды анализа считаются допустимыми.»
Сириллус Тан (Cyrillus Tan), научный сотрудник в постдокторантуре Нью-Йоркского геномного центра
»В целом [вопросы] мне понравились. Они обычно сочетали в себе: (1) Необходимые знания предмета, например, смещение C>T в древней ДНК, (2) Несоответствия в данных, такие как подмена происхождения, (3) Знание правильных аналитических инструментов для работы и методов их реализации. Похоже, большинство агентов провалились на пункте (2). Они недостаточно осторожны с проблемами в данных. Возможно, это подчеркивает слабость современных моделей. А в биологических данных немало нерегулярностей.»
Лекс Флагел (Lex Flagel), директор по науке о данных в Gencove
1 из 2
»Бенчмарки мотивированы самыми разными биологическими вопросами, но… реальная сложность заключается в разведочном анализе данных и рассуждениях на основе этих открытий: выявлении закономерностей и артефактов, а также принятии решений о том, следует ли исключить или скорректировать данные. Это напоминает хаотичную природу реальных биологических наборов данных. Анализ этих оценок подчеркивает, насколько важны четкие контракты для решателей при решении научных задач на основе агентов. Различная формулировка подсказок или спецификация задач могут сильно повлиять на то, какие виды анализа считаются допустимыми.»
Сириллус Тан (Cyrillus Tan), научный сотрудник в постдокторантуре Нью-Йоркского геномного центра

Тем не менее, тот факт, что передовые модели по-прежнему решают менее трети этих задач, показывает наличие огромного пространства для улучшений. Модели могут добиваться частичного прогресса в решении сложных задач, но им трудно замкнуть цикл выводов (inferential loop). Этот паттерн неудач отражает контракт между экспертами-людьми и новичками. Эксперты используют свой опыт для постановки проблемы и адаптации своего подхода, в то время как новички делают наблюдения, но с трудом интегрируют их в более широкий контекст задачи.

Для достижения практически безупречной производительности потребуются оценки, которые одновременно надежно измеряют прогресс и выявляют области, где модели все еще терпят неудачу. Такие бенчмарки, как GeneBench-Pro, могут помочь превратить расплывчатый недостаток возможностей в то, что мы можем диагностировать и улучшить.

Если агенты смогут надежно автоматизировать этот класс анализа, они смогут значительно ускорить научные открытия. Данные генетики человека уже играют центральную роль в приоритизации терапевтических мишеней и последующей трансляционной работе, поскольку механизмы с генетической поддержкой гораздо чаще приводят к одобренным методам лечения.

Между тем, стоимость секвенирования резко упала, а наборы данных масштаба биобанков теперь объединяют молекулярную, фенотипическую информацию и данные медицинских карт с беспрецедентной полнотой. Ограничивающий фактор смещается от генерации данных к превращению информации в применимые на практике инсайты. Модели, способные последовательно выполнять анализ, который сейчас выполняют группы экспертов-людей, могут трансформировать промышленные исследования, ускоряя отбор гипотез, доработку мишеней и итерационный цикл между генерацией данных и принятием решений.

GeneBench-Pro представляет собой первую попытку оценить более абстрактные навыки, связанные с хорошим научным суждением, которым обладают опытные специалисты. Эти навыки позволяют им интуитивно понимать и определять наиболее перспективные первичные анализы, выполнять итерации и пересматривать свои соображения, когда данные противоречат исходным предположениям, и приходить к выводам, от которых могут зависеть дальнейшие клинические, академические или бизнес-решения.

Мы предполагаем, что по мере совершенствования возможностей моделей бенчмарки, проверяющие способности моделей на этих более высоких уровнях абстракции, станут все более полезными — помимо тех, которые просто проверяют знание учебников или способность выполнять рутинные анализы.

Автор

OpenAI

Полный текст статьи читайте на OpenAI