Научные вычисления в эпоху агентного ИИ
В отчете с «полей» рассказывается о том, как ученые используют агентов для написания кода с целью модернизации научного программного обеспечения в области геномики и других насыщенных данными дисциплин.
Научные вычисления служат основой современных исследований как в академических кругах, так и в промышленности. Тем не менее программное обеспечение, необходимое для анализа научной информации, с трудом поспевает за стремительными темпами генерации данных. Многие широко используемые исследовательские инструменты зарождались как код, прилагающийся к научной статье и созданный небольшими академическими командами с ограниченным опытом в области инженерии и минимальным временем на упаковку, тестирование, оптимизацию или долгосрочную поддержку. Результатом становится научная инфраструктура, которая часто зависит от медленных, хрупких рабочих процессов, требующих постоянного обслуживания. Эти ограничения сдерживают темпы открытий.
ИИ-агенты начинают менять это соотношение сил. Снижая издержки на инженерную работу и беря на себя рутинные задачи по реализации, они помогают исследователям быстрее создавать прототипы идей, реализовывать проекты, которые раньше казались непрактичными, и проще поддерживать программное обеспечение в долгосрочной перспективе. В результате научное ПО становится более эффективным и качественным, что позволяет ученым уделять больше времени исследованиям и открытиям.
Мы публикуем ознакомительный отчет о восьми проектах в области научных вычислений с поддержкой агентов, ориентированных преимущественно на науки о жизни: в пяти из них использовался только Codex, а в трех — комбинация Codex и Claude Code. В отчете собраны тематические исследования (кейс-стади), написанные командами разработчиков каждого проекта, и выделены общие закономерности. Проекты варьируются от рутинного обслуживания и целевой оптимизации до масштабной миграции языков программирования и перепроектирования под нативные GPU. Участники отмечают, что агенты существенно ускорили разработку и поддержку программного обеспечения, а в некоторых случаях помогли небольшим командам справиться с работой, которая потребовала бы гораздо больше времени или специализированной инженерной поддержки. Тем не менее они также указывают на сохраняющуюся проблему установления четкой долгосрочной ответственности и управления созданными инструментами.
Авторы единодушно описывают смещение роли исследователей от реализации к верификации и оркестрации: постановка задачи, определение критериев правильности и принятие решений о готовности проекта к релизу. В этой новой модели исследователи сохраняют контроль над научным направлением и планкой качества, но получают прирост скорости за счет помощи агентов.
Тематические исследования
Повторяющиеся темы
Хотя проекты значительно различались по масштабу, они показали, что агенты для написания кода делают инженерный труд и экспертизу менее дефицитными ресурсами в научных вычислениях. Теперь узким местом стала проверка результатов работы ИИ-агента, которая по-прежнему зависит от человеческого суждения.
В ходе тематических исследований агенты эффективно справлялись с конкретными, четко очерченными запросами, но не могли надежно оценить, является ли их работа научно обоснованной или отвечает ли она ожиданиям. Более того, агенты часто демонстрировали уверенность даже тогда, когда их код содержал явные ошибки. Поэтому рецензентам-людям требовалось находить надежные способы проверки результатов. Наиболее эффективные подходы использовали внешние эталоны или измеримые целевые показатели приемки, такие как полное совпадение выходных данных, паритет с существующим инструментом, корректное статистическое поведение или ответы, заранее полученные с использованием симулированных данных.
Еще одной повторяющейся темой стало то, что проекты в целом продвигались поэтапно, с использованием итераций на основе обратной связи, а не в рамках одномоментного подхода. Участники разбивали глобальные цели на более мелкие изменения, а затем использовали промежуточные бенчмарки и тестовые системы для оценки и доработки работы агентов. Агенты часто быстро выдавали первичную реализацию, но устранение крайних случаев (edge cases) и тонких числовых различий занимало гораздо больше времени. Прохождение «последней мили» реализации зачастую требовало наибольших усилий.
В целом эти тематические исследования показывают, что агенты позволяют исследователям тратить меньше времени на реализацию и больше времени на руководство научной работой. Люди определяют цель, делят сложные проекты на управляемые части и судят о том, являются ли результаты научно обоснованными. Смягчая давние инженерные ограничения, агенты расширяют возможности того, что могут создавать исследователи, освобождая их для решения наиболее важных научных вопросов и задач.
Долгосрочное управление по-прежнему имеет решающее значение
Пробел в поддержке и обслуживании исследовательского программного обеспечения долгое время замедлял итерации и ограничивал воспроизводимость и надежность. Опубликованные исследования »исследовательского кода» и инструментов омикс-анализа показали, что опубликованное ПО часто не удается нормально установить в новой вычислительной среде или запустить в соответствии с документацией, из-за чего исследователи вынуждены тратить массу времени на конфигурацию и отладку. Даже рутинные улучшения могут сэкономить исследователям время и снизить требования к вычислительным ресурсам, в то время как рефакторинг на основе производительности и переписывание кода могут принести еще большую отдачу.
Но снижение затрат на реализацию также облегчает создание множества похожих вариантов переписанного кода, что приводит к фрагментации пользователей и распылению экспертного внимания, необходимого для поддержания надежности каждого отдельного инструмента. Это делает долгосрочное управление (stewardship) и атрибуцию крайне важными. Зрелое научное программное обеспечение несет в себе недокументированные соглашения, требования к совместимости и доверие пользователей, которые невозможно воспроизвести путем простого перевода исходного кода.
Тематические исследования иллюстрируют несколько возможных путей движения вперед. Изменения в MHCflurry и cyvcf2 были внедрены в их исходные апстрим-проекты (upstream), в то время как rustar-aligner перешел под управление нового сообщества, поскольку первоначальный проект был заброшен. Если возможна координация с существующими мейнтейнерами (сопровождающими), ее следует начинать как можно раньше. Когда требуется отдельная реализация, для нее нужен четкий владелец и надежный план обслуживания. Без этого современный вариант переписанного сегодня кода может завтра превратиться в заброшенный проект, а не в надежную научную инфраструктуру.
На пути к более долговечному научному ПО
Данный отчет с полей носит ретроспективный и исследовательский характер, однако представленные кейсы указывают на практический сдвиг в том, как разрабатывается научное ПО. Агенты для написания кода, такие как Codex, могут значительно снизить стоимость обслуживания, миграции, оптимизации и реализации новых возможностей. Их долгосрочная научная ценность по-прежнему зависит от решений человека в отношении того, что строить, как это проверять и кто будет это обслуживать. Более глубокое изменение заключается не просто в том, что исследователи могут производить больше программного обеспечения, а в том, что они могут сосредоточить больше усилий на определении, проверке и управлении инструментами.
Эти тематические исследования показывают, что агенты уже способны ускорить темпы итераций в научных вычислениях. По мере совершенствования агентов кодинга исследователи смогут тратить меньше времени на поддержание работоспособности конвейеров анализа и больше времени — на развитие своих областей науки.
Автор
Полный текст статьи читайте на OpenAI
