Оценка способности ИИ ускорять биологические исследования в «мокрой» лаборатории

GPT‑5 создала новые усовершенствования протоколов для «мокрых» лабораторий, повысив эффективность протокола молекулярного клонирования в 79 раз.

Collage-style graphic with soft blue–orange gradients, a DNA assembly diagram, and bold text reading

Ускорение научного прогресса — один из самых ценных способов, с помощью которого ИИ может принести пользу человечеству. С выходом GPT‑5 мы начинаем замечать первые признаки этого: не только в помощи исследователям быстрее ориентироваться в научной литературе, но и в поддержке новых форм научного рассуждения, таких как выявление неожиданных связей, предложение стратегий доказательства или выдвижение правдоподобных механизмов, которые эксперты могут оценить и проверить.

Прогресс на сегодняшний день наиболее заметен в таких областях, как математика, теоретическая физика и теоретическая информатика, где идеи можно строго проверить без проведения физических экспериментов. Биология устроена иначе: большинство достижений зависят от практического выполнения экспериментов, итераций и эмпирической валидации в лаборатории.

Чтобы понять, как передовые модели ведут себя в таких условиях, мы сотрудничали со стартапом в области биобезопасности Red Queen Bio для создания среды оценки, которая проверяет, как модель предлагает, анализирует и итерирует идеи в «мокрой» лаборатории. Мы настроили простую экспериментальную систему молекулярной биологии и поручили GPT‑5 оптимизировать протокол молекулярного клонирования с точки зрения эффективности.

За несколько раундов экспериментов GPT‑5 внедрила новый механизм, который повысил эффективность клонирования в 79 раз. Клонирование — это фундаментальный инструмент молекулярной биологии. Эффективность методов клонирования имеет решающее значение для создания больших сложных библиотек, играющих центральную роль в белковой инженерии, генетических скринингах и инженерии штаммов организмов. Этот проект дает представление о том, как ИИ может работать бок о бок сбиологами для ускорения исследований. Улучшение экспериментальных методов поможет ученым работать быстрее, снизить затраты и воплощать открытия в реальные практические результаты.

Поскольку успехи в биологических рассуждениях имеют значение для биобезопасности, мы провели эту работу в строго контролируемых условиях — используя безопасную экспериментальную систему, ограничивая масштаб задачи и оценивая поведение модели для формирования наших оценок рисков биобезопасности и разработки средств защиты на уровне модели и системы, как описано в нашей методологии обеспечения готовности (Preparedness Framework).

Результаты экспериментов

В этой установке GPT‑5 автономно рассуждала о протоколе клонирования, предлагала модификации и включала данные новых экспериментов для предложения дальнейших улучшений. Единственным вмешательством человека было выполнение измененного протокола учеными и загрузка экспериментальных данных.

В ходе нескольких раундов GPT‑5 оптимизировала процедуру клонирования, повысив эффективность более чем в 79 раз, что означает: для фиксированного количества исходной ДНК мы получили в 79 раз больше подтвержденных секвенированием клонов по сравнению с базовым протоколом. Самое главное, что она внедрила два фермента, составляющих новый механизм: рекомбиназу RecA из E. coli и одноцепочечный ДНК-связывающий белок гена 32 фага T4 (gp32). Работая в тандеме, gp32 выпрямляет и распутывает свободные концы ДНК, а RecA затем направляет каждую нить к ее правильному соответствию.

Первичный скрининг и вторичные эксперименты определили сборку HiFi на основе парно-финишного метода с участием RecA (RAPF) и трансформацию 7 (T7) в качестве лучших протоколов ферментативного воздействия и трансформации соответственно. Как сборка RAPF, так и трансформация T7 независимо улучшили эффективность клонирования по сравнению с базовым протоколом клонирования HiFi реакций в 2,6 и 36 раз соответственно;, а их комбинация обеспечила аддитивное улучшение производительности в 79 раз. Все клоны были подтверждены секвенированием. (Погрешности: стандартное отклонение для n=3 независимых экспериментов по валидации).

Хотя эти результаты получены на ранней стадии, они обнадеживают. Улучшения специфичны для нашей конкретной схемы клонирования, используемой в модельной системе, и по-прежнему требуют от ученых-людей настройки и запуска протоколов. Тем не менее, эти эксперименты показывают, что системы ИИ могут существенно помогать в реальной лабораторной работе и в будущем могут ускорить работу ученых.

Стоит отметить, что цикл «ИИ-лаборатория» запускался с фиксированными промптами и без вмешательства человека. Такой каркас помог выявить способность модели предлагать действительно новые изменения протоколов независимо от указаний человека, но он также запер систему в рамках исследования и ограничил ее способность максимизировать производительность вновь открытых идей. Лучший динамический баланс между поиском нового (exploration) и использованием найденного (exploitation) вероятно, принесет большие дивиденды, так как и ферментативные улучшения, и улучшения трансформации имеют значительный потенциал для доработки. Мы ожидаем, что достижения в области планирования и рассуждений на уровне горизонта задач повысят способность простых фиксированных промптов поддерживать как открытия, так и последующую оптимизацию.

Эволюционная структура для оптимизации протоколов реального мира

Реакция сборки Гибсона (Gibson assembly) была основным методом клонирования с момента ее изобретения в 2009 году и получила широкое распространение в молекулярной биологии. Сборка Гибсона позволяет молекулярным биологам «склеивать» фрагменты ДНК вместе, кратковременно оплавляя их концы, чтобы совпадающие последовательности могли соединиться в единую молекулу. Одно из главных достоинств сборки Гибсона — ее простота: все происходит в одной пробирке при единой температуре. Эти ограничения естественным образом оставляют пространство для улучшений. Кроме того, следующие свойства делают этот метод хорошо подходящим для оценки способностей моделей ИИ улучшать методы «мокрой» лаборатории:

  • Четкая определенность с контролируемыми компонентами, в отличие от клеточных систем
  • Наличие четкой функции оптимизации: трансформируемая кольцевая ДНК, созданная из фиксированного количества исходной линейной ДНК
  • Относительно быстрые экспериментальные циклы (1–2 дня)
  • Многомерное пространство проектирования, требующее механистических рассуждений для улучшения: оптимальные буферы, реагенты и температуры взаимозависимы

Мы использовали сборку HiFi — запатентованную ферментативную систему, разработанную New England Biolabs на основе сборки Гибсона, в качестве отправной точки для оптимизации. Мы исследовали, сможет ли ИИ внедрять инновации и учиться на экспериментальной обратной связи после снятия ограничений на одноэтапность и изотермичность, и тем самым определять улучшения протокола в этом сценарии.

В частности, мы провели реакцию двухкомпонентного клонирования с использованием гена зеленого флуоресцентного белка (GFP) и широко используемой плазмиды pUC19 — стандартного ДНК-«носителя», применяемого для доставки генов в бактерии с целью их копирования. Целью было увеличение числа успешных колоний.

Мы оптимизировали реакцию клонирования, внедрив эволюционную основу для итераций над предложениями, что позволило модели учиться «на лету» на основе своих прошлых экспериментов. В каждом раунде GPT‑5 предлагала партию из 8–10 различных реакций, причем реакции переносились на более поздние раунды, если для них требовались нестандартные реагенты, которых не было под рукой в лаборатории. Затем ученые-люди проводили реакции и измеряли количество колоний по сравнению с базовой сборкой HiFi Gibson в ходе первичного скрининга. Данные с наилучшими результатами из предыдущего раунда подавались на вход в следующий раунд. Важно отметить, что промпты были стандартизированы и не содержали никаких подсказок от человека, кроме ответов на уточняющие вопросы, что позволило нам приписать новые механистические инсайты напрямую ИИ, а не указаниям человека.

Мы повторно протестировали восемь лучших реакций из всей серии оптимизации, используя более широкий диапазон разведений ДНК, и обнаружили, что многие из них показали меньший эффект, чем при первичном скрининге; в конечном итоге самым сильным подтвержденным кандидатом оказалась реакция из 5-го раунда, которая воспроизвела свои первоначальные показатели. Многие высокоэффективные варианты попали в семейство лигазно-полирующих реакций (ligase-polish), которые кажутся особенно чувствительными к небольшим вариациям состояния компетентных клеток и/или обращения с ДНК после реакции. Поскольку в этих реакциях использовался короткий этап HiFi, мы предполагаем, что многие продукты, вероятно, попадают в E. coli только с одним соединенным стыком, в то время как второй удерживается за счет отжига (annealing), оставляя последующее восстановление клеточным путям репарации. Это создает высокую дисперсию и динамику «джекпота»: даже если в большинстве случаев варианты этой реакции не превосходят оригинал, один сильный выброс может вывести все семейство в последующие раунды.

Хотя мы сосредоточились на оптимизации реакции клонирования по раундам из-за ее механистической сложности, параллельно мы оптимизировали процедуру трансформации, используя один «одношаговый» раунд, в котором модель предложила множество независимых изменений, из которых мы выбрали реакцию с наилучшими показателями.

Первичные скрининги оптимизации двухэтапного рабочего процесса клонирования: ферментативная сборка и трансформация. (Слева) Итеративная оптимизация ферментативной сборки за пять раундов (всего 44 реакции). Начиная с базовой сборки HiFi, GPT‑5 предлагала по 8–10 вариантов протокола сборки за раунд; данные наиболее успешных результатов включались в последующие промпты. На каждом раунде мы отображаем лучшую реакцию из всех испробованных на данный момент (включая предыдущие раунды). (Справа) Одноразовая оптимизация условий трансформации с тестированием 13 различных протоколов. Для обоих скринингов оптимизации данные представляют собой единичные измерения (n=1) для каждого условия; повторная валидация для лучших кандидатов проводилась отдельно.

Используя стандартизированные промпты без участия человека, GPT-5 повысила общую эффективность клонирования в 79 раз, что было подтверждено в ходе экспериментальных повторов.

Стоит отметить, что модель предложила новую ферментативную процедуру, которую она назвала сборкой HiFi на основе парно-финишного метода с участием RecA (RAPF-HiFi). Этот метод добавляет в реакцию два новых белка: рекомбиназу RecA из E. coli и одноцепочечный ДНК-связывающий белок гена 32 фага T4 (gp32). Кроме того, модель внесла целенаправленные изменения в температуру и время инкубации, а также в сроки внесения ферментов: она предложила добавлять RecA и gp32 после первоначальной реакции HiFi при 50°C, позволяя этим белкам работать при 37°C, а затем возвращаться к 50°C для завершения сборки. В совокупности эти новые модификации увеличили эффективность более чем в 2,5 раза. Следует отметить, что это первоначальная производительность без итеративной оптимизации условий и времени реакции.

Что касается трансформации, наиболее эффективная модификация оказалась неожиданно простой: осаждение клеток (осаждение их в центрифуге так, чтобы они собирались на дне пробирки), удаление половины поданного объема и ресуспендирование клеток перед добавлением ДНК — все при температуре 4°C. Хотя химически компетентные клетки с высокой эффективностью обычно считаются хрупкими, они хорошо перенесли концентрирование, а увеличение числа молекулярных столкновений существенно повысило эффективность трансформации (>30 раз при финальной валидации).

Новое усовершенствование клонирования на основе гомологии

Diagram showing the steps of RecA-assisted pair-and-finish HiFi DNA assembly, with labeled stages for T5 exonuclease, GP32, RecA, polymerase, and ligase acting sequentially on DNA strands.

Экзонуклеаза T5 создает 3′-выступающие концы, которые белок gp32 стабилизирует, подавляя вторичную структуру. Затем RecA вторгается с 3′-концов, вытесняя gp32 и способствуя поиску гомологии и отжигу. Нагревание до 50 °C удаляет оба белка, обеспечивая заполнение зазоров полимеразой и лигирование.

Сборка Гибсона работает за счет того, что фрагменты ДНК снабжаются комплементарными «липкими» концами, благодаря чему они могут находить друг друга и соединяться. В реакции используются два разных фермента (полимераза и лигаза) для сшивания соединенных фрагментов. В RAPF-HiFi были введены два белка, чтобы этап сопоставления работал эффективнее. Первый, gp32, действует как расческа, которая выпрямляет и распутывает свободные концы ДНК. Второй, RecA, действует как гид, который ищет правильного партнера для каждой нити и сводит вместе совпадающие фрагменты. Более высокая температура заставляет обоих помощников отделяться от ДНК, позволяя обычным ферментам Гибсона завершить реакцию.

Подводя итог, мы предполагаем, что улучшение производительности достигается за счет следующего механизма:

  • Gp32 покрывает неотожженные хвосты одноцепочечной ДНК (оцДНК), устраняя вторичную структуру
  • RecA, на который обычно влияет структура, вторгается с 3′-конца и вытесняет филамент gp32
  • RecA опосредует поиск гомологии оцДНК: оцДНК, стимулируя отжиг
  • Возврат к температуре 50°C вытесняет филаменты как recA, так и gp32, позволяя полимеразе и лигазе завершить реакцию.

Чтобы проверить работоспособность новых ферментов и исключить вероятность того, что улучшение характеристик обусловлено исключительно изменениями температурных режимов или буферов, мы протестировали эффективность RAPF-HiFi без RecA, а также без RecA и gp32 одновременно. Эффективность обеих реакций снизилась по сравнению с RAPF-HiFi, что говорит о необходимости обоих белков для реализации механизма действия RAPF-HiFi.

Чтобы исследовать лежащий в основе механизм, мы разделили два новых фермента в реакции: RecA и gp32. Мы показываем, что наличие каждого из них по отдельности снижает эффективность по сравнению с базовым уровнем HiFi. Вместе они превосходят базовый уровень, обеспечивая прирост эффективности в 2,6 раза. (Планки погрешностей: стандартное отклонение для n=3 независимых экспериментов)

Разработка RAPF-HiFi свидетельствует о том, что GPT‑5 способен к сложному многомерному рассуждению:

  • Белок RecA ингибируется структурой ДНК, и примечательно, что модель внесла две синергичные модификации одновременно: добавила RecA и дополнила его белком gp32 для устранения вторичной структуры ДНК.
  • Естественным партнером E. coli RecA является одноцепочечный связывающий белок E. coli (SSB). SSB выполняет роль, аналогичную gp32, во время репликации, рекомбинации и репарации генома. Однако E. coli SSB не сподвигнут отделяться от ДНК достаточно быстро для роста нитей RecA, причем комплекс RecFOR стимулирует зарождение RecA на нити SSB in vivo. SSB связывается в виде стабильного тетрамера с крайне низкой скоростью диссоциации. В отличие от этого, нить gp32 является более динамичной, что позволяет вытеснять RecA.

Насколько нам известно, RecA и gp32 ранее не использовались совместно на функциональном уровне в методах молекулярной биологии. Как и в случае со многими новыми молекулярно-биологическими техниками, лежащая в их основе биохимическая активность уже изучалась, однако именно их применение в качестве практического и универсального метода представляет собой научный прорыв.

Например, взаимодействие RecA и gp32 изучалось в анализах механистической реконституции in vitro: в исследованиях формирования D-петли было показано, что gp32 способен усиливать активность RecA. Белок Gp32 использовался в сочетании с его естественным партнером — рекомбиназой Т4 UvsX и фактором загрузки рекомбиназы uvsY в рекомбиназополимеразной амплификации (RPA). Хотя в патентной заявке на RPA утверждается, что эффективные реакции RPA были продемонстрированы с использованием RecA E. coli в гетерологичной системе с поврежденным (т. е. искусственно измененным, недиким) белком gp32, это утверждение упоминается лишь вскользь в некоторых патентных описаниях и, насколько нам известно, не было подтверждено опубликованными данными или принято в качестве надежной системы RPA на основе RecA. Один из методов клонирования под названием SLiCE использует экстракт цельных клеток E. coli, содержащий систему рекомбинации λ Red, где Red beta может выполнять двойную роль — как ДНК-связывающего белка, так и рекомбиназы (хотя мы явно запретили использование клеточных экстрактов в нашем запросе). В другом исследовании Феррин и Камерини-Отеро использовали только RecA для избирательного захвата молекул ДНК на основе совпадающих последовательностей. Независимо от этого, gp32 применялся в качестве добавки в процессе амплификации ДНК, называемом ПЦР, для уменьшения вторичной структуры. Было показано, что амплификация NABSA усиливается как за счет RecA, так и за счет gp32, хотя каждый из них мог усиливать реакцию по отдельности, и синергетического эффекта обнаружено не было. В более широком плане сообщения об усовершенствовании базовых реакций сборки ДНК в стиле Гибсона были редкими, причем наиболее заметным примером является термостабильный ДНК-связывающий белок (ET SSB), который повышает эффективность сборки примерно в 2,5 раза.

Для большинства применений мы не ожидаем, что RAPF-HiFi составит конкуренцию простоте и надежности клонирования HiFi/Gibson. Тем не менее, появление принципиально иного механистического пути сборки заслуживает внимания: GPT‑5 пришел к решению, которое включает непривычную комбинацию белков рекомбинации и динамику реакции. Лежащий в основе механизм может оказаться модульным, предоставляя компоненты, которые можно перепрофилировать или объединить в других молекулярных процессах. Мы также продолжаем изучать пути совершенствования RAPF-HiFi. Температуру реакций и продолжительность этапов можно настраивать так, чтобы сбалансировать активность RecA и gp32 против чрезмерного расщепления экзонуклеазой, а количество обоих белков еще предстоит оптимизировать. GPT‑5 также предложил гиперактивный вариант RecA, который мы в настоящее время очищаем.

Что касается протокола трансформации, успешные условия оптимизации охватывали спектр добавок и температурных воздействий, призванных повысить эффективность теплового шока коммерческих компетентных клеток 10-beta. Из 13 протестированных вариантов одностадийной трансформации, сгенерированных ИИ, наиболее эффективной оказалась модификация Transformation 7 (T7), при которой клетки осаждали центрифугированием, удаляли половину поданного объема и ресуспендировали клетки перед добавлением ДНК — и все это при температуре 4°C. Химически компетентные клетки с высокой эффективностью обычно считаются хрупкими, и подобных манипуляций стараются избегать. Тем не менее, клетки хорошо перенесли концентрирование. Совокупный эффект повышенного воздействия ДНК на каждую клетку и менее ингибирующего буфера, приведший к более резкому тепловому шоку, обеспечил значительное увеличение эффективности трансформации (> чем в 30 раз).

Этот протокол трансформации является новым, хотя концептуально схожий подход, при котором клетки концентрируются на более раннем этапе, уже описывался в литературе. Примечательно, что разработанный здесь GPT‑5 метод совместим с готовыми коммерческими химически компетентными клетками, что избавляет от необходимости самостоятельной подготовки клеток в лаборатории и превосходит показатели прироста эффективности аналогичного подхода на сопоставимых штаммах клеток.

Роботизированная система

Чтобы повысить пропускную способность этой модельной экспериментальной системы, компании Robot on Rails и Red Queen Bio объединили усилия для создания робота, который принимает протокол клонирования на естественном языке и выполняет его в «мокрой» лаборатории.

Система объединяет три компонента: 1) языковую модель (LLM) для перевода инструкций с человека на робота, которая преобразует простой английский текст в действия робота; 2) систему технического зрения, которая идентифицирует лабораторную посуду и определяет ее местоположение в реальном времени; и 3) планировщик траектории робота, определяющий, как безопасно и точно выполнить каждое действие. Результатом стал гибкий универсальный лабораторный робот, дополнительно оптимизированный для вариантов протокола клонирования по методу Гибсона.

Мы проверили, сможет ли автономный робот выполнить полный эксперимент по клонированию, запустив два протокола одновременно: стандартный метод HiFi и R8 — модифицированный ИИ протокол с наилучшими показателями по итогам первого раунда оптимизации.

Мы сравнили работу робота с экспериментами, выполненными человеком на каждом этапе. Робот успешно справился с процессом трансформации, который требовал разнообразных физических операций: перенос и смешивание жидкостей, перемещение пробирок с образцами, контролируемый нагрев клеток и высевание клеток на чашки с питательной средой. При прямом сравнении с результатами ручной трансформации робот выдал данные сопоставимого качества с эквивалентным улучшением относительно базового уровня, продемонстрировав ранний потенциал автоматизации и ускорения оптимизации биологических экспериментов.

Хотя кратные изменения (fold-changes) между экспериментами робота и человека оказались схожими, абсолютное количество колоний, полученных с помощью робота, было примерно в десять раз ниже по сравнению с ручным выполнением. Это указывает на области, требующие доработки, такие как точность работы с жидкостями, калибровка контроля температуры и воспроизведение нюансов ручной техники обращения с клетками.

Как стандартный метод HiFi (базовый), так и улучшенный метод R8 выполнялись как исследователями-людьми, так и автономным роботом, при этом эффективность трансформации нормировалась относительно соответствующих контрольных образцов базового уровня HiFi (принятых за 1,0). Метод R8, выполненный человеком, показал улучшение в 2,39 раза; R8, выполненный роботом, достиг улучшения в 2,13 раза (89% от показателей человека), продемонстрировав сопоставимое ранжирование протоколов несмотря на более низкие абсолютные выходы.

Будущее

Мы считаем, что эти эксперименты дают представление о том, как будет выглядеть наука будущего, ускоряемая искусственным интеллектом: модели непрерывно обучаются и взаимодействуют с реальным миром. Хотя в наших экспериментах исключалось вмешательство человека для чистого измерения возможностей модели, мы особенно воодушевлены тем, что ИИ помогает ученым-людям проектировать эксперименты и вносить свой вклад в научные прорывы.


Работая над безопасным и ответственным ускорением научного прогресса, мы также стремимся оценивать и снижать риски, особенно те, которые связаны с биобезопасностью. Результаты этих оценок показывают, что модели способны рассуждать в условиях «мокрой» лаборатории для улучшения протоколов, и могут иметь последствия для биобезопасности, как описано в нашей Концепции готовности (Preparedness Framework). Мы полны решимости создавать необходимые и тщательно выверенные средства защиты на уровне моделей и систем для снижения этих рисков, а также разрабатывать методы оценки для отслеживания текущего уровня угроз.

Полный текст статьи читайте на OpenAI