Представляем GPT‑Rosalind для исследований в области наук о жизни

Новая специализированная модель для ускорения научных исследований и разработки лекарств.

Запросить доступ

Сегодня мы представляем GPT‑Rosalind — нашу передовую модель рассуждений, созданную для поддержки исследований в области биологии, разработки лекарств и трансляционной медицины. Серия моделей для наук о жизни оптимизирована для научных рабочих процессов, сочетая в себе расширенные возможности использования инструментов и более глубокое понимание химии, белковой инженерии и геномики.

В среднем путь от поиска мишени до получения регуляторного одобрения нового лекарства в США занимает от 10 до 15 лет. Достижения на самых ранних этапах исследований многократно окупаются на последующих стадиях за счет более точного выбора мишеней, более надежных биологических гипотез и экспериментов более высокого качества. Прогресс в науках о жизни сдерживается не только сложностью фундаментальной науки, но и сложностью самих исследовательских процессов. Ученым приходится работать с большими объемами литературы, специализированными базами данных, экспериментальными данными и постоянно развивающимися гипотезами для генерации и оценки новых идей. Эти рабочие процессы часто требуют много времени, фрагментированы и с трудом поддаются масштабированию.

Мы верим, что передовые системы ИИ могут помочь исследователям быстрее проходить эти этапы — не просто за счет повышения эффективности текущей работы, но и помогая ученым изучать больше возможностей, находить связи, которые в противном случае могли бы быть упущены, и быстрее приходить к более качественным гипотезам. Поддерживая синтез данных, генерацию гипотез, планирование экспериментов и другие многоэтапные исследовательские задачи, эта модель призвана помочь ученым ускорить ранние стадии открытий. Со временем такие системы смогут помочь организациям в сфере наук о жизни совершать прорывы, которые иначе были бы невозможны, с гораздо более высоким уровнем успеха.

GPT‑Rosalind теперь доступна в качестве исследовательского превью в ChatGPT, Codex и через API для квалифицированных клиентов в рамках нашей программы доверенного доступа. Мы также представляем находящийся в свободном доступе исследовательский плагин Life Sciences для Codex, который помогает ученым подключать модели более чем к 50 научным инструментам и источникам данных. Мы сотрудничаем с такими клиентами, как Amgen, Moderna, Институт Аллена, Thermo Fisher Scientific и другими, чтобы внедрять GPT‑Rosalind в рабочие процессы, ускоряющие исследования и открытия.

Модель названа в честь Розалинд Франклины, чьи тщательные исследования помогли раскрыть структуру ДНК и заложили основы современной молекулярной биологии.

Узнайте, как наша специализированная модель ускоряет исследовательские рабочие процессы — от необработанных данных до обоснованных решений об открытиях.

Создано для научных рабочих процессов

Серия моделей для наук о жизни GPT‑Rosalind создана для современной научной работы с опубликованными данными, материалами, инструментами и результатами экспериментов. В ходе наших оценок она демонстрирует наилучшую производительность в задачах, требующих рассуждений о молекулах, белках, генах, путях и биологии болезней, а также более эффективно использует научные инструменты и базы данных в многоэтапных процессах, таких как обзор литературы, интерпретация последовательностей в функции, планирование экспериментов и анализ данных.

Это первый релиз в нашей серии моделей для наук о жизни GPT‑Rosalind, и мы продолжим расширять границы возможностей биохимических рассуждений модели в долгосрочных научных рабочих процессах, интенсивно использующих различные инструменты. Вычислительная инфраструктура OpenAI дает нам возможность продолжать обучение, оценку и совершенствование все более способных специализированных моделей на реальных научных задачах, помогая этим системам становиться еще более полезными по мере усложнения самих рабочих процессов.

Узнайте, как наш набор решений преобразуется в измеримые улучшения ваших исследовательских рабочих процессов — от основанных на доказательствах идей до экспериментов с высоким эффектом.

Клиенты и экосистема

Мы сотрудничаем с ведущими фармацевтическими, биотехнологическими и исследовательскими компаниями, а также с технологическими организациями в сфере наук о жизни, чтобы применять GPT‑Rosalind в рабочих процессах, стимулирующих научные открытия.

Производительность и оценка

Мы оценили GPT‑Rosalind по ряду возможностей, фундаментальных для научных открытий и исследований в отрасли. Эти оценки измеряют базовые способности к рассуждениям в научных поддоменах, включая механизмы химических реакций; структуру белков, эффекты мутаций и взаимодействия;, а также филогенетическую интерпретацию последовательностей ДНК. Они также оценивают, могут ли модели поддерживать реальные исследовательские рабочие процессы путем интерпретации экспериментальных результатов, выявления закономерностей, важных для экспертов, и синтеза внешней информации для планирования последующих экспериментов. Наконец, они проверяют, способны ли модели выбирать и использовать правильные вычислительные инструменты, базы данных и специализированные возможности для усиления своих рассуждений. В совокупности эти оценки демонстрируют прогресс в сквозном процессе научных исследований и свидетельствуют о возросшей способности помогать исследователям решать сложные задачи в области открытий.

Отраслевые оценки

Мы оценили GPT‑Rosalind на ряде публичных бенчмарков. На BixBench — бенчмарке, созданном на основе реальных задач биоинформатики и анализа данных — GPT‑Rosalind продемонстрировала ведущие показатели среди моделей с опубликованными результатами.

В бенчмарке LABBench2, оценивающем производительность при выполнении различных исследовательских задач, таких как поиск литературы, доступ к базам данных, манипуляции с последовательностями и разработка протоколов, модель GPT‑Rosalind превосходит GPT‑5.4 по 6 из 11 задач. Наиболее заметное улучшение наблюдается в CloningQA, где требуется комплексная разработка ДНК и ферментных реагентов для протоколов молекулярного клонирования.

Мы также объединили усилия с Dyno Therapeutics — компанией, занимающейся разработкой генной терапии с помощью ИИ, — чтобы оценить модель на задачах прогнозирования и генерации функций РНК по последовательности, используя неопубликованные и незагрязненные последовательности. Производительность сравнивалась с 57 историческими результатами экспертов-людей в области ИИ и биологии. При прямой оценке в приложении Codex результаты модели (лучшие из десяти попыток) оказались выше 95-го перцентиля экспертов-людей в задаче прогнозирования и около 84-го перцентиля экспертов-людей в задаче генерации последовательностей.

Эти оценки дают четкое представление об эффективности модели в рабочих процессах, на которые ученые полагаются ежедневно для получения доказательств, анализа сложных данных и формулирования обоснованных биологических выводов.


Интеграция с инструментами, которые используют ученые

Ученые могут использовать наш новый плагин для исследований в области наук о жизни для Codex, доступный уже сегодня на GitHub. Этот пакет включает широкий набор модульных навыков для наиболее распространенных исследовательских задач и призван помочь пользователям работать в таких областях, как генетика человека, функциональная геномика, структура белков, биохимия, клинические данные и поиск публичных исследований.

Life science plugin demo static image

Эти навыки выступают в качестве уровня оркестрации, который помогает ученым эффективнее решать масштабные, неоднозначные и многоэтапные задачи. Они предоставляют доступ к более чем 50 общедоступным мультиомиксным базам данных, литературным источникам и биологическим инструментам, а также служат гибкой отправной точкой для типичных повторяющихся рабочих процессов, таких как поиск структуры белков, поиск последовательностей, обзор литературы и поиск общедоступных наборов данных.

Соответствующие критериям корпоративные пользователи могут использовать этот плагин в исследовательских процессах вместе с GPT‑Rosalind для более глубокого биологического анализа, в то время как все остальные пользователи могут использовать пакет плагинов с нашими основными моделями.

Доверенный доступ

Мы стремимся предоставить эти возможности ученым и исследовательским организациям, которые имеют наилучшие возможности для укрепления здоровья человека, сохраняя при этом надежные средства защиты от биологического нецелевого использования. Модель Life Sciences запускается в рамках схемы развертывания с доверенным доступом для квалифицированных корпоративных клиентов в США, с элементами контроля соответствия требованиям, управления доступом и организационного управления. В то же время мы делаем набор коннекторов и плагин Life Sciences Research Plugin более доступными, чтобы исследователи могли эффективнее использовать наши основные модели для решения задач в области наук о жизни.

Модель Life Sciences была разработана с повышенными средствами безопасности корпоративного уровня и усиленным управлением доступом, что позволяет использовать ее в профессиональных научных целях в регулируемых исследовательских средах. Мы оцениваем доступ на основе трех ключевых принципов: полезное применение, надежное управление и контроль безопасности, а также контролируемый доступ с защитой корпоративного уровня. На практике это означает, что участвующие организации должны проводить законные научные исследования с явной пользой для общества; поддерживать надлежащие меры управления, соблюдения нормативных требований и предотвращения неправомочного использования;, а также ограничивать доступ утвержденными пользователями в защищенных, хорошо управляемых средах. Организации также должны согласиться с условиями предварительного ознакомления с исследованиями в области наук о жизни и соблюдать правила использования OpenAI, и мы можем запросить дополнительную информацию в рамках адаптации или продолжения участия.

С чего начать

Организации могут запросить доступ через наш процесс квалификации и проверки безопасности.

В ходе исследовательского превью использование этой модели не будет расходовать существующие кредиты или токены (при условии соблюдения защитных мер против злоупотреблений). Мы поделимся более подробной информацией о ценах и доступности по мере расширения программы.

Модель Life Sciences создана для того, чтобы помочь научным организациям выполнять работу более качественно и быстро в условиях, требующих как технических возможностей, так и операционного контроля. Наша специализированная команда по наукам о жизни, а также консультационные партнеры, включая McKinsey & Company, Boston Consulting Group (BCG) и Bain & Company, помогают организациям выявлять сценарии применения с высокой отдачей, интегрировать модель в корпоративные среды и добиваться измеримых результатов. Если вы хотите узнать, как подразделение OpenAI Life Sciences может поддержать вашу работу, вы можете связаться с нашей командой по наукам о жизни.

Что дальше

Это наш первый релиз в серии моделей для наук о жизни, и мы рассматриваем его как начало долгосрочных инвестиций в создание ИИ, способного ускорить научные открытия в сферах, имеющих важнейшее значение для общества — от здоровья человека до более широких биологических исследований. Мы продолжим совершенствовать биологические рассуждения модели, расширять поддержку сложных исследовательских рабочих процессов с использованием инструментов и долгосрочных сценариев, а также тесно сотрудничать с ведущими научными учреждениями для оценки реального влияния. Сюда входят продолжающиеся партнерские отношения с национальными лабораториями, такими как Лос-Аламосская национальная лаборатория, где мы изучаем возможности ИИ для проектирования белков и катализаторов, включая способность систем ИИ модифицировать биологические структуры при сохранении или улучшении ключевых функциональных свойств. 

Со временем мы ожидаем, что эти системы станут еще более способными партнерами в научных открытиях, помогая ученым быстрее проходить путь от вопроса к доказательствам, от доказательств к пониманию и от понимания к новым методам лечения пациентов.

Полный текст статьи читайте на OpenAI