Использование ИИ для помощи врачам в диагностике редких генетических заболеваний у детей

В исследовании NEJM AI эксперты использовали модель логического выводов OpenAI для повторного анализа 376 ранее нераспознанных случаев и выявления зацепок для 18 диагнозов.

Читать аннотацию исследования на NEJM AI

Даже с учетом возможностей геномного секвенирования многие пациенты с редкими заболеваниями так и не получают точного генетического диагноза. Примерно половина случаев остается недиагностированной после масштабных тестов и консультаций узких специалистов. В их медицинских данных могут содержаться разгадки, однако на их поиски порой уходит много времени: приходится просеивать от тысяч до миллионов возможных генетических вариантов, разрозненные клинические записи и стремительно обновляющуюся научную литературу.

По мере накопления новых данных о взаимосвязи между генами и болезнями, описаний клинических случаев и результатов классификации нерешенные проблемы со здоровьем могут получить новое толкование.

Исследователи из Центра редких детских заболеваний им. Ментона при Бостонской детской больнице, Гарвардского университета и компании OpenAI задействовали модель логического рассуждения OpenAI o3 Deep Research для анализа обезличенных клинических и геномных данных 376 ранее исследованных и не имевших диагноза случаев. Модель сформировала подтвержденные доказательствами варианты-кандидаты для изучения исследователями и клиницистами. После экспертного анализа, проведения дополнительных тестов и клинического подтверждения врачи поставили диагноз в 18 случаях — дополнительный прирост диагностической точности составил 4,8% после первичного анализа специалистами. Это исследование было опубликовано 18 июня 2026 года в журнале NEJM AI и демонстрирует, как исследовательский рабочий процесс с поддержкой ИИ может помочь экспертам находить новые зацепки при повторном рассмотрении самых сложных случаев.

Многие из этих случаев годами ускользали от внимания экспертов. В данном исследовании модель OpenAI o3 Deep Research помогла ученым выявить направления для поиска, которые затем оценивались с помощью устоявшихся клинических процедур. Это позволяет предположить, что периодический пересмотр данных под руководством экспертов может стать более масштабируемым по мере развития медицинских знаний. Модель не ставила диагнозы пациентам и не принимала клинических решений. Она генерировала основанные на доказательствах гипотезы, которые специалисты могли изучить и, при необходимости, исследовать с помощью дополнительных тестов и подтвердить в клинической лаборатории.

Почему старый медицинский случай может таить в себе новый ответ

Неубедительный результат генетического теста далеко не всегда является окончательным приговором. Описания фенотипа пациента, результаты анализов и семейный анамнез могут быть рассредоточены по базам данных, использующим разные идентификаторы, форматы и словари. Связать эти записи воедино сложно, поэтому даже специалисты могут упустить диагноз. Кроме того, эксперты могут секвенировать геном ребенка еще до того, как соответствующий ген или его варианты будут связаны с заболеванием. По мере развития научных знаний те же данные могут открывать ответы, которые ранее выявить было невозможно.

Повторный анализ редких заболеваний — задача как научная, так и техническая. Геном пациента остается прежним, но окружающая его база доказательств постоянно меняется: исследователи связывают с болезнями новые гены и варианты, лаборатории реклассифицируют старые варианты, а базы данных и научные статьи пополняются новыми наблюдениями. Каждое обновление делает старый неубедительный случай заслуживающим повторного рассмотрения, в результате чего многие медицинские учреждения накапливают растущий объем неизученных геномов, которые необходимо соотносить с меняющейся базой знаний.

В данном исследовании ученые разработали рабочий процесс таким образом, чтобы модель выступала в роли логического уровня, ставящего во главу угла обоснование поверх существующих геномных конвейеров. Вместо того чтобы выдавать лишь ранжированный список генов, ее просили увязать клинические особенности, характер наследования, доказательства по вариантам и научную литературу в единое обоснование, которое мог бы проверить человек.

Как проводился повторный анализ

Для каждого случая исследовательская группа сформировала обезличенный пакет данных, включающий стандартизированные термины онтологии фенотипов человека (Human Phenotype Ontology) для описания клинической картины пациента, эпизодические заметки клиницистов и любые описательные клинические диагнозы, метаданные (такие как возраст и пол), а также отфильтрованную таблицу вариантов. В таблице отражались редкость каждого варианта, его прогнозируемое влияние на кодируемый белок, классификация в ClinVar и качество сигнала у доступных членов семьи. В большинстве случаев использовались данные ребенка и обоих биологических родителей.

Команда попросила модель предложить наиболее правдоподобное молекулярное объяснение и продемонстрировать ход своих мыслей. Затем исследователи проанализировали полученные результаты с помощью того же стандарта ACMG/AMP, который клинические лаборатории используют для классификации генетических вариантов. Каждый кандидат проверялся как минимум двумя участниками группы, разногласия разрешались путем консенсуса, а результаты работы модели никогда не воспринимались как готовый диагноз. Находка считалась диагнозом только после того, как квалифицированные эксперты изучили доказательства, вариант был классифицирован как патогенный или вероятно патогенный, это подтвердила сертифицированная лаборатория CLIA, а клиническая группа сообщила результат семье.

Перед анализом неразгаданных случаев команда отладила рабочий процесс на пациентах с уже установленными диагнозами. Модель правильно определила ген и вариант в ходе повторных прогонов для 48 из 51 случая, включавших различные редкие патологии. В наборе из 57 нервно-мышечных случаев рабочий процесс выдал верный диагноз в повторных запусках для 45 случаев. В наборе геномов с длинными прочтениями из 15 случаев модель назвала правильный ген в каждом из них, а оба вызывающих заболевание аллеля — в 12 случаях. Эти оценки помогли в разработке промптов и показали, в каких аспектах экспертная проверка по-прежнему остается незаменимой.

Показатели уверенности модели, оцениваемые ею самостоятельно, корректно соотносились с правильными диагнозами в этих ранее решенных случаях: среднее минимальное значение составляло 85,6 для стабильно правильных вариантов и 42,1 для неверных или неизвестных. Эти оценки не являлись калиброванными вероятностями, и команда не использовала их в качестве замены доказательствам или клиническому заключению. Тем не менее, они помогали экспертам сосредоточиться на наиболее перспективных диагнозах-кандидатах.

Workflow diagram titled

Результаты исследования

Затем исследовательская группа применила этот рабочий процесс к четырем группам ранее неразгаданных случаев: детям с нарушениями нервно-психического развития, пациентам с редкими нервно-мышечными заболеваниями, детям и подросткам с ранним психозом, а также к случаям внезапной необъяснимой смерти в педиатрической практике. Это были не свежие случаи, ожидающие первичного рассмотрения: многие из них уже проходили через множество коммерческих или институциональных алгоритмов и обсуждались междисциплинарными командами.

Результаты по кохортам

Кохорта

Случаи

Выявленные диагнозы

Эффективность

Нарушения нервно-психического развития

100

10

10,0%

Нервно-мышечные заболевания

61

4

6,6%

Внезапная необъяснимая смерть в педиатрии

200

2

1,0%

Ранний психоз

15

2

13,3%

Всего

376

18

4,8%

Кохорта пациентов с ранним психозом была небольшой, поэтому ее процентный показатель имеет широкий доверительный интервал. Показатель эффективности также отражает вероятность того, что в той или иной кохорте причина заболевания обусловлена одним геном.

После того как модель выдвинула кандидатов, а эксперты завершили их проверку и клиническое подтверждение, врачи установили диагнозы в 4,8% случаев. Этот показатель относительно невелик, но имеет важное значение для данной группы пациентов, поскольку предыдущие экспертные обследования не смогли разрешить эти случаи. В аналогичных исследованиях по повторному анализу сообщается об однопроцентном приросте в случаях, прошедших через тщательное изучение; более высокие результаты обычно достигаются в исследованиях, включающих новые случаи или хорошо известные расстройства, ожидающие генетического подтверждения.

Из 18 поставленных диагнозов 7 оказались повторно открытыми: это диагнозы, установленные за пределами местного исследовательского процесса, но отсутствовавшие в записях, которые изучала команда. В ряде случаев варианты уже значились как патогенные или вероятно патогенные в публичных базах данных, что подчеркивает сложность задачи по синтезу разрозненной информации из различных источников.

Гибкость при выявлении генетических вариантов

В одном из случаев с ранним психозом модель выявила структурное изменение в геноме, которое отсутствовало в исходных данных. Она сопоставила серию низкокачественных вызовов на 22-й хромосоме с кардиологическими, иммунными, нервно-психическими и психиатрическими особенностями ребенка, после чего выдвинула гипотезу о делеции 22q11.2, связанной с синдромом Ди Джорджи. Предполагаемый вариант был подтвержден с помощью повторного секвенирования генома.

Хотя в запросе требовалось указать одну моногенную причину, модель порой находила два гена, которые лучше объясняли сложную клиническую картину. Варианты в генах LAMA2 и FOXP1 в совокупности помогли объяснить мышечные нарушения и проблемы нервно-психического развития в одном из случаев; в другом обнаружилось ранее не распознанное дигенное объяснение с участием генов TTN и SRPK3.

Создание проверяемой и биологически согласованной гипотезы

Помимо постановки диагнозов, модель также выявила возможное новое механистическое объяснение для такого заболевания, как витилиго. В одном случае нарушений нервно-психического развития у пациента с витилиго модель обратила внимание на делецию 11 аминокислот в гене S1PR1. Ген S1PR1 кодирует клеточный рецептор поверхности, участвующий в передаче сигналов, миграции иммунных клеток и биологии тканей. Модель объединила данные, свидетельствующие о том, что эта делеция может изменять структуру рецептора и передачу сигналов таким образом, что выработка пигмента снижается, а иммунные клетки дольше сохраняются в коже.

Предполагаемая связь между геном S1PR1 и витилиго требует дополнительной экспериментальной проверки, но она демонстрирует огромный потенциал ИИ в преобразовании разрозненных данных структурной биологии, иммунологии и клинической генетики в конкретные, проверяемые гипотезы.

Команда также отметила возможное расширение фенотипа в нервно-мышечной кохорте. Повреждающие варианты в генах HSPB8 и CDK13 не идеально соответствовали наиболее известным проявлениям этих генов, что указывает на более широкий клинический спектр, который предстоит проверить в дальнейших исследованиях и лабораторных работах.

Клинический случай: постановка диагноза Кайре спустя почти два десятилетия

Все началось на занятиях каратэ, когда мать Кайры заметила, что ее 9-летняя дочь при выполнении стойки не опускается так низко, как раньше. Кайра также стала медленнее двигаться на тренировках по футболу и во время ходьбы и бега опиралась на носки. Ее педиатр не смог определить причину мышечной слабости и направил девочку к профильному специалисту. За этим последовал почти 20-летний путь через обследования, курсы лечения и консультации, так и не приведший к постановке диагноза.

Случай Кайры стал одним из четырех диагнозов, выявленных в нервно-мышечной кохорте. Исследователи связали ее состояние со сдвигом рамки считывания в гене HSPB8 и диагностировали форму миофибриллярной миопатии, при которой в мышечных волокнах накапливаются аномальные белковые структуры, способствующие развитию слабости. Генетический консультант из Центра им. Ментона позвонил Кайре примерно за неделю до ее 28-го дня рождения.

К тому времени Кайре пришлось приспосабливаться к болезни большую часть своей жизни. К 13 годам она уже была прикована к инвалидному креслу и зависела от аппарата искусственной вентиляции легких, хотя в дальнейшем ее состояние стабилизировалось. И хотя форма миофибриллярной миопатии у Кайры настолько редка, что о ее долгосрочном течении практически ничего неизвестно, сам диагноз принес долгожданную определенность.

Ограничения

Данное исследование показывает, что модель рассуждений общего назначения может способствовать ретроспективному геномному переанализу, объединяя фенотип, наследование, аннотации вариантов, закономерности качества данных и научную литературу в проверяемые гипотезы. Оно также демонстрирует, почему периодический переанализ имеет значение: некоторые ответы всплывают только после развития знаний или объединения разрозненных записей.

Это исследование не является доказательством того, что пациенты, врачи или клиенты должны использовать модели OpenAI для диагностики заболеваний или принятия медицинских решений. В нем не описывается и не одобряется какое-либо предполагаемое использование клиентами OpenAI o3 Deep Research, ChatGPT или любого другого продукта OpenAI для диагностики. Модель не ставила диагноз ни одному участнику; врачи и другие квалифицированные клинические эксперты ставили каждый диагноз в ходе установленных процессов рассмотрения, тестирования и клинического подтверждения.

Исследование носили ретроспективный характер, когорты были гетерогенными, а рецензенты не были ослеплены в отношении уверенности модели. Исследователи не измеряли сэкономленное время, затраты, усилия клиницистов, объем работы с ложноположительными результатами или изменения в уходе. Они также систематически не оценивали другие формы генетических вариаций, такие как структурные варианты, экспансии повторов, глубокие интронные изменения или мозаицизм.

Большие языковые модели могут неверно истолковывать контекст или выдавать правдоподобные объяснения, которые не выдерживают при ближайшем рассмотрении. Поэтому каждый результат проходил через экспертную оценку человеком и клиническое подтверждение. Модель расширила поиск и сфокусировала последующий анализ под руководством человека; она не решала, какая информация или какой диагноз должны быть возвращены семье.

В этом исследовании использовалась обезличенная информация, при этом защищенная медицинская информация не использовалась и не передавалась за пределы утвержденных сред. Более широкое клиническое развертывание потребует такого же внимания к конфиденциальности, безопасности, проверяемости и местным нормативным актам, которые применяются ко всей медицинской помощи. Доступ к модели не заменяет инфраструктуру секвенирования, генетическое консультирование, подтверждающее тестирование или суждения специалистов.

Abstract blue gradient background with soft transitions between light blue, cyan, and deep blue tones, creating a smooth, blurred effect.

«Узким местом является время. Эксперт может уделять какому-то одному конкретному человеку лишь определенную часть своего дня».

Abstract blue gradient background with soft transitions between light blue, cyan, and deep blue tones, creating a smooth, blurred effect.

«Узким местом является время. Эксперт может уделять какому-то одному конкретному человеку лишь определенную часть своего дня».

Д-р Кэтрин Браунштейн, Центр исследования редких заболеваний Мантона при Бостонской детской больнице

Abstract blue gradient background with soft transitions between light blue, cyan, and deep blue tones, creating a smooth, blurred effect.

«Исследователи вроде Кэтрин и меня просто не могут держать в голове 8 000 различных заболеваний. В этом и заключается сила ИИ».

Abstract blue gradient background with soft transitions between light blue, cyan, and deep blue tones, creating a smooth, blurred effect.

«Исследователи вроде Кэтрин и меня просто не могут держать в голове 8 000 различных заболеваний. В этом и заключается сила ИИ».

Алан Беггс, директор Центра исследования редких заболеваний Мантона

Что дальше

Проспективные многоцентровые исследования должны сравнить переанализ с помощью языковых моделей со стандартной практикой по диагностической ценности, времени до получения кандидата, усилиям клиницистов, бремени ложноположительных результатов, стоимости и влиянию на уход. Версионные промпты, проверка ссылок, журналы аудита и откалиброванная неопределенность будут важны для воспроизводимости и безопасности. Такие исследования по-прежнему будут требовать квалифицированных клиницистов для оценки доказательств, назначения соответствующих тестов и принятия любых решений о диагнозе или лечении.

В этом исследовании использовалась система OpenAI o3 Deep Research. Более новые модели общего назначения способны искать и синтезировать больше научных материалов, в то время как специализированные системы, такие как GPT‑Rosalind, созданы для более глубокой работы в области наук о жизни, включая влияние вариантов на структуру и функцию белка. Эти возможности здесь не тестировались и потребуют собственных оценок и средств контроля доступа.

Хотя компания OpenAI помогла поддержать это первоначальное исследовательское исследование, Центр Мантона возглавит следующий этап работы за счет гранта от Фонда OpenAI. Грант поддержит более широкие усилия Центра по разработке независимого от платформ, недорогого генетического ИИ-помощника, который поможет клиническим группам быстрее и последовательнее анализировать случаи редких заболеваний.

Долгосрочная исследовательская возможность заключается в том, чтобы выяснить, может ли поддерживаемый экспертами переанализ с помощью ИИ помочь научному пониманию идти в ногу с открытиями. Перспектива заключается не в том, чтобы ИИ заменял диагноз врача, а в том, что тщательно оцененные исследовательские инструменты могут помочь специалистам выявить доказательства, заслуживающие изучения. Для тысяч семей сегодняшние оставшиеся без ответа вопросы не обязательно должны оставаться без ответа навсегда.

Автор

OpenAI

Полный текст статьи читайте на OpenAI