Разработка клинического ИИ-ассистента совместно с Penda Health
Исследование 40 000 посещений пациентов показало, что врачи, использующие ИИ-ассистент, совершали меньше ошибок.
Системы искусственного интеллекта обладают потенциалом для улучшения здоровья человека во всем мире: делают надежную информацию о здоровье повсеместно доступной, помогают врачам оказывать более качественную помощь и дают людям возможность лучше понимать свое здоровье и отстаивать свои интересы в этой сфере.
Производительность и безопасность больших языковых моделей (LLM) в сфере здравоохранения продолжают расти. Производительность моделей OpenAI на бенчмарке HealthBench выросла вдвое при переходе от GPT‑4o к o3, а передовые модели часто превосходят экспертов в таких задачах, как диагностическое рассуждение и клиническое обобщение. Тем не менее, внедрение таких решений для решения реальных проблем пациентов и врачей остается медленным. Чтобы реализовать потенциал LLM в здравоохранении, экосистеме необходимо преодолеть разрыв между моделью и ее внедрением (model-implementation gap) — пропасть между тем, что модели могут делать, и тем, как они используются на практике.
Чтобы продвинуть исследования в области практического внедрения, OpenAI заключила партнерское соглашение с Penda Health — провайдером первичной медико-санитарной помощи, работающим в Найроби (Кения) с 2012 года, — для проведения новаторского исследования клинического второго пилота (копилота) Penda на базе LLM. Компания Penda создала своего копилота, AI Consult, чтобы предоставлять врачам рекомендации, созданные LLM, в ключевые моменты визита пациента. AI Consult действует как система безопасности в реальном времени, которая активируется только тогда, когда может возникнуть ошибка, оставляя полный контроль в руках врача.
В ходе исследования 39 849 визитов пациентов в 15 клиниках у врачей, использовавших AI Consult, наблюдалось относительное сокращение диагностических ошибок на 16% и ошибок лечения на 13% по сравнению с теми, кто работал без него.
Мы считаем, что этот результат стал следствием трех ключевых факторов:
- Мощная модель: в копилоте Penda использовалась GPT‑4o с августа 2024 года, и с тех пор модели стремительно совершенствовались. Производительность модели больше не является ограничивающим фактором.
- Клинически адаптированное внедрение: копилот разрабатывался совместно с клиническими специалистами, чтобы гарантировать, что он действительно поддерживает, а не нарушает рабочий процесс оказания помощи.
- Активное развертывание: Penda приложила значительные усилия, чтобы помочь врачам понять, зачем и как использовать копилот, что имело решающее значение для его принятия.
Сегодня мы публикуем результаты исследования вместе с подробным обзором успешного внедрения Penda, предлагая экосистеме ранний шаблон безопасного и эффективного использования LLM для поддержки врачей.
Для проведения исследования мы активно взаимодействовали с местными заинтересованными сторонами. Этот проект по исследованию качества был одобрен Комитетом по этическим и научным исследованиям AMREF Health Africa, Министерством здравоохранения Кении, Агентством цифрового здравоохранения и Департаментом здравоохранения округа Найроби, а также проводился в рамках исследовательской лицензии Национальной комиссии Кении по науке, технологиям и инновациям.
Первичная медико-санитарная помощь, Penda Health и AI Consult
Системы ИИ могут быть особенно полезны в первичном звене здравоохранения. Врачи общей практики принимают пациентов всех возрастов, с заболеваниями любых систем органов и видов болезней, зачастую в течение одного дня, что требует огромного багажа знаний. Такая сложность делает медицинские ошибки распространенным явлением: ВОЗ сообщает, что вред пациентам в первичном звене здравоохранения является как распространенным, так и предотвратимым явлением.
Penda Health — это социальное предприятие, целью которого является предоставление высококачественной и доступной медицинской помощи. Penda управляет 16 клиниками, каждая из которых оказывает услуги первичной медико-санитарной помощи, неотложной помощи, а также имеет лабораторные службы и аптеку. Эти клиники открыты круглосуточно и принимают почти полмиллиона пациентов ежегодно. Penda уделяет исключительное внимание качеству ухода, реализуя активную программу обучения врачей и контроля качества, а также разработала и протестировала предыдущие итерации систем-копилотов.

После выпуска ChatGPT главный медицинский директор Penda, доктор Роберт Кором (Dr. Robert Korom), осознал, как LLM могут обеспечить более качественную поддержку принятия решений за счет охвата более широкого спектра состояний и потенциальных ошибок, чем это было возможно ранее. В ответ на это компания Penda создала один из первых клинических копилотов на базе LLM, позволяющий врачам при желании запросить второе мнение у модели. В ходе внутреннего аудита Penda изучила 100 результатов работы LLM для реальных случаев приема пациентов и обнаружила множество ситуаций, когда ответы модели были полезны, и ни одного случая, когда они нанесли бы вред. Тем не менее, эта ранняя версия AI Consult получила ограниченное распространение, поскольку требовала от врачей активного запроса помощи и прерывала ход взаимодействия с пациентом.

Итерации на пути к клинически адаптированному внедрению
В начале 2025 года компания Penda разработала новую версию AI Consult, которая действует как система безопасности в реальном времени в рамках рабочего процесса врача. Этот копилот интегрирован в электронную медицинскую карту, которую врачи Penda используют ежедневно, и работает в фоновом режиме во время каждого визита. Когда врачи общаются с пациентами и документируют визиты, обезличенная медицинская документация отправляется в OpenAI API в ключевые моменты. Затем AI Consult предоставляет врачам необходимые отзывы на основе текущего клинического взаимодействия. Предусмотрено три типа ответов:
- Зеленый: означает отсутствие проблем; отображается в виде зеленой галочки.
- Желтый: указывает на умеренные проблемы; отображается в виде значка звонящего колокольчика, который врачи могут просмотреть по желанию.
- Красный: указывает на критические проблемы с безопасностью; появляется во всплывающем окне, которое врачи обязаны просмотреть перед продолжением работы.
Компания Penda разработала AI Consult с учетом требований безопасности пациентов. Копилот действует как система защиты, выявляя потенциальные ошибки для проверки врачом, а не предпринимая действия от его имени. Важно отметить, что на каждом этапе рабочий процесс контролируют клиницисты: когда копилот выявляет потенциальные ошибки, врачи могут сами решать, изменять ли свои решения на основе полученных отзывов, при этом окончательное решение всегда остается за врачом. AI Consult был адаптирован к специфике Penda: промпты включают данные кенийской эпидемиологии, руководство по местным клиническим рекомендациям и стандартные процедуры клиник Penda.
AI Consult указывает на важный пропущенный диагноз железодефицитной анемии, побуждая врача добавить этот диагноз для назначения соответствующего лечения.
Проведенные исследования: Развернутый клинический анализ крови (РКАК): * Лейкоциты (WBC): 12.38 * Гемоглобин (HGB): 9.90 * Гематокрит (HCT): 30.70 * Тромбоциты (Plt): 248.00 * Эритроциты (RBC): 5.26 * MCV: 58.30 * MCH: 18.80 * MCHC: 32.20 Тест на антиген стрептококка группы А: * Результат: Отрицательный Диагноз: тонзиллит, острый бактериальный
Обоснование: Клиническая документация указывает на наличие микроцитарной анемии с уровнем гемоглобина 9.90 г/дл и MCV 58.30 фл, что свидетельствует об анемии, которая не отражена в диагнозе. Наличие микроцитарной анемии следует оценивать наряду с текущим симптомом рвоты. Рекомендации: Переоцените диагноз с учетом значимого обнаружения микроцитарной анемии, которая не была учтена. Исследуйте первопричины анемии, такие как дефицит железа или хроническое заболевание. Рассмотрите возможность проведения дополнительных анализов на показатели обмена железа или углубленного исследования рациона питания. Убедитесь, что анемия включена в план лечения для устранения этой критической находки.
Проведенные исследования: Развернутый клинический анализ крови (РКАК): * Лейкоциты (WBC): 12.38 * HGB: 9.90 * HCT: 30.70 * Plt: 248.00 * RBC: 5.26 * MCV: 58.30 * MCH: 18.80 * MCHC: 32.20 Тест на антиген стрептококка группы А: * Результат: Отрицательный Диагнозы: тонзиллит, острый бактериальный, рвота неуточненная, железодефицитная анемия, шкала фарингита при стрептококке группы А <2
Активное развертывание для эффективного внедрения врачами
Penda внедрила AI Consult для случайно выбранной половины своих врачей в рамках практики по улучшению качества обслуживания. Это развертывание проходило в два этапа: период адаптации (30 января — 28 февраля) и основной период (1 марта — 17 апреля).
В период адаптации компания использовала отзывы врачей для совершенствования копилота. Это включало в себя устранение технических проблем, которые невозможно было выявить при тестировании (например, некорректное срабатывание в некоторых случаях), и доработку рабочих процессов клиницистов (например, срабатывание предупреждения об отсутствии измерения артериального давления при осмотре ребенка, хотя в Penda рутинное измерение давления детям не проводится). В этот период Penda также заметила, что врачи только учились пользоваться AI Consult — например, они часто игнорировали красные предупреждения, поскольку не осознавали их важности, — что указало на необходимость помощи врачам в правильном использовании инструмента.
В течение основного периода Penda предприняла несколько шагов, чтобы помочь клиницистам эффективнее использовать AI Consult. К ним относятся:
- Взаимодействие: коллеги-лидеры и руководители филиалов объясняли важность копилота, знакомили коллег с его сильными сторонами и ограничениями, а также предлагали индивидуальный коучинг для поддержки внедрения.
- Измерение: Penda отслеживала, как часто врачи взаимодействуют с рекомендациями AI Consult, и организовывала персонализированное наставничество.
- Стимулирование: руководство по качеству Penda отмечало врачей и клиники, которые успешно использовали AI Consult.
Penda сотрудничала с OpenAI для анализа последствий внедрения копилота, сравнивая медицинскую помощь, оказываемую врачами, у которых был доступ к AI Consult, и теми, у кого его не было. OpenAI оказала финансовую поддержку исследования и консультировала по вопросам дальнейшего развития копилота.
В анализ включались только те пациенты, которые дали индивидуальное согласие на использование их данных в исследовании по улучшению качества, причем они могли отозвать свои данные по запросу. Комитет по этическим и научным исследованиям AMREF постановил, что дополнительного согласия для данного исследования не требуется.
Результаты исследования: AI Consult значительно снизил количество диагностических ошибок и ошибок лечения
В исследовании проанализированы данные 39 849 визитов пациентов: 20 859 в группе с AI Consult (группа ИИ) и 18 990 в группе без него (группа без ИИ).
Влияние на качество медицинской помощи
108 независимых врачей (29 из Кении) оценили итоговую документацию и решения по 5666 случайно выбранным визитам с целью выявления ошибок. Они оценивали четыре параметра: качество сбора анамнеза; уместность назначенных исследований; правильность поставленного диагноза и правильность назначенного лечения.
Количество ошибок во всех четырех категориях оказалось значительно ниже в группе ИИ по сравнению с группой без ИИ. Ошибки при сборе анамнеза сократились на 32%, ошибки при назначении исследований — на 10%, диагностические ошибки — на 16%, а ошибки в лечении — на 13%. Этот эффект был еще более выражен в случаях, когда AI Consult выдавал хотя бы одно красное предупреждение: в таких визитах ИИ снизил количество диагностических ошибок на 31%, а ошибок лечения — на 18%.
Уровни значимости обозначаются звездочками: ★ для p ≤ 0,05, ★★ для p ≤ 0,01 и ★★★ для p ≤ 0,001.
Эти показатели эффективности сопоставимы с программами рационального применения антибиотиков или системами оповещения, стимулирующими назначение статинов пациентам, которым они необходимы. При этом результаты достигаются с помощью единой системы, способной поддерживать самые разные клинические решения. В абсолютном выражении внедрение AI Consult позволило бы предотвратить диагностические ошибки при 22 000 визитов и ошибки лечения при 29 000 визитов ежегодно только в сети Penda.
Мы также изучили конкретные типы ошибок, которые помог сократить AI Consult. Выяснилось, что в группе ИИ реже пропускают ключевые детали анамнеза, упускают из виду важные исследования или ошибаются в основном диагнозе. Кроме того, врачи, использовавшие ИИ, реже допускали ошибки при назначении лекарств или упускали важные моменты обучения пациентов.
Уровни значимости обозначаются звездочками: ★ для p ≤ 0,05, ★★ для p ≤ 0,01 и ★★★ для p ≤ 0,001.
Эффект активного развертывания
Работа компании Penda по активному развертыванию оказалась поразительно эффективной. Одним из показателей, которые отслеживала Penda, была частота случаев с оставленными красными предупреждениями: процент визитов, в рамках которых имели место красные предупреждения в любой из категорий (или имели бы место для группы без использования ИИ), и при этом врачи не приняли меры по их устранению.
В период вводного обучения частота случаев с оставленными красными предупреждениями была схожей у групп с ИИ и без ИИ и составляла 35–40%, что говорит о том, что врачи, использовавшие ИИ, лишь иногда реагировали на красные предупреждения. Как только Penda приступила к активному развертыванию, этот показатель в группе с ИИ снизился до 20%, в то время как в группе без ИИ он остался на уровне около 40%. Это подчеркивает, насколько важным было активное развертывание для эффективности AI Consult.
Мы провели анонимный опрос среди врачей Penda (получив их согласие) относительно влияния AI Consult на качество оказываемой ими помощи. Все респонденты из группы с ИИ сообщили, что AI Consult помог им улучшить качество медицинской помощи, причем 75% охарактеризовали этот эффект как «существенный».
Врачи из группы с ИИ не просто пользовались AI Consult — они росли вместе с ним. Один из врачей отметил: «В нескольких случаях это помогло мне принять правильное клиническое решение», в то время как другие назвали систему «консультантом в кабинете» и охарактеризовали ее как «одно из лучших нововведений в Penda». Они также описали ее как «инструмент обучения», который помог им расширить медицинские знания и отточить клинические навыки. Данные исследования подтвердили это восприятие: врачи, использующие ИИ, со временем стали реже сталкиваться с необходимостью реагировать на красные предупреждения (их доля снизилась с 45% визитов в начале исследования до 35% в конце). Это означает, что они научились избегать типичных ошибок еще до получения обратной связи от AI Consult. Наряду с энтузиазмом врачи также указали на возможности для улучшения, особенно в отношении локализации и скорости работы.
Влияние на результаты лечения пациентов
В рамках стандартной практики в Penda сотрудники звонят пациентам, давшим на это согласие, через восемь дней после визита, чтобы узнать, чувствуют ли они себя лучше. В группе с ИИ 3,8% пациентов чувствовали себя не лучше, в то время как в группе без ИИ этот показатель составил 4,3%. Данная разница не была статистически значимой. Частота обращения пациентов за дополнительной медицинской помощью за пределами Penda — еще один показатель качества, который собирает компания — также оказалась схожей в обеих группах.
Сотрудники Penda также могут составлять отчеты о безопасности пациентов в случаях потенциального вреда. Было зафиксировано 7 таких отчетов в группе с ИИ и 5 в группе без ИИ, каждый из которых был изучен командой Penda. Ни в одном случае рекомендации AI Consult не привели к нанесению вреда. Более того, в ряде случаев советы AI Consult потенциально могли бы предотвратить вред, если бы они были своевременно получены или учтены.
Куда мы движемся дальше
Наша работа с Penda была обусловлена общим стремлением расширить доступ к безопасной и высококачественной медицинской помощи. По всему миру пациенты часто сталкиваются с ограниченным доступом к лечению или предотвратимым вредом для здоровья. Мы провели это исследование не просто как технический эксперимент, а как попытку понять, как ИИ может практическим и ответственным образом помочь врачам заботиться о людях.
Дополнением к этой публикации в блоге служит полноценный исследовательский документ, посвященный данному исследованию, системе AI Consult и опыту ее развертывания в Penda. Мы надеемся, что эта работа послужит источником вдохновения и практического руководства для других организаций здравоохранения, стремящихся расширить границы применения искусственного интеллекта в медицине.
Мы верим, что AI Consult представляет собой ранний, многообещающий архетип клинического второго пилота (copilot), а не его окончательную форму. Мы ожидаем, что экосистема здравоохранения будет способствовать дальнейшему совершенствованию внедрения — например, созданию интерфейса с голосовым управлением для снижения нагрузки по ведению документации или агента, способного вносить изменения в медицинскую карту после подтверждения врачом. Для дальнейшего изучения влияния таких помощников на результаты лечения пациентов, валидации этих внедрений и их трансформации в готовые шаблоны для успешного масштабирования необходимы последующие исследования. В настоящее время Penda совместно с организацией PATH проводит рандомизированное контролируемое исследование с целью более детальной оценки влияния на результаты лечения пациентов.
По мере развития моделей ИИ главной проблемой становится уже не производительность самих моделей, а их практическое внедрение в реальных условиях. Ликвидация разрыва между возможностями модели и ее внедрением потребует скоординированных усилий всей экосистемы медицинского ИИ, включая строгую оценку и итеративное развертывание в клинических условиях. Мы верим, что медицинские помощники на базе ИИ начинают входить в «окно Овертона» для ответственного внедрения. Продолжая изучать и масштабировать эти системы, мы надеемся, что ИИ станет надежной частью стандартов медицинской помощи — как это уже происходит в Penda Health — для достижения лучших результатов лечения пациентов во всем мире.
Авторы
Robert Korom, Sarah Kiptinness, Najib Adan, Kassim Said, Catherine Ithuli, Oliver Rotich, Boniface Kimani, Irene King’ori, Stellah Kamau, Elizabeth Atemba, Muna Aden, Preston Bowman, Michael Sharman, Rebecca Soskin Hicks, Rebecca Distler, Johannes Heidecke, Rahul K. Arora, Karan Singhal
Благодарности
Amelia Glaese, Benjamin Kinsella, Dorothy Cheboi, Lilian Weng, Magdalene Kaisa, Nino Jananashvili, Phoebe Thacker, Rachel Ndiema, Spruce Campbell, Stephanie Koczela, Wyatt Thompson
Мы хотели бы поблагодарить следующих рецензентов за ценные отзывы: Ethan Goh, Fred Mutisiya, Isaac Kohane, Nigam Shah и Steven Wanyee. Ответственность за любые возможные ошибки лежит на нас.
Мы также выражаем благодарность врачам-рецензентам, оценившим качество клинической документации для данного исследования.
Полный текст статьи читайте на OpenAI
