Ученые усомнились в готовности ИИ оказывать помощь в здравоохранении

Nature: искусственный интеллект не готов для применения в здравоохранении
Баюшкина Наталья Сергеевна
Фото: ИЗВЕСТИЯ/Юлия Майорова

За последние несколько лет искусственный интеллект совершил настоящий прорыв в медицине. Современные нейросети научились анализировать рентгеновские снимки, выявлять опухоли, составлять медицинские заключения и даже успешно сдавать экзамены, которые проходят будущие врачи. На этом фоне все чаще звучат прогнозы, что уже в ближайшие годы ИИ сможет заменить часть медицинских специалистов. Однако сами ученые призывают не торопиться с такими выводами. Новое исследование показало: высокие результаты искусственного интеллекта (ИИ) на тестах вовсе не означают, что ему можно доверить лечение реальных пациентов. О том, почему медицинские нейросети пока остаются лишь помощниками врачей и какие препятствия стоят на пути к их полноценному внедрению в здравоохранение, — в материале «Известий».

Почему пятерка на экзамене еще не делает ИИ хорошим врачом

За последние два года крупные языковые модели неоднократно становились героями громких новостей. Одни успешно проходили американский медицинский экзамен USMLE, другие демонстрировали результаты, сопоставимые с ответами опытных врачей на клинические вопросы. Подобные достижения породили ощущение, что искусственный интеллект уже практически готов работать с пациентами самостоятельно. Однако авторы нового исследования в журнале Nature Medicine считают, что именно такая логика сегодня становится одной из главных ошибок при оценке медицинского ИИ.

Исследователи обращают внимание на проблему, которую называют «benchmark ≠ readiness» («эталон ≠ готовность») — другими словами, успешное прохождение тестов еще не означает готовности к работе в реальной клинике. Большинство современных оценок строится на заранее подготовленных наборах задач, где существует правильный ответ. Настоящая медицина устроена совершенно иначе: пациенты редко описывают симптомы по учебнику, заболевания могут маскировать друг друга, результаты анализов бывают противоречивыми, а врачу нередко приходится принимать решения в условиях неполной информации.

Авторы сравнивают такую ситуацию с экзаменом для пилота: человек может идеально ответить на вопросы по аэродинамике и навигации, но это еще не означает, что он справится с посадкой самолета во время грозы. По мнению исследователей, с медицинским искусственным интеллектом происходит нечто похожее: модели отлично решают стандартные задачи, однако реальная клиническая практика требует гораздо большего — умения работать с неопределенностью, неожиданными обстоятельствами и уникальными особенностями каждого пациента.

Именно поэтому ученые предлагают отказаться от привычного подхода, при котором успех ИИ оценивают только по количеству правильных ответов. Вместо этого они призывают проверять модели в условиях, максимально приближенных к настоящей работе врача: оценивать, как алгоритмы взаимодействуют с медицинским персоналом, реагируют на неполные данные, объясняют свои выводы и ведут себя в нестандартных ситуациях.

Главная проблема — медицина не похожа на экзамен

Одной из самых серьезных проблем современных нейросетей остаются так называемые галлюцинации — ситуации, когда модель уверенно выдает информацию, которая не соответствует действительности. В обычной жизни подобная ошибка может привести к неправильному пересказу статьи или вымышленной ссылке на научную работу. В медицине же цена такой неточности оказывается значительно выше: алгоритм способен назвать несуществующий препарат, ошибиться в дозировке или сослаться на клинические рекомендации, которых никогда не существовало.

Не менее серьезной проблемой исследователи называют смещение данных, на которых обучаются модели. Если алгоритм анализировал преимущественно истории болезни пациентов определенного возраста, пола или происхождения, его точность может заметно снижаться при работе с другими группами людей. Именно поэтому многие специалисты считают, что медицинский ИИ необходимо проверять на максимально разнообразных данных еще до его внедрения в больницы.

Еще одна особенность искусственного интеллекта заключается в том, что он редко демонстрирует неуверенность. В отличие от врача, который может назначить дополнительные исследования или направить пациента к профильному специалисту, языковая модель зачастую формулирует ответ так, будто полностью уверена в своей правоте. По мнению авторов обзоров Nature Medicine, именно эта «ложная уверенность» считается одним из самых опасных качеств современных нейросетей, поскольку человеку бывает трудно понять, где алгоритм действительно прав, а где лишь убедительно ошибается.

Наконец, медицина — это не только анализ симптомов и постановка диагноза. Врачу приходится учитывать психологическое состояние пациента, объяснять сложные решения родственникам, замечать детали, которые невозможно свести к цифрам, и брать на себя ответственность за принятое решение. Пока ни одна языковая модель не способна полноценно воспроизвести эту сторону клинической практики. Именно поэтому большинство исследователей сегодня рассматривают искусственный интеллект не как замену врачу, а как инструмент, который может помочь специалисту быстрее анализировать информацию, но не должен принимать окончательные решения самостоятельно.

Почему большинство исследований пока ничего не доказывают

Несмотря на стремительное развитие медицинского искусственного интеллекта, ученые до сих пор не могут однозначно ответить на главный вопрос: действительно ли такие системы улучшают здоровье пациентов. Причина заключается в том, что большинство исследований оценивают работу алгоритмов в искусственных условиях — на экзаменационных вопросах, заранее подготовленных клинических случаях или наборах медицинских изображений. До реальной практики доходит лишь небольшая часть подобных разработок.

Это подтверждает масштабный обзор, также опубликованный в Nature Medicine ранее. Исследователи проанализировали 4609 научных работ, посвященных большим языковым моделям в клинической медицине. Оказалось, что подавляющее большинство исследований проверяли способности ИИ в симуляциях или теоретических сценариях. Реальные пациенты фигурировали лишь примерно в четверти работ, а настоящих рандомизированных клинических испытаний — золотого стандарта современной медицины — авторы нашли всего 19.

По мнению исследователей, подобная ситуация напоминает испытания нового лекарства исключительно в лаборатории: даже если препарат отлично работает в пробирке, этого недостаточно, чтобы назначать его миллионам людей. Он должен пройти несколько этапов клинических исследований, доказать безопасность, эффективность и только после этого попасть в больницы. Авторы считают, что медицинский ИИ нуждается в столь же строгой системе проверки, поскольку цена ошибки в здравоохранении слишком высока.

Именно поэтому в последние годы ученые начали разрабатывать специальные международные рекомендации по внедрению искусственного интеллекта в клиническую практику. Одной из таких инициатив стал проект DECIDE-AI, предлагающий единые правила оценки медицинских алгоритмов перед их использованием в больницах. Исследователи считают, что нейросети должны проходить поэтапную проверку — от лабораторных испытаний до работы в реальных клиниках под постоянным контролем специалистов. По сути, речь идет о создании для ИИ такой же системы испытаний, какая уже существует для новых лекарств и медицинских технологий.

Сможет ли ИИ однажды стать врачом

При этом сами ученые вовсе не считают искусственный интеллект тупиковой технологией. Напротив, уже сегодня нейросети помогают врачам находить опухоли на компьютерной томографии, быстрее анализировать рентгеновские снимки, выявлять признаки диабетической ретинопатии, искать редкие заболевания и автоматизировать подготовку медицинской документации. Во многих задачах ИИ способен значительно сократить время обработки информации и уменьшить нагрузку на специалистов.

Однако практически все современные исследования сходятся в одном: на нынешнем этапе развития искусственный интеллект должен рассматриваться прежде всего как инструмент поддержки принятия решений, а не как самостоятельный участник лечебного процесса. Окончательный диагноз, выбор метода лечения и ответственность за пациента по-прежнему остаются за врачом, который способен учитывать множество факторов, недоступных алгоритму, — от особенностей течения заболевания до эмоционального состояния человека и нюансов общения с его семьей.

Авторы новой статьи в Nature Medicine подчеркивают: главная задача ближайших лет заключается не в том, чтобы научить нейросети еще лучше отвечать на экзаменационные вопросы, а в создании новых способов оценки их надежности в реальной медицине. Искусственный интеллект должен демонстрировать не только высокую точность, но и устойчивость к неполным данным, способность корректно взаимодействовать с врачами, объяснять свои выводы и безопасно работать в самых разных клинических ситуациях.

История медицины уже не раз показывала, что даже самые перспективные технологии требуют длительной проверки, прежде чем становятся частью повседневной практики. Искусственный интеллект, вероятно, тоже пройдет этот путь. Сегодня он уже способен существенно облегчить работу врачей, но до момента, когда алгоритму можно будет безоговорочно доверить человеческую жизнь, наука, по мнению самих исследователей, еще не дошла. Высокий балл на экзамене оказался лишь первым шагом — впереди у медицинского ИИ гораздо более сложное испытание: встреча с реальным пациентом.