ИИ-модели обошли врачей традиционной китайской медицины в разборе 349 случаев
Исследователи собрали библиотеку из 349 обезличенных амбулаторных случаев традиционной китайской медицины (ТКМ) из 62 больниц. На основе 60 показательных случаев из этой библиотеки они сравнили 16 ИИ-моделей с контрольной группой из 60 практикующих врачей ТКМ. Ответы моделей и заключения врачей были обезличены и оценены пятью старшими экспертами ТКМ по девяти диагностическим и лечебным критериям.
Передовые ИИ-модели общего назначения получили от экспертов более высокие оценки, чем врачи-люди, особенно по разделам медицинских рекомендаций, принципов лечения и части диагностических задач. Источник не приводит разбивку результатов по конкретным моделям и не называет их поимённо, сравнение дано только как результат группы «передовых моделей общего назначения» против врачей.
При этом анализ уровня рецептов выявил расхождения в выборе трав, дозировках и стратегии лечения. Качественная проверка безопасности обнаружила у моделей галлюцинации и нежелательные шаблонные, «конвейерные» ответы. Источник не уточняет, какие именно травы, дозировки или модели были связаны с этими проблемами. Авторы делают вывод: результаты показывают потенциал ИИ как инструмента поддержки решений в ТКМ, но подчёркивают необходимость контроля со стороны врача, ограничений безопасности и проспективной клинической проверки, прежде чем такие модели можно будет использовать на практике.
Ключевые факты
- Библиотека из 349 обезличенных амбулаторных случаев ТКМ собрана из 62 больниц
- 16 ИИ-моделей сравнили с 60 практикующими врачами ТКМ на 60 отобранных случаях
- Оценку давали пять старших экспертов ТКМ по девяти диагностическим и лечебным критериям
- Модели обошли врачей по медицинским рекомендациям, принципам лечения и части диагностики
- На уровне рецептов у моделей нашли расхождения в травах и дозировках, галлюцинации и шаблонные ответы
Почему это важно
Это одно из немногих прямых сравнений ИИ-моделей с практикующими врачами не на абстрактных тестах, а на реальных амбулаторных случаях из десятков больниц, да ещё в узкой и специфичной области, традиционной китайской медицине. Результат неоднозначен: по части задач (общие рекомендации, принципы лечения, часть диагностики) модели оценены экспертами выше врачей, но именно там, где цена ошибки выше всего, в конкретных рецептах, у моделей нашли расхождения в выборе трав и дозировках, а также галлюцинации и шаблонные ответы.
Кому это важно
Разработчикам медицинских ИИ-инструментов и исследователям, оценивающим применимость языковых моделей в клинической практике, особенно в традиционных и нишевых медицинских системах, где обучающих данных меньше и стандарты лечения устроены иначе, чем в западной медицине. Также важно врачам и регуляторам, рассматривающим ИИ как инструмент поддержки диагностики.
Как это применить
Источник не описывает модели как готовый продукт с ценой или доступом, это исследовательская работа, сравнивающая существующие модели на собранном авторами наборе случаев. Практический вывод для тех, кто хочет использовать ИИ в медицинском консультировании: доверять общим рекомендациям и формулировкам принципов лечения можно с осторожностью, но конкретные назначения, травы, дозировки, схему лечения, должен проверять и утверждать врач, а не модель самостоятельно.
Можно ли доверять
Источник, научная работа с полным описанием методики (число случаев, больниц, моделей, врачей, экспертов и критериев оценки), поэтому цифрам можно доверять в пределах того, что раскрыл текст. Но в тексте нет названий конкретных моделей, ни их индивидуальных результатов, ни авторов, институтов или даты проведения исследования, сравнение дано только на уровне группы «передовые модели общего назначения» против врачей, без детализации.
Риски и подводные камни
Главный риск назван в самом источнике: расхождения в рецептах (травы, дозировки, стратегия лечения), галлюцинации и шаблонные, неестественные ответы моделей при качественной проверке безопасности. Это означает, что более высокая экспертная оценка по общим рекомендациям не означает готовность моделей заменить врача в конкретных клинических назначениях, авторы прямо указывают на необходимость врачебного контроля, ограничений безопасности и дальнейшей проспективной проверки, прежде чем расширять применение таких моделей.