Google научила ИИ-агента SymptomAI ставить диагнозы точнее врачей
Google Research и Google DeepMind представили исследовательский проект SymptomAI, экспериментального разговорного ИИ-агента для опроса пациентов о симптомах и постановки дифференциального диагноза (DDx, списка вероятных диагнозов). Агент построен на модели Gemini Flash 2.0 и существовал в пяти вариантах, различавшихся стратегией опроса.
В исследовании приняли участие 13 917 добровольцев: каждый случайно попадал на одного из пяти агентов SymptomAI, описывал свои симптомы и получал дифференциальный диагноз с рекомендациями по дальнейшим действиям. Через две недели участников просили сообщить, какой диагноз им поставил врач на очном приёме. Все диагнозы ИИ в исследовании носили исключительно исследовательский характер и не являлись официальным медицинским заключением.
Для оценки точности команда собрала коллегию из трёх сертифицированных врачей, которые вслепую изучали расшифровки бесед и сравнивали диагнозы от SymptomAI с диагнозами, независимо поставленными другими врачами по тем же расшифровкам. В более чем 50% случаев эксперты предпочли список диагнозов от SymptomAI спискам от других врачей. По метрике top-5 accuracy (попадает ли реальный диагноз пациента, поставленный его лечащим врачом, в пятёрку вариантов от ИИ) эксперты чаще признавали точным именно список SymptomAI, чем список коллег-людей.
Исследователи также сравнили пять стратегий опроса: два варианта давали агенту полную свободу задавать уточняющие вопросы (Dynamic Live и Dynamic Final), два, ограничивали его стандартным набором вопросов из медицинского образования (Fixed Canonical и Flexible Canonical), а пятый (Base) представлял собой обычный чат-бот без структурированного опроса, аналог того, как люди сегодня консультируются с ИИ. Все варианты с активным опросом значимо обошли базовый вариант без вопросов: именно уточняющие вопросы, а не сама по себе языковая модель, дают основной прирост точности. Преимущество SymptomAI над врачами оказалось наибольшим в тех случаях, где сами клиницисты меньше всего были уверены в собственном диагнозе.
Отдельно команда сопоставила диагнозы SymptomAI с данными фитнес-браслетов Fitbit, которые участники носили до 30 дней перед разговором с агентом. Для случаев, которые SymptomAI классифицировал как острые респираторные инфекции, исследователи обнаружили заметные сдвиги в физиологических показателях, сердечно-сосудистой активности, дыхании, температуре кожи и качестве сна, в дни, предшествующие обращению с симптомами, причём пик этих сдвигов совпадал с датой, когда участник сообщил о симптомах. Это стало независимым физиологическим подтверждением того, что диагнозы ИИ соответствуют реальному состоянию участников.
Авторы называют SymptomAI исследовательским прототипом, а не готовым продуктом, и указывают на ограничения: врачи-эксперты в исследовании оценивали только текстовые расшифровки бесед, не имея возможности сами задавать вопросы или проводить осмотр, а значит могли упустить сигналы вроде языка тела или физического осмотра; дифференциальный диагноз, снимок состояния в конкретный момент, который не учитывает, как болезнь могла измениться со временем. Работа выполнена при равном вкладе Джо Бреды (Joseph Breda), Джейка Саншайна (Jake Sunshine) и Дэниела Макдаффа (Daniel McDuff).
Ключевые факты
- Google Research провела национальное исследование на 13 917 участниках с разговорным ИИ-агентом SymptomAI на базе Gemini Flash 2.0
- В слепом сравнении врачи-эксперты предпочли диагнозы SymptomAI диагнозам других врачей более чем в 50% случаев
- По метрике top-5 accuracy SymptomAI чаще, чем врачи-люди, включал верный итоговый диагноз пациента в список из пяти вариантов
- Стратегии с активными уточняющими вопросами значимо обошли базовый режим чат-бота без структурированного опроса
- Диагнозы SymptomAI о респираторных инфекциях совпали с независимыми сдвигами в данных фитнес-браслетов Fitbit за дни до обращения
Почему это важно
Это одно из первых крупномасштабных исследований разговорного ИИ для дифференциальной диагностики, проведённое не на отобранных синтетических медицинских кейсах, а на реальных повседневных обращениях: участники сами, своими словами и с разным уровнем медицинской грамотности описывали симптомы, а не отвечали на заранее подготовленные учебные вопросы. До этого способности языковых моделей в диагностике проверяли в основном на искусственных клинических виньетках, что плохо отражает реальную вариативность симптомов. SymptomAI также впервые в таком масштабе сопоставил ИИ-диагнозы с независимыми физиологическими данными носимых устройств, что даёт объективное подтверждение результатов помимо самоотчётов участников.
Кому это важно
Прежде всего, исследователям в области ИИ для здравоохранения и разработчикам симптом-чекеров и телемедицинских сервисов: работа показывает, что структурированный опрос ИИ-агентом, а не просто языковая модель сама по себе, даёт основной прирост точности. Также это важно системам здравоохранения, которые ищут способы снизить финансовые, географические и организационные барьеры доступа к диагностике, и людям без быстрого доступа к врачу, которые хотят предварительно понять природу своих симптомов.
Как это применить
SymptomAI, исследовательский прототип, а не выпущенный продукт: агент недоступен как коммерческий сервис, цен или условий использования в материале нет. Практический потенциал, который описывают авторы, не готовое приложение, а инфраструктура для науки: точный ИИ-симптом-чекер может автоматически размечать диагнозы в больших популяционных выборках, что сейчас дорого делать вручную, и тем самым открыть крупномасштабные исследования связи симптомов с объективными физиологическими данными вроде показателей фитнес-браслетов.
Можно ли доверять
Материал, блог самой Google Research по мотивам её собственной научной статьи, оценивать нужно с поправкой на источник. Дизайн исследования достаточно строгий: рандомизация участников по пяти вариантам агента, слепая экспертная оценка тремя независимыми сертифицированными врачами, сравнение по двум разным метрикам (предпочтение экспертов и top-5 accuracy) и независимая проверка через объективные данные носимых устройств, которая по времени совпала с самоотчётами участников. Ограничение: итоговый диагноз пациента врачи-эксперты сверяли по данным опроса через две недели после визита к врачу, то есть часть данных строится на самоотчётах участников, а не на медицинских записях.
Риски и подводные камни
Врачи-эксперты в исследовании оценивали только текстовые расшифровки бесед и не могли сами задавать уточняющие вопросы или проводить осмотр, значит, могли упустить сигналы вроде языка тела, визуального осмотра или уже имеющихся у лечащего врача данных о пациенте. Дифференциальный диагноз, по своей природе снимок состояния в конкретный момент: из-за масштаба исследования авторы не контролировали, на каком этапе развития болезни участник обращался к SymptomAI, поэтому часть случаев могла быть заведомо проще или сложнее для диагностики. Авторы прямо подчёркивают, что все диагнозы в исследовании экспериментальные и не являются официальным медицинским заключением; SymptomAI пока не готовый к внедрению клинический инструмент.