Google научила AMIE проводить видеоконсультации на уровне врачей

Google Research представила AMIE (Video), версию своей исследовательской медицинской ИИ-системы AMIE (Articulate Medical Intelligence Explorer), которая проводит клиническую консультацию синхронно по видеосвязи, а не текстовым чатом. Систему построили на базе Gemini и Project Astra. Авторы работы, старший научный сотрудник Google Анил Палепу (Anil Palepu) и руководитель исследования Майк Шекерманн (Mike Schaekermann) с соавторами.
Раньше AMIE работал только с текстом: пациент описывал симптомы словами, а система вела диагностический диалог, и уже показывала экспертный уровень в текстовых консультациях и в качестве инструмента дифференциальной диагностики для врачей. Но текстовый формат теряет часть клинической картины, походку, видимые признаки дискомфорта, дыхание, реакцию на приёмы физического осмотра, а пациентам с ограниченной цифровой или медицинской грамотностью трудно описать симптомы словами. AMIE (Video) убирает это ограничение: система в реальном времени распознаёт невербальные визуальные и звуковые сигналы, ведёт пациента через виртуальные приёмы физического осмотра и параллельно строит диагностические рассуждения.
Чтобы совместить разговорную скорость ответа с глубоким клиническим рассуждением, AMIE (Video) использует асинхронную мультиагентную архитектуру: работу делят три специализированных агента, которые действуют параллельно и непрерывно (конкретные роли агентов и названия рукавов исследования в источнике не раскрыты).
Основной результат, крупное рандомизированное исследование по формату OSCE (Objective Structured Clinical Examination) с синхронным видеоинтерфейсом. Оно охватило 100 клинических сценариев по пяти системам организма (сердечно-лёгочная, брюшная, ЛОР/голова/глаза, неврологическая/психиатрическая, опорно-двигательная). Пятнадцать обученных актёров-пациентов провели 300 стандартизированных консультаций в трёх рукавах исследования, включая сравнение с 30 сертифицированными врачами первичной помощи. Независимая комиссия из 20 опытных врачей первичной помощи оценивала все консультации по установленным клиническим шкалам.
Результаты: по основным клиническим компетенциям, полнота сбора анамнеза, точность диагностики, адекватность назначений, качество общения, эксперты оценили AMIE (Video) наравне с живыми врачами, а также на уровне или выше текстовой версии AMIE. В части физического осмотра и наблюдения AMIE (Video) оценили значительно выше, чем и врачей, и текстовую версию AMIE, система активнее и точнее выявляла физические признаки и вела пациентов через приёмы осмотра. Сами актёры-пациенты заметно предпочли видеоформат текстовому чату, назвав его удобнее и эффективнее для описания жалоб, и оценили AMIE (Video) выше по эмпатии, доверию и уверенности в качестве помощи, выше и врачей, и текстовой версии AMIE. Точные числовые оценки и p-значения этих сравнений в источнике не приведены, только заявленная статистическая значимость.
Авторы прямо оговаривают ограничения: исследование целиком проведено с профессиональными актёрами-пациентами в смоделированных условиях, а не с настоящими пациентами и реальными заболеваниями; часть клинических случаев, где аудиовизуальное восприятие критично, невозможно достоверно разыграть актёрски и потому их исключили. Отдельные автоматизированные проверки выявили эпизодические ошибки восприятия и рассуждений, а система периодически сталкивается с техническими сбоями, которые нарушают естественность разговора, Project Astra в этом продукте всё ещё прототип. Google называет проверку на реальных пациентах и реальных клинических случаях обязательным следующим шагом перед любыми выводами о практической пользе. Параллельно компания уже ведёт исследования текстовой версии AMIE в реальной практике, с Медицинским центром Beth Israel Deaconess и в общенациональном рандомизированном исследовании с Included Health.
Ключевые факты
- AMIE (Video), видеоверсия медицинского ИИ-ассистента AMIE на базе Gemini и Project Astra, ведёт клиническую консультацию в реальном времени и распознаёт визуальные и звуковые сигналы пациента
- Архитектура, три специализированных ИИ-агента, работающих параллельно и асинхронно, чтобы совместить разговорную скорость с глубоким клиническим рассуждением
- Рандомизированное OSCE-исследование: 100 клинических сценариев, 15 актёров-пациентов, 300 консультаций, 3 рукава, 30 врачей первичной помощи и комиссия из 20 экспертов-оценщиков
- По ключевым клиническим компетенциям систему оценили наравне с врачами и выше текстовой версии AMIE; в физическом осмотре, значительно выше и врачей, и текстовой версии
- Исследование проведено только с актёрами-пациентами в смоделированных условиях; Google называет проверку на реальных пациентах обязательным следующим шагом
Почему это важно
Текстовый формат медицинского ИИ теряет часть клинической картины: пациент вынужден словами описывать то, что врач обычно видит и слышит сам, походку, дыхание, признаки дискомфорта, реакцию на приём осмотра. AMIE (Video), первая демонстрация того, что ИИ-система в реальном времени по видео способна вести клиническую консультацию на уровне живого врача, а не только отвечать текстом.
Кому это важно
Разработчикам телемедицинских сервисов и врачам первичной помощи, как ориентир, где ИИ-ассистент уже сопоставим с человеком, а где ещё нет. Регуляторам и медицинским учреждениям, которые оценивают допустимость ИИ в клинической практике. Исследователям в области клинического ИИ, как методику оценки аудиовизуальных компетенций через таксономию и OSCE-формат.
Как это применить
AMIE (Video), исследовательский прототип на базе Gemini и Project Astra, не коммерческий продукт: Google явно называет Project Astra прототипом с техническими ограничениями. Параллельно компания уже тестирует текстовую версию AMIE в реальной практике, в клиническом исследовании с Beth Israel Deaconess Medical Center и в общенациональном рандомизированном исследовании с Included Health; это ближайший путь, по которому наработки видеоверсии могут дойти до реальной телемедицины.
Можно ли доверять
Результаты получены в контролируемом рандомизированном исследовании с независимой комиссией из 20 врачей-оценщиков, это методологически сильная постановка. Но исследование опубликовано самой Google, без точных числовых оценок и p-значений сравнений (заявлена лишь статистическая значимость), и проведено полностью с профессиональными актёрами-пациентами, а не реальными больными, сами авторы называют это ключевым ограничением.
Риски и подводные камни
Сценарии для актёров-пациентов ограничены случаями, которые можно достоверно сыграть, из выборки выпали клинические ситуации, где аудиовизуальное восприятие как раз может быть решающим. Автоматизированные проверки фиксируют отдельные ошибки восприятия и рассуждений, а система периодически сталкивается с техническими сбоями, нарушающими естественность диалога. Никаких сроков выхода на реальных пациентов Google не называет, проверка на живых людях с настоящими заболеваниями пока не проведена.