Microsoft Research представила CARE-X, единую модель для рентгена грудной клетки

Microsoft Research представила CARE-X, единую модель для рентгена грудной клетки

Microsoft Research представила CARE-X, исследовательскую модель, объединяющую зрение и текст (VLM), для расшифровки рентгена грудной клетки. Радиологам нужен инструмент, который одновременно пишет развёрнутые заключения, отвечает на вопросы о наличии и месте находки, распознаёт медицинские устройства и их положение и указывает точную локализацию патологии на снимке. По мнению авторов, у существующих моделей три пробела: генеративные модели не дают калиброванной уверенности в диагнозе и не позволяют клиницистам настраивать баланс чувствительности и специфичности; стандартное обучение на кросс-энтропии штрафует все ошибки токенов одинаково, переворот «да» на «нет» или пропуск угрожающей жизни находки наказываются не строже опечатки; и модели не умеют считать признаки, которые требуют измерения, а не визуальной оценки, например, кардиоторакальный индекс для диагностики кардиомегалии.

CARE-X построена на визуальном энкодере SigLIP2-so400M и языковой модели Phi-4-mini-instruct (3,8 млрд параметров), соединённых лёгким адаптером. К общему языковому «стволу» добавлены вспомогательные головы (auxiliary heads) для классификации и локализации (grounding), они обучаются совместно с генеративной задачей, а не отдельно, и таким образом обогащают общие представления модели. За счёт этого при одном прямом проходе модель выдаёт и текстовый ответ, и структурированный прогноз с калиброванной оценкой уверенности, так называемый dual inference. Обучение идёт в три этапа SFT (предобучение зрения, обучение адаптера и голов, LoRA-адаптация), после которых следует reinforcement learning по методу DAPO, оптимизирующий отдельные награды за качество заключений, точность диагноза и качество локализации.

Вспомогательная голова локализации заметно улучшает результат по сравнению с генеративным декодированием: на анатомической локализации (датасет Chest ImaGenome) mAP и mIoU выросли на +28,2 и +6,2 процентных пункта соответственно, а на локализации по фразам (PadChest), на +24,6 и +14,1 процентных пункта. При этом после DAPO-обучения генеративный вывод CARE-X (0,868 mAP) обошёл специализированную SFT-голову детекции (0,865 mAP) на задаче anatomy grounding, по словам авторов, это показывает, что обучение с наградой позволяет обойтись одним генеративным режимом вывода без отдельных вспомогательных голов на этапе применения. Голова классификации даёт калиброванные вероятности с настраиваемым порогом, что позволяет переключаться между режимом высокой чувствительности (скрининг) и высокой специфичности (подтверждение диагноза) в рамках одного прохода. По большинству метрик на четырёх бенчмарках генерации заключений (MIMIC-CXR, IU-Xray, CheXpert-Plus, ReXGradient) CARE-X показала лучший результат среди сравниваемых моделей; отдельная метрика CRIMSON, взвешивающая ошибки по клинической тяжести, по мнению авторов, говорит о том, что прирост отражает реальную клиническую пользу, а не подгонку под награду. На бенчмарке ReXVQA (41 007 пар вопрос-ответ по пяти клинически значимым категориям) CARE-X достигла 94% точности, на шесть процентных пунктов выше ближайшей из опубликованных моделей, и по состоянию на август 2026 года занимает первое место в лидерборде ReXrank RexVQA.

Отдельно от CARE-X Microsoft Research провела эксперимент с моделью Qwen3-VL-4B-Instruct, соединив её с детерминированными инструментами измерения. Модель сохраняет доступ к снимку на протяжении всего вывода и вызывает инструменты, чтобы находить анатомические ориентиры, вычислять измерения и сверять их с диагностическими порогами, получается многошаговый цикл, чередующий визуальное восприятие и точные вычисления. Без какого-либо дополнительного обучения под конкретную задачу такой подход заметно обошёл вывод только на основе визуального восприятия на всех проверенных состояниях, зависящих от измерений. Авторы приводят пример: расширение аорты обычно не измеряют по рентгену грудной клетки, его чаще случайно находят на КТ по другому поводу, а надёжный скрининг по рентгену мог бы дать более раннее выявление.

Обе разработки проверили на ретроспективных обезличенных клинических данных индийской сети госпиталей Narayana Health, которая согласовала использование данных по действующим этическим нормам и одобрила публикацию результатов. В первом исследовании CARE-X протестировали на 1047 рентгенограммах по пяти редким тяжёлым состояниям (включая случаи из отделений интенсивной терапии) с распространённостью от 2,6% до 5,2%, модель показала наивысшую чувствительность в трёх состояниях из пяти при приемлемой специфичности. Во втором исследовании оценивали состояния, зависящие от измерений средостения (расширение аорты, увеличение корня лёгкого, увеличение лёгочной артерии) на 122 случаях с подтверждением по КТ; вариант с инструментами измерения (Qwen3-VL-4B-Instruct) дал recall 94,26%, на 10,65 процентного пункта выше лучшего варианта без инструментов, работающего только на визуальном восприятии.

Microsoft Research прямо оговаривает: CARE-X, исследовательская модель, а не продукт Microsoft и не медицинское изделие, она не получала одобрения ни одного регулятора и не предназначена для клинической диагностики, скрининга или ведения пациентов. Описанные результаты, ретроспективные исследовательские данные, которые не подтверждают безопасность, эффективность или пригодность CARE-X для реального клинического применения; упоминания возможных рабочих процессов описывают направления будущих исследований, а не доступные сейчас возможности.

Ключевые факты

  • CARE-X построена на визуальном энкодере SigLIP2-so400M и языковой модели Phi-4-mini-instruct (3,8 млрд параметров), обучена в три этапа SFT, затем reinforcement learning по методу DAPO.
  • Вспомогательная голова локализации подняла mAP на анатомической локализации (Chest ImaGenome) на +28,2 п.п. и на локализации по фразам (PadChest), на +24,6 п.п. по сравнению с генеративным декодированием.
  • После DAPO-обучения генеративный вывод CARE-X (0,868 mAP) обошёл специализированную SFT-голову детекции (0,865 mAP) на задаче anatomy grounding.
  • На бенчмарке ReXVQA (41 007 пар вопрос-ответ) CARE-X достигла 94% точности, на шесть процентных пунктов выше ближайшего конкурента, и по состоянию на август 2026 года лидирует в рейтинге ReXrank RexVQA.
  • В отдельном эксперименте связка Qwen3-VL-4B-Instruct с инструментами измерения дала recall 94,26% на 122 случаях увеличения средостения с подтверждением по КТ (данные Narayana Health), на +10,65 п.п. выше варианта без инструментов.

Почему это важно

Большинство ИИ-моделей для рентгена умеют либо писать свободный текст заключения, либо выдавать калиброванный диагностический прогноз, но не то и другое сразу. CARE-X совмещает оба режима в одной модели через вспомогательные головы, обучаемые совместно с генеративной задачей, и переходит с обычной кросс-энтропии на обучение с наградой (DAPO), которое штрафует именно клинически значимые ошибки, например, переворот «да» на «нет» или пропуск угрожающей жизни находки, а не любые отклонения токенов одинаково. Отдельно показано, что для признаков, которые физически нужно измерять (кардиоторакальный индекс, расширение аорты), прямое вычисление через инструменты надёжнее визуальной прикидки моделью.

Кому это важно

Материал адресован радиологам и клиницистам, которые работают с рентгеном грудной клетки, а также разработчикам и исследователям в области медицинского ИИ и клиническим учреждениям, оценивающим будущие инструменты поддержки диагностики. Прямую практическую пользу из результатов пока извлекать рано: источник явно называет CARE-X исследовательской моделью, а не готовым к использованию продуктом.

Как это применить

Источник не описывает CARE-X как доступный сейчас инструмент, упоминания возможных клинических рабочих процессов (например, скрининг расширения аорты по рентгену) названы направлениями будущих исследований, а не готовыми к использованию возможностями. В тексте не сказано, будут ли открыты веса модели, обучающий код или пайплайн DAPO, поэтому воспроизвести или встроить CARE-X по этому материалу нельзя, доступна только концепция архитектуры и опубликованные метрики.

Можно ли доверять

Публикация исходит от самой Microsoft Research, а результаты проверены не только на публичных бенчмарках (MIMIC-CXR, IU-Xray, CheXpert-Plus, ReXGradient, ReXVQA), но и на реальных ретроспективных данных индийской сети госпиталей Narayana Health с соблюдением этических процедур и с её одобрением на публикацию. Отдельная метрика CRIMSON, взвешивающая ошибки по клинической тяжести, введена именно для того, чтобы отличить настоящий клинический выигрыш от подгонки под функцию награды. При этом это блог-публикация без независимого рецензирования (авторы указаны, Mercy Ranjit, Nikhilesh E, Abhyuday Kumara Swamy, Tanuja Ganu, но сам разбор написан от «мы»), а сама Microsoft прямо предупреждает, что результаты не подтверждают пригодность модели для клинического применения.

Риски и подводные камни

Главная оговорка, от самих авторов: CARE-X не одобрена ни одним регулятором, не является медицинским изделием и не предназначена для диагностики, скрининга или ведения пациентов; все результаты, ретроспективные исследовательские данные. В источнике нет сведений о вычислительной стоимости и задержке инференса ни для CARE-X, ни для связки Qwen3-VL-4B-Instruct с инструментами измерения, а также нет информации об открытии весов или кода, оценить воспроизводимость и стоимость внедрения по этому материалу невозможно.