GraphDx: мультиагентный ИИ с графом знаний поднял точность диагностики до 93%

Учёные предложили фреймворк GraphDx для автоматической последовательной диагностики: система на каждом шаге решает, какое обследование назначить пациенту дальше, стараясь одновременно не терять точность и не тратить лишние деньги на анализы.

Проблема, которую решает GraphDx: языковые модели (LLM) содержат огромный объём медицинских знаний, но плохо умеют системно рассуждать под ограничением по стоимости обследований, из-за этого они склонны назначать избыточное количество тестов «на всякий случай», вместо того чтобы действовать по короткому и обоснованному пути к диагнозу.

Решение состоит из двух частей. Во-первых, авторы построили автоматический конвейер, в котором LLM сама собирает Медицинский граф диагностических знаний (MDKG, Medical Diagnosis Knowledge Graph), граф связей между симптомами, обследованиями и диагнозами, где каждая связь размечена «типичностью» (насколько признак характерен для диагноза) и стоимостью соответствующего действия (анализа, обследования).

Во-вторых, в системе работают три агента с разделением труда: агент Восприятия и агент Принятия решений отвечают за понимание запроса и формулировку ответа на естественном языке, а агент Рассуждения выполняет детерминированный (не основанный на свободной генерации текста) подсчёт веса улик и планирование следующего шага с учётом стоимости, опираясь на граф MDKG, а не на догадки самой языковой модели.

На тестах MedQA (банк экзаменационных медицинских вопросов) и MIMIC-IV (база данных реальных историй болезни пациентов интенсивной терапии), прогнанных на трёх разных базовых моделях, DeepSeek-V3, Kimi-k2 и Llama-3.3, GraphDx подняла долю успешных диагнозов с 50, 68% до 79, 93% и одновременно снизила стоимость обследований на 20, 54% по сравнению с обычными подходами на основе LLM.

Ключевые факты

  • GraphDx, фреймворк для последовательной медицинской диагностики, объединяющий граф знаний и трёх ИИ-агентов
  • Граф MDKG строится автоматически силами LLM и хранит типичность симптомов и стоимость каждого обследования
  • Агент Рассуждения считает вес улик и планирует шаги детерминированно по графу, а не свободной генерацией текста
  • На бенчмарках MedQA и MIMIC-IV доля успешных диагнозов выросла с 50, 68% до 79, 93%
  • Стоимость обследований снизилась на 20, 54% сразу на трёх базовых моделях: DeepSeek-V3, Kimi-k2, Llama-3.3

Почему это важно

Авторы называют это «пробелом между знанием и рассуждением» (knowledge-reasoning gap): современные LLM формально знают медицину очень широко, но при последовательном сборе анамнеза не умеют системно взвешивать, какой следующий тест даст больше всего информации за наименьшие деньги, и по умолчанию перестраховываются избыточными назначениями. GraphDx закрывает этот пробел, разделяя работу на две части, язык остаётся за LLM, а точный расчёт «какой тест выбрать дальше» отдан детерминированному алгоритму поверх структурированного графа знаний.

Кому это важно

Разработчикам систем поддержки клинических решений и медицинских ИИ-стартапов, как пример архитектуры, которая контролирует стоимость обследований, а не только точность. Исследователям мультиагентных систем, как рабочий пример разделения ролей между «языковыми» агентами и «расчётным» агентом. Организациям здравоохранения, которые ищут способы сократить траты на избыточную диагностику без потери качества.

Как это применить

GraphDx, исследовательский прототип, а не готовый продукт: код и веса конкретной клинической системы в статье не анонсированы, оценка сделана на бенчмарках MedQA и MIMIC-IV. Практически применим сам архитектурный приём, автоматически строить граф знаний силами LLM и поручать точные вычисления по нему отдельному детерминированному агенту, оставляя языковой модели только понимание запроса и формулировку ответа; такой паттерн переносим и на другие предметные области с дорогими последовательными решениями, не только на медицину.

Можно ли доверять

Работа, препринт arXiv, не прошедший рецензирование в журнале. Результаты проверены на двух публичных бенчмарках (экзаменационные вопросы MedQA и реальные истории болезни MIMIC-IV) и воспроизведены на трёх разных базовых моделях (DeepSeek-V3, Kimi-k2, Llama-3.3), что снижает риск случайного результата на одной модели. Однако сравнения с решениями практикующих врачей-людей или проспективного клинического испытания на реальных пациентах в описании эксперимента нет.

Риски и подводные камни

Точность даже у лучшей версии GraphDx не 100% (до 93%), то есть часть диагнозов остаётся ошибочной. Качество графа MDKG зависит от того, насколько верно LLM разметила типичность и стоимость связей при автоматическом построении графа, ошибки на этом этапе способны исказить все последующие решения. Экономия измерена в стоимости назначенных анализов, а не в полной стоимости эксплуатации мультиагентной системы (вычисления, обслуживание). Наконец, между результатами на экзаменационных вопросах и историях болезни и реальной клинической практикой с непредсказуемыми пациентами обычно остаётся разрыв, который бенчмарки не отражают.