GraphDx: мультиагентный ИИ с графом знаний поднял точность диагностики до 93%
Учёные предложили фреймворк GraphDx для автоматической последовательной диагностики: система на каждом шаге решает, какое обследование назначить пациенту дальше, стараясь одновременно не терять точность и не тратить лишние деньги на анализы.
Проблема, которую решает GraphDx: языковые модели (LLM) содержат огромный объём медицинских знаний, но плохо умеют системно рассуждать под ограничением по стоимости обследований, из-за этого они склонны назначать избыточное количество тестов «на всякий случай», вместо того чтобы действовать по короткому и обоснованному пути к диагнозу.
Решение состоит из двух частей. Во-первых, авторы построили автоматический конвейер, в котором LLM сама собирает Медицинский граф диагностических знаний (MDKG, Medical Diagnosis Knowledge Graph), граф связей между симптомами, обследованиями и диагнозами, где каждая связь размечена «типичностью» (насколько признак характерен для диагноза) и стоимостью соответствующего действия (анализа, обследования).
Во-вторых, в системе работают три агента с разделением труда: агент Восприятия и агент Принятия решений отвечают за понимание запроса и формулировку ответа на естественном языке, а агент Рассуждения выполняет детерминированный (не основанный на свободной генерации текста) подсчёт веса улик и планирование следующего шага с учётом стоимости, опираясь на граф MDKG, а не на догадки самой языковой модели.
На тестах MedQA (банк экзаменационных медицинских вопросов) и MIMIC-IV (база данных реальных историй болезни пациентов интенсивной терапии), прогнанных на трёх разных базовых моделях, DeepSeek-V3, Kimi-k2 и Llama-3.3, GraphDx подняла долю успешных диагнозов с 50, 68% до 79, 93% и одновременно снизила стоимость обследований на 20, 54% по сравнению с обычными подходами на основе LLM.
Ключевые факты
- GraphDx, фреймворк для последовательной медицинской диагностики, объединяющий граф знаний и трёх ИИ-агентов
- Граф MDKG строится автоматически силами LLM и хранит типичность симптомов и стоимость каждого обследования
- Агент Рассуждения считает вес улик и планирует шаги детерминированно по графу, а не свободной генерацией текста
- На бенчмарках MedQA и MIMIC-IV доля успешных диагнозов выросла с 50, 68% до 79, 93%
- Стоимость обследований снизилась на 20, 54% сразу на трёх базовых моделях: DeepSeek-V3, Kimi-k2, Llama-3.3
Почему это важно
Авторы называют это «пробелом между знанием и рассуждением» (knowledge-reasoning gap): современные LLM формально знают медицину очень широко, но при последовательном сборе анамнеза не умеют системно взвешивать, какой следующий тест даст больше всего информации за наименьшие деньги, и по умолчанию перестраховываются избыточными назначениями. GraphDx закрывает этот пробел, разделяя работу на две части, язык остаётся за LLM, а точный расчёт «какой тест выбрать дальше» отдан детерминированному алгоритму поверх структурированного графа знаний.
Кому это важно
Разработчикам систем поддержки клинических решений и медицинских ИИ-стартапов, как пример архитектуры, которая контролирует стоимость обследований, а не только точность. Исследователям мультиагентных систем, как рабочий пример разделения ролей между «языковыми» агентами и «расчётным» агентом. Организациям здравоохранения, которые ищут способы сократить траты на избыточную диагностику без потери качества.
Как это применить
GraphDx, исследовательский прототип, а не готовый продукт: код и веса конкретной клинической системы в статье не анонсированы, оценка сделана на бенчмарках MedQA и MIMIC-IV. Практически применим сам архитектурный приём, автоматически строить граф знаний силами LLM и поручать точные вычисления по нему отдельному детерминированному агенту, оставляя языковой модели только понимание запроса и формулировку ответа; такой паттерн переносим и на другие предметные области с дорогими последовательными решениями, не только на медицину.
Можно ли доверять
Работа, препринт arXiv, не прошедший рецензирование в журнале. Результаты проверены на двух публичных бенчмарках (экзаменационные вопросы MedQA и реальные истории болезни MIMIC-IV) и воспроизведены на трёх разных базовых моделях (DeepSeek-V3, Kimi-k2, Llama-3.3), что снижает риск случайного результата на одной модели. Однако сравнения с решениями практикующих врачей-людей или проспективного клинического испытания на реальных пациентах в описании эксперимента нет.
Риски и подводные камни
Точность даже у лучшей версии GraphDx не 100% (до 93%), то есть часть диагнозов остаётся ошибочной. Качество графа MDKG зависит от того, насколько верно LLM разметила типичность и стоимость связей при автоматическом построении графа, ошибки на этом этапе способны исказить все последующие решения. Экономия измерена в стоимости назначенных анализов, а не в полной стоимости эксплуатации мультиагентной системы (вычисления, обслуживание). Наконец, между результатами на экзаменационных вопросах и историях болезни и реальной клинической практикой с непредсказуемыми пациентами обычно остаётся разрыв, который бенчмарки не отражают.