7B-модель с агентным конвейером обошла Claude Sonnet 4.5 и Gemini 3.1 Pro в медицинской диагностике
Команда представила DeepLens Diagnosis Agent, агентную систему для медицинской диагностики, построенную вокруг компактной модели JSL Medical Small 7B v2 (7 миллиардов параметров) и генерации с опорой на поиск (RAG, retrieval-augmented generation). Вместо того чтобы просить модель поставить диагноз одним запросом, система проводит её через пять последовательных этапов: структурированное извлечение клинических фактов из описания случая, дисциплинированный поиск релевантных медицинских знаний, формирование ограниченного набора вероятных диагнозов-кандидатов, явное сопоставление и взвешивание доказательств за и против каждого кандидата и, наконец, финальное решение с прослеживаемым обоснованием.
На тестовом наборе DiagnosisArena из 915 клинических случаев агент показал 60,14% точности угадывания правильного диагноза с первой попытки (top-1), лучший результат среди малых и средних моделей. Та же модель JSL Medical Small 7B v2 без агентного конвейера, то есть при обычном единичном запросе, дала только 23,99%, разница примерно в 36 процентных пунктов возникла исключительно за счёт структуры рабочего процесса, без изменения самой модели. Показательно, что на стандартных медицинских бенчмарках эта модель набирает 88,2%, то есть высокие баллы на типовых тестах сами по себе не гарантируют надёжного диагностического рассуждения в условиях неопределённости, где нужно взвешивать конкурирующие гипотезы.
По цене и скорости система тоже выигрывает: один случай обходится в 0,0072 доллара (около 24 тысяч токенов на GPU A100) и обрабатывается за 24 секунды. Это на 35-45% дешевле, чем прогон через флагманские модели Claude Sonnet 4.5 (0,0110 доллара за случай) и Gemini 3.1 Pro (0,0128 доллара за случай), при этом DeepLens Diagnosis Agent обходит их по точности на 9,70 и 9,17 процентных пункта соответственно.
Помимо итоговой точности, конвейер на каждом этапе оставляет структурированные промежуточные артефакты, извлечённые факты, список кандидатов, сопоставленные доказательства, что позволяет проверять и локализовать ошибку на конкретном шаге, а не смотреть только на финальный ответ. Авторы отмечают, что это особенно важно для медицины и других областей с высокими ставками, где нужна прослеживаемость и воспроизводимость решения, а не только процент правильных ответов.
Ключевые факты
- DeepLens Diagnosis Agent, пятиэтапный агентный конвейер вокруг компактной модели JSL Medical Small 7B v2 (7 млрд параметров) и RAG
- На бенчмарке DiagnosisArena (915 клинических случаев) агент дал 60,14% top-1 точности диагноза, лучший результат среди малых и средних моделей
- Без агентного конвейера та же модель показывает только 23,99%, разница около 36 процентных пунктов создана только структурой рабочего процесса
- Обходит по точности Claude Sonnet 4.5 (+9,70 п.п.) и Gemini 3.1 Pro (+9,17 п.п.), при этом стоит на 35-45% дешевле ($0,0072 против $0,0110 и $0,0128 за случай)
- Каждый этап конвейера оставляет проверяемые промежуточные артефакты, что позволяет локализовать ошибку на конкретном шаге, а не только по финальному ответу
Почему это важно
Работа показывает, что дисциплинированная архитектура рабочего процесса может значить для качества результата больше, чем размер модели или стоимость API. Компактная 7-миллиардная модель, обёрнутая в структурированный пятиэтапный конвейер, обгоняет по точности диагностики флагманские модели Claude Sonnet 4.5 и Gemini 3.1 Pro, при том что без этого конвейера та же модель показывает результат на 36 процентных пунктов ниже. Это прямое опровержение идеи, что для сложных рассуждений всегда нужна максимально большая и универсальная модель.
Кому это важно
Разработчикам медицинских ИИ-систем и агентных конвейеров: результат демонстрирует конкретный шаблон, как компактную специализированную модель довести до уровня выше frontier-моделей за счёт структуры процесса, а не размера. Также интересно исследователям, изучающим дизайн агентных систем и их применимость в задачах с высокими ставками, где важна не только точность, но и объяснимость решения.
Как это применить
Пятиэтапная схема, структурированное извлечение фактов, дисциплинированный поиск по базе знаний, формирование ограниченного набора кандидатов, явное сопоставление доказательств за и против каждого кандидата и финальное решение с обоснованием, переносима на другие задачи диагностического или классификационного рассуждения под неопределённостью, не только медицинские. Ключевой элемент, не сама модель, а дисциплина процесса и промежуточная фиксация артефактов на каждом шаге.
Можно ли доверять
Это препринт на arXiv, без указания на прохождение независимого рецензирования или клинических испытаний. Результат получен на одном специализированном бенчмарке DiagnosisArena из 915 случаев, сопоставление цены и скорости с Claude Sonnet 4.5 и Gemini 3.1 Pro также измерено в рамках этого же теста. Данных о проверке в реальной клинической практике, одобрении регуляторами или сравнении на других наборах случаев в тексте нет.
Риски и подводные камни
60,14% точности с первой попытки означает, что примерно в четырёх случаях из десяти первый предложенный диагноз всё ещё неверен, этого недостаточно для автономного использования без врача. Результат получен на одном бенчмарке ограниченного размера, и неясно, насколько он переносится на реальное разнообразие клинических случаев вне тестового набора. В тексте нет упоминаний о регуляторном одобрении, проверке безопасности или обязательном контроле со стороны врача при внедрении такой системы.