Топовые ИИ-модели вместе провалили 42% решений в онкологии
Исследователи построили бенчмарк ODBB (Oncology Decision Boundary Benchmark), 2005 онкологических решений, составленных из клинических рекомендаций NCCN и разборов случаев колоректального рака (1586 и 419 пунктов соответственно). На нём проверили девять современных ИИ-моделей, четыре закрытые и пять открытых семейств, выпущенных в промежутке с июня 2025 по апрель 2026 года.
Ответы моделей оценивал полностью детерминированный скрипт (без единого обращения к самой LLM), который относил каждый ответ к одному из 14 типов ошибок. Правильность этой разметки проверили два независимых онколога на выборке из 225 заданий, совпадение их оценок со скриптом оказалось высоким (взвешенная каппа Коэна 0,939 и 0,790).
Главный результат: если объединить все девять моделей в единую «сборную» и засчитывать успех, если хотя бы одна из них ответила верно, всё равно 42,1% заданий (95% доверительный интервал Уилсона 40,0, 44,3%) не решила ни одна модель. По типам заданий разрыв резкий: 35,7% пунктов из клинических рекомендаций NCCN и 66,4% случаев с колоректальным раком не поддались ни одной из девяти моделей. Авторы подчёркивают, что провалы концентрируются в конкретном месте, выборе между альтернативными путями по рекомендациям ещё до того, как модель начинает рассуждать внутри выбранного пути. По их формулировке, это устойчивый пробел в клиническом метасуждении, который скорее требует изменения архитектуры системы, а не увеличения объёма обучающих данных.
Отдельно выявлена разница в стиле ответов: две модели, настроенные на решительность (GPT-5.5 и Gemini 3.1 Pro Preview), в 3, 5 раз чаще делали небезопасные однозначные заявления по сравнению с семью более осторожными моделями, при этом точность у них выше не была. Ещё один тип провала, в 3, 9% заданий модель формулировала верный следующий клинический шаг, но не решалась однозначно на нём настоять; авторы называют это сбоем принятия решения, а не сбоем знаний.
Вывод авторов: качество отдельной модели больше не главное узкое место для внедрения ИИ в клинику, ограничением стало само допущение, что решение может опираться на одну-единственную модель. По их мнению, дальнейший прогресс требует архитектур, которые умеют распознавать момент, когда модель достигает границы своей компетенции, и в этот момент передавать решение врачу.
Ключевые факты
- Бенчмарк ODBB: 2005 онкологических решений, 1586 пунктов по клиническим рекомендациям NCCN и 419 случаев колоректального рака
- Проверены девять топовых моделей (четыре закрытые, пять открытых семейств), выпущенных с июня 2025 по апрель 2026 года
- Даже объединённые в одну «сборную», модели не смогли правильно ответить на 42,1% заданий (95% ДИ 40,0, 44,3%): 35,7% пунктов NCCN и 66,4% случаев колоректального рака
- Провалы концентрируются в выборе между путями по рекомендациям до начала рассуждения внутри пути, авторы считают, что это требует изменения архитектуры, а не больше данных
- GPT-5.5 и Gemini 3.1 Pro Preview, настроенные на решительность, в 3, 5 раз чаще делали небезопасные заявления, чем семь осторожных моделей, без прироста точности
Почему это важно
ИИ-модели хорошо сдают медицинские экзамены на знание фактов, но реальная онкологическая практика, это не тест на знания, а последовательность выборов между путями лечения по клиническим рекомендациям, решений об эскалации и обязательств в условиях неопределённости. Бенчмарк ODBB впервые системно проверил именно этот навык на 2005 решениях и показал: даже если собрать девять современных моделей вместе и засчитывать успех при правильном ответе хотя бы одной, 42,1% заданий всё равно остаются нерешёнными. Это значит, что проблема не в недостатке знаний у конкретной модели, а в общем для всех моделей слепом пятне, выборе между альтернативными путями рекомендаций ещё до начала рассуждения внутри выбранного пути.
Кому это важно
Результат важен разработчикам систем поддержки клинических решений в онкологии, медицинским учреждениям, рассматривающим внедрение ИИ-ассистентов для работы с рекомендациями NCCN, и командам, проектирующим мультимодельные архитектуры для медицины. Он также важен регуляторам и разработчикам самих ИИ-моделей, которые настраивают их на большую решительность в ответах: исследование прямо показывает цену такой настройки в клиническом контексте.
Как это применить
Главный практический вывод авторов, нельзя строить клиническое решение на одной-единственной модели, каким бы качественным ни было её среднее качество ответов. Вместо этого нужна архитектура, которая умеет распознавать момент, когда модель достигает границы своей компетенции (например, именно в точке выбора между путями рекомендаций), и в этот момент передаёт решение врачу, а не выдаёт ответ модели как окончательный. Отдельная практическая рекомендация: настройка модели на большую решительность не защита, а риск, в этом исследовании она увеличивала частоту небезопасных заявлений в 3, 5 раз без прироста точности.
Можно ли доверять
Методология выглядит тщательной: ответы моделей оценивал полностью детерминированный скрипт (без обращения к LLM), разбивавший ошибки на 14 типов, а качество самой разметки проверили два независимых онколога на выборке из 225 заданий, совпадение оценок оказалось высоким (взвешенная каппа Коэна 0,939 и 0,790). В то же время в доступном тексте не названы ни авторы и их организации, ни статус публикации (журнал, рецензирование), ни то, как именно отбирались 1586 пунктов NCCN и 419 случаев колоректального рака среди всех типов онкологии, это стоит иметь в виду при оценке независимости и воспроизводимости результата.
Риски и подводные камни
Ключевой риск, который подсвечивает работа, соблазн внедрить одну модель как самостоятельный источник клинических решений: именно это допущение авторы называют главным узким местом, а не качество моделей само по себе. Второй риск, настройка на решительность: у GPT-5.5 и Gemini 3.1 Pro Preview она обернулась в 3, 5 раз более частыми небезопасными однозначными заявлениями по сравнению с семью осторожными моделями, притом без более высокой точности. Третий риск, скрытый тип ошибки, где модель знает правильный следующий шаг, но не решается однозначно его назвать (3, 9% заданий): такой сбой принятия решения легко спутать со сбоем знаний и не заметить при поверхностной проверке.
«Качество модели больше не главное узкое место для внедрения ИИ в клинику; ограничение, само допущение, что решение может опираться на одну-единственную модель.»
— авторы исследования