GPT-4.1 nano умеет сомневаться в диагнозах, но путается в спорных случаях
Исследователи собрали контролируемый клинический бенчмарк, устроенный по образцу психофизических экспериментов, чтобы проверить не только точность диагноза языковой модели, но и то, насколько её уверенность в ответе соответствует качеству имеющихся данных. Задача, различить вероятное нейрокогнитивное расстройство альцгеймеровского типа (AT-NCD) и когнитивные нарушения, связанные с депрессией (DRCI): две категории, которые в реальной клинике легко спутать.
Для теста написали 45 синтетических клинических виньеток с разной силой доказательств, с противоречивыми данными и с намеренно неполной информацией. Каждую виньетку показывали в трёх вариантах формулировки запроса, итого получилось 135 испытаний. В пилотном прогоне на модели gpt-4.1-nano все 135 испытаний дали корректно структурированный ответ без сбоев формата.
По результатам форс-чойс испытаний (модель обязана была выбрать один из двух диагнозов) точность составила 93,5%, средняя заявленная уверенность модели, 78,4%, а метрика метакогнитивного различения AUROC2, 0,876. Уверенность модели росла, когда доказательства были дальше от границы между диагнозами, и снижалась, когда часть информации была скрыта; на верных ответах уверенность оставалась выше, чем на ошибочных, это сохранялось даже с поправкой на силу доказательств и формулировку запроса. Авторы делают вывод, что это признак частичной метакогнитивной чувствительности, а не полностью бесполезной, ничего не значащей уверенности.
Но есть и системный сбой: ошибки не распределены равномерно, а кучкуются в умеренных, противоречивых случаях AT-NCD, именно там, где данные конфликтуют друг с другом, но не выглядят однозначно ясными. В этой зоне модель склонна вместо AT-NCD ставить DRCI и при этом сохраняет уверенность выше, чем оправдывает её фактическая точность в этих случаях. Сравнение моделей (детали которого в тексте аннотации не раскрыты) привело авторов к выводу: качество уверенности модели нужно измерять напрямую отдельным тестом, а не выводить из общей точности бенчмарка или из общего уровня возможностей модели.
Ключевые факты
- Бенчмарк из 45 клинических виньеток (три варианта запроса на каждую, 135 испытаний) проверяет, различает ли модель вероятную деменцию альцгеймеровского типа (AT-NCD) и когнитивные нарушения из-за депрессии (DRCI)
- На пилоте с gpt-4.1-nano: точность 93,5%, средняя уверенность 78,4%, метрика метакогнитивного различения AUROC2 = 0,876
- Уверенность модели адекватно реагирует на качество данных: растёт при явных доказательствах, падает при нехватке информации, выше на верных ответах, чем на ошибочных
- В умеренных, противоречивых случаях AT-NCD модель чаще ошибочно выбирает DRCI и держит уверенность выше, чем оправдывает фактическая точность в этой зоне
- Авторы предлагают измерять качество уверенности медицинских моделей отдельным тестом, а не выводить его из общей точности бенчмарка
Почему это важно
Для медицинского применения языковой модели мало того, чтобы она чаще отвечала правильно, важно, чтобы её уверенность в ответе была осмысленным сигналом: высокая уверенность там, где данные однозначны, и низкая там, где они спорны или неполны. Этот бенчмарк, один из первых, где такую метакогнитивную чувствительность проверяют контролируемо, на специально сконструированных клинических случаях, а не просто меряют долю правильных ответов.
Кому это важно
Разработчикам медицинских ИИ-инструментов и клиницистам, которые рассматривают языковые модели как вспомогательный инструмент диагностики: результат показывает, что доверять заявленной уверенности модели без проверки нельзя, особенно в пограничных, неоднозначных случаях, где цена ошибки выше всего. Также важно исследователям, которые оценивают ИИ-модели по одной метрике точности, не проверяя отдельно качество их уверенности.
Как это применить
Методику можно перенести на другие диагностические пары и другие модели: строить синтетические виньетки с контролируемой силой доказательств, противоречиями и пробелами в данных, а затем сравнивать не только точность, но и то, насколько уверенность модели коррелирует с реальной вероятностью правильного ответа, отдельно для однозначных и для спорных случаев.
Можно ли доверять
Частично. Работа сама демонстрирует ограничение: на понятных случаях уверенность модели ведёт себя разумно, но именно там, где нужна максимальная осторожность, в спорных, противоречивых сценариях, модель регулярно завышает уверенность в неверном диагнозе. Тест, на одной модели (gpt-4.1-nano) и на синтетических, а не реальных клинических данных, что сужает применимость выводов напрямую к практике.
Риски и подводные камни
Главный риск, иллюзия надёжности: врач или пациент, ориентирующийся на заявленную уверенность модели, рискует довериться ей именно в тех пограничных случаях деменции и депрессии, где модель чаще всего ошибается и субъективно чувствует себя увереннее, чем должна. Аннотация не называет авторов, институты и дату публикации работы, а также не даёт определения использованной метрики AUROC2, это ограничивает независимую проверку деталей методики.