GPT-4.1 nano умеет сомневаться в диагнозах, но путается в спорных случаях

Исследователи собрали контролируемый клинический бенчмарк, устроенный по образцу психофизических экспериментов, чтобы проверить не только точность диагноза языковой модели, но и то, насколько её уверенность в ответе соответствует качеству имеющихся данных. Задача, различить вероятное нейрокогнитивное расстройство альцгеймеровского типа (AT-NCD) и когнитивные нарушения, связанные с депрессией (DRCI): две категории, которые в реальной клинике легко спутать.

Для теста написали 45 синтетических клинических виньеток с разной силой доказательств, с противоречивыми данными и с намеренно неполной информацией. Каждую виньетку показывали в трёх вариантах формулировки запроса, итого получилось 135 испытаний. В пилотном прогоне на модели gpt-4.1-nano все 135 испытаний дали корректно структурированный ответ без сбоев формата.

По результатам форс-чойс испытаний (модель обязана была выбрать один из двух диагнозов) точность составила 93,5%, средняя заявленная уверенность модели, 78,4%, а метрика метакогнитивного различения AUROC2, 0,876. Уверенность модели росла, когда доказательства были дальше от границы между диагнозами, и снижалась, когда часть информации была скрыта; на верных ответах уверенность оставалась выше, чем на ошибочных, это сохранялось даже с поправкой на силу доказательств и формулировку запроса. Авторы делают вывод, что это признак частичной метакогнитивной чувствительности, а не полностью бесполезной, ничего не значащей уверенности.

Но есть и системный сбой: ошибки не распределены равномерно, а кучкуются в умеренных, противоречивых случаях AT-NCD, именно там, где данные конфликтуют друг с другом, но не выглядят однозначно ясными. В этой зоне модель склонна вместо AT-NCD ставить DRCI и при этом сохраняет уверенность выше, чем оправдывает её фактическая точность в этих случаях. Сравнение моделей (детали которого в тексте аннотации не раскрыты) привело авторов к выводу: качество уверенности модели нужно измерять напрямую отдельным тестом, а не выводить из общей точности бенчмарка или из общего уровня возможностей модели.

Ключевые факты

  • Бенчмарк из 45 клинических виньеток (три варианта запроса на каждую, 135 испытаний) проверяет, различает ли модель вероятную деменцию альцгеймеровского типа (AT-NCD) и когнитивные нарушения из-за депрессии (DRCI)
  • На пилоте с gpt-4.1-nano: точность 93,5%, средняя уверенность 78,4%, метрика метакогнитивного различения AUROC2 = 0,876
  • Уверенность модели адекватно реагирует на качество данных: растёт при явных доказательствах, падает при нехватке информации, выше на верных ответах, чем на ошибочных
  • В умеренных, противоречивых случаях AT-NCD модель чаще ошибочно выбирает DRCI и держит уверенность выше, чем оправдывает фактическая точность в этой зоне
  • Авторы предлагают измерять качество уверенности медицинских моделей отдельным тестом, а не выводить его из общей точности бенчмарка

Почему это важно

Для медицинского применения языковой модели мало того, чтобы она чаще отвечала правильно, важно, чтобы её уверенность в ответе была осмысленным сигналом: высокая уверенность там, где данные однозначны, и низкая там, где они спорны или неполны. Этот бенчмарк, один из первых, где такую метакогнитивную чувствительность проверяют контролируемо, на специально сконструированных клинических случаях, а не просто меряют долю правильных ответов.

Кому это важно

Разработчикам медицинских ИИ-инструментов и клиницистам, которые рассматривают языковые модели как вспомогательный инструмент диагностики: результат показывает, что доверять заявленной уверенности модели без проверки нельзя, особенно в пограничных, неоднозначных случаях, где цена ошибки выше всего. Также важно исследователям, которые оценивают ИИ-модели по одной метрике точности, не проверяя отдельно качество их уверенности.

Как это применить

Методику можно перенести на другие диагностические пары и другие модели: строить синтетические виньетки с контролируемой силой доказательств, противоречиями и пробелами в данных, а затем сравнивать не только точность, но и то, насколько уверенность модели коррелирует с реальной вероятностью правильного ответа, отдельно для однозначных и для спорных случаев.

Можно ли доверять

Частично. Работа сама демонстрирует ограничение: на понятных случаях уверенность модели ведёт себя разумно, но именно там, где нужна максимальная осторожность, в спорных, противоречивых сценариях, модель регулярно завышает уверенность в неверном диагнозе. Тест, на одной модели (gpt-4.1-nano) и на синтетических, а не реальных клинических данных, что сужает применимость выводов напрямую к практике.

Риски и подводные камни

Главный риск, иллюзия надёжности: врач или пациент, ориентирующийся на заявленную уверенность модели, рискует довериться ей именно в тех пограничных случаях деменции и депрессии, где модель чаще всего ошибается и субъективно чувствует себя увереннее, чем должна. Аннотация не называет авторов, институты и дату публикации работы, а также не даёт определения использованной метрики AUROC2, это ограничивает независимую проверку деталей методики.