ClinLens: новый бенчмарк показал провал ИИ-агентов в клинической аналитике

Исследователи представили ClinLens, новый бенчмарк для проверки ИИ-агентов, которые должны анализировать длинные (продольные, собранные за долгое время наблюдения) истории болезни пациентов сразу по нескольким типам данных. Существующие тесты для медицинских ИИ, по словам авторов, обычно изолированно проверяют что-то одно: либо ответы на медицинские вопросы, либо работу со структурированными таблицами, либо задачи из общих научных репозиториев. ClinLens устроен иначе, агент должен превратить разнородный, слабо структурированный набор данных о пациенте в проверяемый аналитический отчёт.

Бенчмарк состоит из 200 выполняемых задач, построенных на пяти связанных ресурсах базы MIMIC: структурированных электронных медицинских картах, врачебных заметках, электрокардиограммах, снимках грудной клетки и эхокардиограммах. Задачи организованы по таксономии 4×5, четыре временных охвата истории пациента пересекаются с пятью типами аналитических возможностей.

Для оценки авторы применили метод "программно-ориентированного обратного синтеза" (program-first reverse synthesis): под каждую ограниченную по объёму полусырую задачу заранее составляется скрытый от агента эталонный алгоритм решения, по которому затем проверяются необходимые артефакты, правильность отбора когорты пациентов и временных рамок, а также итоговый ответ.

На фиксированном наборе из 126 задач лучшая из 24 стандартизированных комбинаций "модель плюс обвязка" довела выполнение до конца (EXECSUCCESS) в 100% случаев, но прошла строгую посрезовую проверку правильности (STRICTPASS) лишь в 56,3% случаев. Отдельно настроенный кодинг-агент решил 83 задачи из 126. Пять систем, адаптированных под биомедицинскую область и работающих на GPT-4o-mini, показали результат не выше 2,9% STRICTPASS. Авторы делают вывод: между способностью ИИ-агента формально довести решение до работающего кода и его способностью дать клинически корректный анализ, существенный разрыв.

Ключевые факты

  • ClinLens, 200 выполняемых задач на пяти связанных ресурсах MIMIC: ЭМК, врачебные заметки, ЭКГ, рентген грудной клетки, эхокардиограммы
  • Таксономия задач 4×5: четыре временных охвата истории пациента × пять аналитических способностей
  • Лучшая из 24 конфигураций агентов: 100% EXECSUCCESS (код выполнился), но только 56,3% STRICTPASS (ответ признан правильным)
  • Отдельно настроенный кодинг-агент решил 83 задачи из 126
  • Пять биомедицинских систем на GPT-4o-mini показали не выше 2,9% STRICTPASS

Почему это важно

Бенчмарк впервые количественно фиксирует разрыв между тем, что ИИ-агент способен технически выполнить (написать и запустить код, получить какой-то ответ), и тем, что этот ответ клинически корректен. Цифра 100% EXECSUCCESS против 56,3% STRICTPASS у лучшей конфигурации показывает: то, что агент "отработал без ошибок", не значит, что его вывод можно доверять как медицинский анализ.

Кому это важно

Разработчикам ИИ-агентов и биомедицинских систем для клинических данных, исследователям в области clinical ML, командам, оценивающим ИИ-инструменты перед внедрением в больницах и лабораториях, а также авторам других медицинских бенчмарков, которым ClinLens задаёт более строгую планку проверки.

Как это применить

ClinLens можно использовать как испытательный стенд: прогонять через него любую комбинацию модели и обвязки (scaffold) перед тем, как предлагать её для реальной клинической аналитики, и смотреть не только на факт выполнения задачи, но и на долю STRICTPASS по каждому из четырёх временных охватов.

Можно ли доверять

Это препринт arXiv, без указания имени автора в исходных метаданных и без данных о рецензировании; все цифры (56,3%, 83 из 126, 2,9%) взяты из собственного эксперимента авторов на их же бенчмарке. Результаты ограничены набором MIMIC и конкретным набором из 24 протестированных конфигураций, обобщать их на все ИИ-агенты в медицине преждевременно.

Риски и подводные камни

Главный риск, ложное чувство надёжности: метрика EXECSUCCESS (код запустился) может создать впечатление, что агент справился с задачей, хотя STRICTPASS показывает обратное. Если такие агенты будут применяться в реальной клинической практике без подобной строгой проверки, ошибки в отборе когорты пациентов или временных рамок могут остаться незамеченными.