Учёные выяснили: врачи предпочитают ответы ИИ, которые опасны для пациентов
Исследователи проверили, можно ли доверять парным предпочтениям врачей (когда клиницисту показывают два ответа модели и просят выбрать лучший) как индикатору клинической безопасности больших языковых моделей. Данные взяты с платформы MOOVE (Massive Open Online Validation and Evaluation), она собирает как раз такие слепые парные оценки, а вместе с ними ещё и оценки по отдельным критериям (рубрикам) по дискретной шкале от −2 до +2, где отрицательные значения означают клинически небезопасный или вводящий в заблуждение ответ. Всего проанализировано 26 804 парных суждения по ответам 13 разных языковых моделей, вынесенных более чем 736 врачами из 28+ стран.
Главный вывод: предпочтение врачей, плохой показатель безопасности. Модель, которая занимает верхние строчки по числу выигранных парных сравнений, всё равно может выдавать существенную долю клинически значимых провалов (оценка −1 и ниже) по таким критериям, как «безвредность» и «точность». Причём эти провалы распределены неравномерно по медицинским специальностям: возникают своего рода «зоны запрета», специальности, где модель регулярно ошибается, но это не видно в общем рейтинге или в одном сводном числе.
Авторы также разобрали, что влияет на выбор врачей: длину промпта, поведение модели при отказе отвечать или эскалации вопроса к специалисту, и то, какую долю в предпочтении играют признаки, связанные именно с безопасностью, а какую, поверхностные характеристики ответа (стиль, длина, уверенность тона). Оказалось, что значительная часть голосов «за» вообще не несёт положительного сигнала о безопасности, а поверхностные признаки объясняют чуть больше вариации в предпочтениях, чем различия по критериям, связанным с безопасностью.
На основе этого авторы предложили клинически скорректированный рейтинг предпочтений, он объединяет обычное парное предпочтение с оценками по рубрикам безопасности и даёт более безопасно-ориентированное ранжирование моделей, чем чистая сила по методу Брэдли, Терри (стандартный способ превращать парные сравнения в рейтинг). Вывод авторов: практика оценки моделей должна разделять «нравится врачам» и «безопасно», напрямую сообщать долю клинически значимых провалов и учитывать клинически обоснованные поправки при ранжировании моделей для медицинского применения.
Ключевые факты
- 26 804 парных оценки ответов 13 языковых моделей от более чем 736 врачей из 28+ стран (платформа MOOVE)
- Модели, которые врачи предпочитают чаще, всё равно могут регулярно давать клинически опасные ответы (оценка −1 и ниже по шкале от −2 до +2)
- Провалы по безопасности распределены неравномерно между медицинскими специальностями, образуются скрытые «зоны запрета», невидимые в общем рейтинге
- Значительная часть голосов врачей за один ответ против другого не несёт сигнала о безопасности вовсе
- Поверхностные черты ответа (стиль, длина) влияют на выбор врача чуть сильнее, чем реальные различия в безопасности
Почему это важно
Большинство рейтингов языковых моделей, в том числе в медицине, строятся именно на парных предпочтениях: людям показывают два ответа и просят выбрать лучший, а из тысяч таких голосов складывается единый рейтинг. Это исследование показывает, что для клинической безопасности такой метод вводит в заблуждение: модель может нравиться врачам и одновременно регулярно давать ответы, способные навредить пациенту. Один сводный балл маскирует эту разницу.
Кому это важно
Разработчикам медицинских ИИ-инструментов и тем, кто их закупает или сертифицирует; исследователям, которые строят лидерборды для клинических моделей; врачам и медицинским учреждениям, рассматривающим внедрение ИИ-ассистентов в разных специальностях, там, где риск скрытых «зон запрета» неодинаков.
Как это применить
Авторы предлагают не полагаться на один сводный рейтинг предпочтений, а отдельно измерять и публиковать долю клинически значимых провалов по безопасности и использовать клинически скорректированное ранжирование, которое учитывает оценки по рубрикам безопасности, а не только «кто кому больше понравился».
Можно ли доверять
Это препринт arXiv, ещё не прошедший рецензирование, но опирающийся на большой реальный массив данных (более 26 тысяч оценок, более 736 врачей, 28+ стран), а не единичный кейс. Конкретные 13 моделей и точная величина «существенной доли» голосов без сигнала о безопасности на странице аннотации arXiv не названы, это ограничивает степень детализации пересказа, но не сам вывод исследования.
Риски и подводные камни
Работа сама себя описывает как методологическую критику существующей практики оценки, а не готовое решение: клинически скорректированный рейтинг, предложение, а не проверенный на практике стандарт. Опасность в том, что многие существующие лидерборды медицинских ИИ-моделей продолжают строиться именно на чистом парном предпочтении, которое, согласно этой работе, плохо коррелирует с реальной безопасностью для пациента.