LLM почти не отличают надёжные источники от просто популярных, показало исследование

Исследователи изучили, насколько хорошо большие языковые модели умеют взвешивать внешнюю информацию, когда работают с интернет-источниками, то есть насколько сильнее они должны доверять более надёжным источникам (source discernment, «распознавание источника») и насколько сильнее должны менять мнение, когда новое утверждение приближает их оценку к истине (truth discernment, «распознавание истины»). Оба свойства вместе авторы называют information discernment («информационное распознавание») и формализуют через три нормативных аксиомы с измеримыми метриками. Для этого они построили экспериментальный фреймворк и бенчмарк Learn2Discern (L2D).

Чтобы проверить, что эти аксиомы действительно важны для реальных пользователей, а не только для авторов методики, команда провела предварительно зарегистрированный опрос с квотной выборкой (n=299): участники подтвердили согласие со всеми тремя аксиомами и сообщили, что нарушение этих принципов моделью снижает их доверие к ней и желание её использовать.

Основной эксперимент охватил 13 моделей и почти 670 тысяч испытаний. Результат устойчиво отрицательный по обоим измерениям: модели оценивают надёжность источников и правдивость утверждений на уровне, близком к случайному угадыванию. При этом на решения моделей популярность источника влияет примерно вдвое сильнее, чем его фактическая надёжность. Кроме того, модели обновляют свою позицию примерно одинаково независимо от того, приближает новое утверждение их оценку к истине или, наоборот, уводит от неё, то есть не различают полезную и вредную информацию по её реальному эффекту. Лучше всего модели интегрируют внешние знания на тех наборах данных, где их собственные исходные оценки (до получения новой информации) уже были наиболее точными.

Отдельный важный вывод: более новые и крупные модели действительно лучше справляются с truth discernment (точнее оценивают, приближает ли новое утверждение их позицию к истине), но НЕ становятся лучше в source discernment (распознавании надёжности источника), этот «слепое пятно» размер и сложность модели не устраняют. Авторы также нашли простые вмешательства на этапе инференса (без дообучения), которые улучшают оба вида распознавания одновременно. Датасет и опросник команда выложила в открытый доступ как испытательный стенд для этого свойства, значимость которого, по их оценке, будет расти по мере того, как LLM заменяют традиционный поиск.

Ключевые факты

  • На 13 моделях и почти 670 тысячах испытаний модели показали результаты, близкие к случайному угадыванию, и в оценке надёжности источников, и в оценке правдивости утверждений
  • Популярность источника влияет на решения моделей примерно вдвое сильнее, чем его реальная надёжность
  • Модели меняют свою позицию примерно одинаково независимо от того, улучшает новое утверждение их оценку истины или ухудшает её
  • Более новые и крупные модели лучше распознают истинность утверждений, но НЕ лучше распознают надёжность источников, размер модели этот пробел не закрывает
  • Предварительно зарегистрированный опрос 299 пользователей подтвердил: нарушение этих принципов моделью снижает доверие людей к ней и желание её использовать

Почему это важно

LLM всё чаще подключают к интернет-поиску и другим внешним источникам, чтобы отвечать на актуальные вопросы, и постепенно заменяют собой традиционный поиск. Если модель не умеет отличать надёжный источник от просто популярного и не умеет корректно менять мнение в сторону истины, она рискует некритично тиражировать распространённые, но неточные утверждения, причём чем шире LLM используются вместо поиска, тем выше цена этой слепоты для конечных пользователей.

Кому это важно

В первую очередь, разработчикам продуктов, которые строят поиск и агентов с доступом в интернет поверх LLM: они получают конкретное измеримое ограничение модели, а не абстрактное «модели иногда ошибаются». Также это важно для исследователей выравнивания (alignment) моделей и для пользователей, которые полагаются на ответы LLM с веб-поиском как на замену собственной проверки источников.

Как это применить

Авторы нашли простые вмешательства на этапе инференса (без дообучения модели), которые улучшают одновременно и распознавание надёжности источника, и распознавание истинности утверждения. Команда также выложила датасет и опросник L2D в открытый доступ, их можно использовать как готовый бенчмарк для проверки собственных моделей и пайплайнов, работающих с внешними источниками, вместо того чтобы полагаться только на общие оценки качества ответов.

Можно ли доверять

Методология выглядит основательной: три нормативных аксиомы с измеримыми метриками, предварительно зарегистрированный квотный опрос на 299 участниках для внешней валидации самих аксиом, и масштабная проверка на 13 моделях почти в 670 тысячах испытаний. Само по себе это академическая препринт-работа с arXiv, прошедшая через прозрачно описанный протокол, но без указания на рецензирование в журнале или конференции в приведённом тексте.

Риски и подводные камни

Главный риск, не единичная ошибка, а системный паттерн: модели путают популярность источника с его надёжностью и почти не различают, ведёт ли новая информация к истине или от неё. При этом рост размера и «свежести» модели решает только половину проблемы, распознавание истины улучшается, а распознавание надёжности источника остаётся на прежнем уровне. Это значит, что просто более крупная или новая модель не гарантирует более критичной работы с источниками, и полагаться на такую защиту от дезинформации без дополнительных мер (в том числе найденных авторами вмешательств) рискованно.