MirageBench показал: нейросети выдумывают факты о пользователях

Yushi Sun, Yanjie Zhang и Rui Sheng опубликовали 5 августа 2026 года на Hugging Face работу «The Personalization Mirage» («Мираж персонализации») и представили в ней MirageBench, бенчмарк для измерения того, насколько ассистенты с долговременной памятью склонны придумывать факты о пользователе, для которых нет оснований в разговоре. Авторы называют это явление over-inference, ниже оно передано как «домысливание». На Hugging Face публикация помечена организацией HKUST (сама аннотация место работы авторов не называет) и стала второй «статьёй дня» с 26 голосами сообщества.
MirageBench построен на 150 персонах, поровну разделённых на стереотипные, контрстереотипные и нейтральные, и 6 задачах на персонализацию, которые авторы выстроили вдоль условной «шкалы воображения», задачи заметно различаются тем, сколько домысливания требуют от модели (это подтверждает и разброс результатов по задачам, от 27% до 59%). Утверждения моделей о пользователе классифицирует независимая модель-судья по четырёхклассовой таксономии достоверности; судью сверили со «слепым» человеком-разметчиком на 400 утверждениях и получили высокое согласие, каппа Коэна 0,863 по четырём классам и 0,900 при сведении к бинарной шкале. На этой основе построен рейтинг из 12 моделей семи разных семейств, для которых в общей сложности проверили 143 616 утверждений.
Главный результат: домысливание пользовательских черт есть у всех 12 моделей без исключения, доля таких утверждений колеблется от 35% до 49%, в среднем 41,6% по моделям и 41,8% при подсчёте по всем утверждениям (модели с большим числом проверенных утверждений вносят в эту цифру больший вклад). Ни одна из проверенных моделей не избежала проблемы.
Второй, более неожиданный результат авторы называют «инверсией самоконтроля» (Self-Monitoring Inversion). Если сравнивать модели друг с другом по тому, сколько домысливания они сами себе приписывают, эта самооценка отрицательно коррелирует с уровнем, который фиксирует независимый судья: ранговая корреляция rho = -0,60, p = 0,044. Проще говоря: модели, заявляющие о наименьшем домысливании, на практике оказываются в числе тех, кого судья чаще всего уличает в выдумывании, самоотчёт модели вводит в заблуждение, если использовать его для сравнения моделей между собой. Внутри же одной модели дело обстоит иначе: если попросить модель оценить уверенность по каждому отдельному своему утверждению, эта самооценка более-менее неплохо ранжирует именно её собственные утверждения по вероятности домысливания, показатель AUROC (площадь под ROC-кривой, где 0,5, случайное угадывание, а 1,0, идеальное ранжирование) для этого составляет от 0,58 до 0,83.
Отдельно, в пилотном многоходовом тесте (его масштаб статья не раскрывает), придуманные детали о пользователе накапливаются от хода к ходу почти линейно и почти не пересматриваются, домысленное не самоисправляется по ходу разговора. Авторы прямо оговаривают, что вывод про «инверсию самоконтроля» статистически предварительный (exploratory): он посчитан всего на 12 моделях, а доверительный интервал для корреляции широкий, от -0,90 до +0,06, то есть почти доходит до нуля и слегка заходит в область положительных значений. Из всего этого авторы делают вывод: доверять стоит не тому, что модель сообщает о себе сама, а внешней независимой проверке, именно на этом принципе построен сам MirageBench.
Ключевые факты
- MirageBench: 150 персон (стереотипные, контрстереотипные и нейтральные), 6 задач на персонализацию, 12 моделей из 7 семейств, 143 616 проверенных утверждений.
- Каждая из 12 моделей приписывает пользователю недоказанные детали в 35, 49% утверждений (41,6% в среднем по моделям, 41,8% по утверждениям); ни одна модель не избежала этого.
- «Инверсия самоконтроля»: модели, которые сами оценивают себя как наименее склонные к домысливанию, на деле оказываются наиболее склонными к нему (ранговая корреляция rho = -0,60, p = 0,044 на 12 моделях; сами авторы называют вывод предварительным).
- Внутри одной модели самооценка отдельных утверждений работает более-менее сносно (AUROC 0,58, 0,83), проблема именно в сравнении моделей друг с другом по их самоотчётам.
- Домысливание зависит от типа задачи (от 27% до 59%), а в пилотном многоходовом тесте придуманные детали накапливаются почти линейно и почти не пересматриваются.
Почему это важно
Персонализированные ассистенты с долговременной памятью запоминают детали о пользователе между сессиями и всё шире входят в обиход, но насколько достоверны эти внутренние «профили» пользователя, до сих пор системно не проверялось. Авторы изучают именно это, явление over-inference, «домысливание»: модель приписывает пользователю характеристики, для которых в разговоре нет достаточных оснований. Результат: домысливание, не сбой отдельной модели, а системное свойство. Из 12 протестированных моделей семи разных семейств ни одна не избежала домысливания: доля таких утверждений, от 35% до 49% (в среднем 41,6% по моделям, 41,8% по утверждениям). То есть ассистент, который якобы «запомнил» что-то о пользователе, в среднем в четырёх случаях из десяти на самом деле это придумал.
Кому это важно
В первую очередь, командам, которые строят ассистентов с персональной памятью: домысливание пользовательских черт оказалось не редким багом конкретного продукта, а фоновым свойством всех 12 проверенных моделей, значит рассчитывать, что «наша модель другая», без отдельной проверки не стоит. Дальше, исследователям в области оценки и безопасности ИИ: авторы предлагают не просто диагноз, а готовую методику, 150 персон, 6 задач, независимая модель-судья, сверенная с человеком-разметчиком, для измерения этой же проблемы у любой модели с памятью. И конечным пользователям персонализированных сервисов: если ассистент незаметно достраивает профиль пользователя домыслами, а не фактами, это может повлиять на то, какие советы, тон и рекомендации он выдаёт.
Как это применить
Работа, исследовательский бенчмарк, а не готовый продукт: на странице публикации на Hugging Face не указано ни одной модели, ни одного датасета, ссылающихся на статью, и нет упоминания репозитория с кодом, так что воспроизвести MirageBench своими силами по состоянию на момент публикации нечем, кроме самого текста статьи (со страницы есть ссылки на arXiv и PDF). Практический вывод для команд, которые уже занимаются похожим: раз самоотчёт модели вводит в заблуждение именно при сравнении моделей между собой, выбирать модель для функции персонализации по тому, что она сама говорит о своей «честности», не стоит, нужна внешняя независимая проверка утверждений о пользователе, как в MirageBench. Показательно и то, что домысливание сильно зависит от типа задачи (от 27% до 59%): если продукт использует персонализацию в одном узком сценарии, разумнее измерять именно на нём, а не полагаться на усреднённую цифру по всем задачам.
Можно ли доверять
Методика проверена достаточно тщательно для препринта: независимую модель-судью, которая распределяет утверждения по четырёхклассовой таксономии достоверности, сверили со «слепым» человеком-разметчиком на 400 утверждениях и получили высокое согласие, каппа Коэна 0,863 по четырём классам и 0,900 при сведении к бинарной шкале (домыслил или нет); сама оценка построена на 143 616 проверенных утверждениях 12 моделей, выборка довольно большая. Слабее подкреплён самый эффектный вывод статьи, «инверсия самоконтроля»: ранговая корреляция между самооценкой модели и оценкой судьи (rho = -0,60, p = 0,044) посчитана всего на 12 моделях, и сами авторы называют её предварительной (exploratory), с широким доверительным интервалом от -0,90 до +0,06, он почти доходит до нуля и даже слегка заходит в область положительных значений. Иначе говоря: то, что домысливание массово присутствует, подтверждено солидно (143 616 утверждений), а то, что модели, которые сами оценивают себя как наименее склонные к домысливанию, на деле оказываются наиболее склонными к нему, скорее правдоподобная тенденция на маленькой выборке моделей, чем окончательно доказанный факт. Дополнительный контекст: на Hugging Face это вторая «статья дня» с 26 голосами сообщества, заметный, но не проходивший публичное рецензирование препринт; для проверки на 400 утверждениях использовался один человек-разметчик, а не несколько, так что перекрёстного согласия между разными людьми в статье нет.
Риски и подводные камни
Главный практический риск, соблазн «починить» домысливание, поручив модели следить за собой: статья прямо показывает, что модели, заявляющие о низком уровне домысливания, часто оказываются худшими нарушителями, так что самоаудит как единственная защита не работает при сравнении и выборе моделей. Второй риск, накопительный: в пилотном многоходовом тесте (масштаб которого статья не раскрывает) придуманные детали о пользователе накапливаются от хода к ходу почти линейно и почти не пересматриваются, ошибка не самоисправляется по ходу разговора, а множится. Третий: раз 150 персон MirageBench намеренно включают стереотипные и контрстереотипные профили, а домысливание, обычное дело, велик риск, что в реальных системах домысленные детали чаще окажутся стереотипными достройками образа пользователя, а не нейтральными предположениями. Наконец, стоит держать в уме ограничения самого исследования: небольшая выборка моделей для главного статистического вывода, один человек-разметчик на этапе валидации и отсутствие пока опубликованных кода или датасета для независимой проверки.