Исследование: нейросети путаются в ответах при перефразировке вопроса, расхождение свыше 23%
Учёные проверили, насколько устойчивы ответы больших языковых моделей (LLM), когда один и тот же вопрос перефразируют, сохраняя смысл. Эксперимент охватил четыре бенчмарка (задачи на фактические знания и математическое рассуждение) и 13 моделей. Итог: средняя точность при перефразировках почти не падает, но это создаёт ложное впечатление надёжности. На уровне отдельных вопросов картина куда хуже, модель может ответить правильно на одну формулировку и неправильно на другую, чисто из-за смены слов, а не смысла. Доля таких расхождений (mismatch rate) достигает более 23%. Если смотреть только на вопросы, где модель изначально ответила верно, доля случаев, когда перефразировка сбивает её на неверный ответ (флип-рейт), оказывается ещё выше, то есть правильный ответ на один-единственный вариант формулировки почти ничего не говорит о том, знает ли модель материал на самом деле. При этом авторы заметили и обнадёживающий момент: для многих вопросов модель хотя бы на одной из перефразировок отвечает верно, то есть нужные знания у неё есть, но извлекаются они нестабильно, в зависимости от формулировки запроса. Опираясь на это наблюдение, авторы предложили простой приём, self-paraphrasing (модель сама генерирует несколько перефразировок вопроса и сверяет ответы), и показали, что он частично восстанавливает эти скрытые знания и повышает итоговую точность на этапе вывода (инференса). Общий вывод работы: стандартные метрики точности маскируют серьёзную нестабильность моделей, и чтобы честно оценить их надёжность, нужно проверять согласованность ответов на эквивалентные по смыслу формулировки вопроса, а не только точность на фиксированном наборе фраз.
Ключевые факты
- Проверка охватила 4 бенчмарка (фактические вопросы и математика) и 13 моделей.
- Средняя точность при перефразировках почти не меняется, но на уровне отдельных вопросов расхождение (mismatch rate) достигает более 23%.
- Если смотреть только на вопросы, изначально отвеченные верно, доля случаев, когда перефразировка сбивает модель на неверный ответ, ещё выше.
- Для многих вопросов модель хотя бы на одной из перефразировок отвечает правильно, знания есть, но извлекаются нестабильно.
- Приём self-paraphrasing (модель сама генерирует несколько формулировок вопроса и сверяет ответы) частично восстанавливает скрытые знания и повышает точность.
Почему это важно
Работа показывает, что привычная метрика, точность на фиксированном наборе вопросов, переоценивает надёжность нейросетей. Модель может «знать» правильный ответ и при этом регулярно ошибаться просто из-за того, как сформулирован вопрос. Это подрывает доверие к бенчмаркам как единственному мерилу качества модели.
Кому это важно
Разработчикам LLM и командам, которые оценивают и сравнивают модели по бенчмаркам; инженерам, строящим продукты поверх таких моделей (чат-боты, ассистенты, системы вопрос-ответ), где формулировка запроса пользователя заранее не известна и не контролируется.
Как это применить
Авторы предлагают простой практический приём, self-paraphrasing: модель сама создаёт несколько альтернативных формулировок вопроса, генерирует ответы на каждую и сверяет их между собой. Это позволяет частично компенсировать нестабильность и повысить итоговую точность без дообучения модели, прямо на этапе вывода (инференса).
Можно ли доверять
Результат получен на большой выборке, 4 бенчмарка и 13 разных моделей, что снижает риск случайности вывода. Однако конкретные числа (доля расхождений, флип-рейт) взяты из абстракта работы; методология подсчёта и полный список моделей в предзагруженном тексте не раскрываются, для деталей нужно смотреть полный текст статьи.
Риски и подводные камни
Если пользователи или тестировщики продолжат опираться только на точность при одной фиксированной формулировке вопроса, реальная надёжность модели в проде может систематически переоцениваться. Приём self-paraphrasing снижает проблему лишь частично и требует дополнительных вызовов модели (лишние ответы на перефразировки), то есть увеличивает стоимость и время получения ответа.