Исследование: нейросети путаются в ответах при перефразировке вопроса, расхождение свыше 23%

Учёные проверили, насколько устойчивы ответы больших языковых моделей (LLM), когда один и тот же вопрос перефразируют, сохраняя смысл. Эксперимент охватил четыре бенчмарка (задачи на фактические знания и математическое рассуждение) и 13 моделей. Итог: средняя точность при перефразировках почти не падает, но это создаёт ложное впечатление надёжности. На уровне отдельных вопросов картина куда хуже, модель может ответить правильно на одну формулировку и неправильно на другую, чисто из-за смены слов, а не смысла. Доля таких расхождений (mismatch rate) достигает более 23%. Если смотреть только на вопросы, где модель изначально ответила верно, доля случаев, когда перефразировка сбивает её на неверный ответ (флип-рейт), оказывается ещё выше, то есть правильный ответ на один-единственный вариант формулировки почти ничего не говорит о том, знает ли модель материал на самом деле. При этом авторы заметили и обнадёживающий момент: для многих вопросов модель хотя бы на одной из перефразировок отвечает верно, то есть нужные знания у неё есть, но извлекаются они нестабильно, в зависимости от формулировки запроса. Опираясь на это наблюдение, авторы предложили простой приём, self-paraphrasing (модель сама генерирует несколько перефразировок вопроса и сверяет ответы), и показали, что он частично восстанавливает эти скрытые знания и повышает итоговую точность на этапе вывода (инференса). Общий вывод работы: стандартные метрики точности маскируют серьёзную нестабильность моделей, и чтобы честно оценить их надёжность, нужно проверять согласованность ответов на эквивалентные по смыслу формулировки вопроса, а не только точность на фиксированном наборе фраз.

Ключевые факты

  • Проверка охватила 4 бенчмарка (фактические вопросы и математика) и 13 моделей.
  • Средняя точность при перефразировках почти не меняется, но на уровне отдельных вопросов расхождение (mismatch rate) достигает более 23%.
  • Если смотреть только на вопросы, изначально отвеченные верно, доля случаев, когда перефразировка сбивает модель на неверный ответ, ещё выше.
  • Для многих вопросов модель хотя бы на одной из перефразировок отвечает правильно, знания есть, но извлекаются нестабильно.
  • Приём self-paraphrasing (модель сама генерирует несколько формулировок вопроса и сверяет ответы) частично восстанавливает скрытые знания и повышает точность.

Почему это важно

Работа показывает, что привычная метрика, точность на фиксированном наборе вопросов, переоценивает надёжность нейросетей. Модель может «знать» правильный ответ и при этом регулярно ошибаться просто из-за того, как сформулирован вопрос. Это подрывает доверие к бенчмаркам как единственному мерилу качества модели.

Кому это важно

Разработчикам LLM и командам, которые оценивают и сравнивают модели по бенчмаркам; инженерам, строящим продукты поверх таких моделей (чат-боты, ассистенты, системы вопрос-ответ), где формулировка запроса пользователя заранее не известна и не контролируется.

Как это применить

Авторы предлагают простой практический приём, self-paraphrasing: модель сама создаёт несколько альтернативных формулировок вопроса, генерирует ответы на каждую и сверяет их между собой. Это позволяет частично компенсировать нестабильность и повысить итоговую точность без дообучения модели, прямо на этапе вывода (инференса).

Можно ли доверять

Результат получен на большой выборке, 4 бенчмарка и 13 разных моделей, что снижает риск случайности вывода. Однако конкретные числа (доля расхождений, флип-рейт) взяты из абстракта работы; методология подсчёта и полный список моделей в предзагруженном тексте не раскрываются, для деталей нужно смотреть полный текст статьи.

Риски и подводные камни

Если пользователи или тестировщики продолжат опираться только на точность при одной фиксированной формулировке вопроса, реальная надёжность модели в проде может систематически переоцениваться. Приём self-paraphrasing снижает проблему лишь частично и требует дополнительных вызовов модели (лишние ответы на перефразировки), то есть увеличивает стоимость и время получения ответа.