Исследование на DeepSeek: обоснования почти не повышают точность ответов, но сбивают проверяющую модель

Авторы статьи на arXiv изучают конвейеры вопрос-ответ с разделением ролей: одна модель рассуждает, другая проверяет. Всё чаще между ними передают обоснование (rationale, то есть цепочку рассуждений), но неясно, что это даёт: более точные ответы, более надёжную оценку того, подкреплён ли ответ, или новую уязвимость.

Для ответа предложена диагностика «вмешательство в сообщение» (message-intervention). Доказательства и кандидатный ответ фиксируются, а меняется только обоснование, которое переходит от рассуждающей модели к проверяющей. Основной эксперимент: 400 примеров из наборов MuSiQue, HotpotQA и 2WikiMultiHopQA, DeepSeek в роли и генератора, и проверяющего.

Главный результат: честные (faithful) обоснования почти не добавляют точности ответов по сравнению с отсутствием обоснования, зато искажённые обоснования сильно меняют оценки поддержки, то есть суждения проверяющего о том, подкреплён ли ответ. При «слепом» промпте проверяющего безвредные перефразировки сдвигают оценки поддержки лишь на 0, 2,5%, а искажённые обоснования, на 10, 22%. Если проверяющего явно просят проверять обоснование, тот же эффект усиливается до 34, 55%.

Итоговые ответы двигаются меньше, на 2, 30%, и лишь 2,9, 35,3% случаев, когда оценка поддержки менялась из-за искажённого обоснования, сопровождаются сменой ответа. То есть влияние обоснования проявляется главным образом в суждении «подтверждено или нет», а не в самом ответе.

Аудит с участием людей показал, почему это важно: 16 из 42 валидных искажений оказались случаями чрезмерного доверия к искажённому обоснованию (corruption-overtrust). Люди, оценивавшие вслепую, отвергли или сочли неясными 9 из 10 проверенных искажённых обоснований, которые модель при этом приняла. Межмодельные проверки и проверки на границах задач, по словам авторов, показывают, когда этот канал активен, усилен, неактивен или сливается с меткой задачи.

Вывод авторов: передачу обоснований следует оценивать как механизм верификационного сообщения, а не только как способ повысить точность ответов.

Ключевые факты

  • Диагностика фиксирует доказательства и кандидатный ответ и меняет только обоснование, передаваемое от рассуждающей модели к проверяющей.
  • Основной эксперимент: 400 примеров из MuSiQue, HotpotQA и 2WikiMultiHopQA, DeepSeek как генератор и проверяющий; честные обоснования почти не повышают точность ответов.
  • При слепом промпте безвредные перефразировки сдвигают оценки поддержки на 0, 2,5%, искажённые обоснования, на 10, 22%; при явной просьбе проверять обоснование, на 34, 55%.
  • Итоговые ответы двигаются на 2, 30%; лишь 2,9, 35,3% сдвигов оценки поддержки из-за искажений сопровождаются сменой ответа.
  • Аудит людьми: 16 из 42 валидных искажений, случаи чрезмерного доверия; люди вслепую отвергли или сочли неясными 9 из 10 искажённых обоснований, принятых моделью.

Почему это важно

Передача обоснований между ролями, популярный приём в многошаговых конвейерах, и обычно его оценивают по точности итогового ответа. Работа показывает, что на 400 примерах с DeepSeek честные обоснования почти ничего не добавляют к точности, зато искажённые заметно влияют на суждения проверяющего. Это смещает вопрос: важно не только то, помогает ли обоснование отвечать, но и то, как оно влияет на проверку.

Кому это важно

Тем, кто строит системы вопрос-ответ с разделением на «рассуждающего» и «проверяющего», и тем, кто оценивает такие системы. Также исследователям, которые измеряют пользу объяснений моделей только по точности ответов.

Как это применить

Прямых рекомендаций по внедрению в аннотации нет. Идея для оценки: фиксировать доказательства и кандидатный ответ и менять только передаваемое обоснование (честное, перефразированное, искажённое), сравнивая, как меняются оценки поддержки и итоговые ответы. Сами авторы советуют оценивать передачу обоснований как механизм верификационного сообщения, а не только как путь к точности.

Можно ли доверять

Это аннотация научной статьи на arXiv. Цифры приведены в ней без расшифровки: не сказано, это процентные пункты или относительные изменения, какие базовые уровни взяты и какая именно версия DeepSeek использована. Результаты межмодельных проверок в аннотации не даны числами. Выводы относятся к конкретной постановке: три набора многошаговых вопросов и 400 примеров в основном эксперименте.

Риски и подводные камни

Главный риск, чрезмерное доверие проверяющей модели к убедительно выглядящему, но искажённому обоснованию: по аудиту, модель приняла искажённые обоснования, которые люди вслепую отвергали или считали неясными (9 из 10 проверенных). Явная просьба проверять обоснование не защищает, а усиливает сдвиг оценок до 34, 55%. Кроме того, оценка только по итоговой точности может не заметить проблему: ответ меняется заметно реже, чем оценка поддержки.

«Передачу обоснований следует оценивать как механизм верификационного сообщения, а не только как путь к более высокой точности ответов.»

— из аннотации статьи