Дообучение по инструкциям меняет уверенность моделей и снижает разнообразие их рассуждений

Дообучение по инструкциям меняет уверенность моделей и снижает разнообразие их рассуждений

Языковые модели, дополнительно обученные выполнять инструкции (то есть переведённые из «сырой» базовой формы в формат диалогового ассистента), хорошо справляются с широким кругом задач генерации текста. Но, как показывали более ранние работы, такие модели склонны к вербализованной сверхуверенности: когда модель сама оценивает в тексте, насколько она уверена в своём ответе, эта заявленная уверенность оказывается завышенной. В задачах вопрос-ответ такая избыточная уверенность может быть связана с тем, насколько согласованны обоснования, которые модель приводит в поддержку своего ответа. Авторы новой работы проверяют: меняется ли лексическое разнообразие этих обоснований вместе с изменением уверенности модели, которое вызывает дообучение по инструкциям?

Чтобы это проверить, авторы сравнили три пары моделей, «сырую» базовую версию и её же вариант, дообученный по инструкциям, на нескольких бенчмарках для проверки ответов на вопросы. Конкретные названия моделей и бенчмарков, а также точные числовые результаты в доступном тексте работы не приводятся, только качественные выводы.

Первый результат касается уверенности. Дообучение по инструкциям стабильно меняет то, насколько уверенно модель заявляет о своих ответах, и это происходит при том, что точность самих ответов меняется незначительно, а калибровка на основе правдоподобия (насколько заявленная моделью уверенность соответствует её реальной правоте) при этом ухудшается. То есть сдвиг в заявленной уверенности не объясняется тем, что модель стала отвечать точнее, это согласуется с более ранними наблюдениями об избыточной вербализованной уверенности у моделей, дообученных по инструкциям.

Второй результат касается разнообразия обоснований, и здесь эффект неоднородный. Разнообразие между разными обоснованиями, которые модель даёт для одного и того же ответа, после дообучения по инструкциям стабильно снижается, модель начинает объяснять себя более однотипно. А вот поверхностное лексическое разнообразие, то, насколько разнообразна лексика внутри самих обоснований, ведёт себя не так предсказуемо: оно меняется и в одну, и в другую сторону, причём с разной силой в зависимости от конкретной модели и бенчмарка.

Наконец, авторы проверили, не объясняются ли оба эффекта побочными факторами, тем, какой именно ответ выбрала модель, или длиной самого обоснования. После того как эти факторы учли отдельно, различия в уверенности и в разнообразии обоснований сохранились. Это подтверждает, что уверенность модели и разнообразие её рассуждений, два самостоятельных следствия дообучения по инструкциям, а не два проявления одного и того же изменения.

Ключевые факты

  • Авторы сравнили три пары моделей, базовую версию и её же вариант, дообученный по инструкциям, на нескольких бенчмарках вопрос-ответ; конкретные модели и бенчмарки в тексте не названы.
  • Дообучение по инструкциям стабильно меняет заявленную моделью уверенность в ответах, хотя точность ответов меняется незначительно, а калибровка (соответствие уверенности реальной правоте) ухудшается.
  • Разнообразие между разными обоснованиями одного и того же ответа после дообучения по инструкциям стабильно снижается, модель объясняет себя более однотипно.
  • Поверхностное лексическое разнообразие внутри самих обоснований меняется непредсказуемо: и в плюс, и в минус, с разной силой в зависимости от модели и бенчмарка.
  • Оба эффекта, сдвиг уверенности и снижение разнообразия, сохраняются даже после учёта того, какой ответ выбрала модель, и длины обоснования: это два независимых следствия дообучения по инструкциям.

Почему это важно

Чат-ассистенты, которыми пользуются каждый день, почти всегда, это языковые модели, прошедшие дообучение по инструкциям: базовую модель дополнительно обучают выполнять команды и вести диалог. Работа показывает, что именно этот шаг обучения, а не рост точности ответов, систематически меняет заявленную моделью уверенность и одновременно делает её обоснования менее разнообразными между попытками. Избыточную вербализованную уверенность таких моделей отмечали и раньше; здесь её напрямую связывают с самим шагом дообучения по инструкциям и проверяют вместе со сдвигом в разнообразии рассуждений, а не по отдельности.

Кому это важно

Исследователям, которые занимаются калибровкой языковых моделей и оценкой их неопределённости; разработчикам ассистентов, дообученных по инструкциям, и командам, отвечающим за безопасность и согласованность моделей, им нужно понимать, как сам шаг дообучения влияет на надёжность заявленной моделью уверенности. Важно это и тем, кто в своих продуктах опирается на несколько независимо сгенерированных моделью обоснований одного ответа: именно разнообразие между такими обоснованиями, как показывает работа, дообучение по инструкциям снижает.

Как это применить

Прямых рекомендаций или объяснения механизма авторы не приводят, но из результатов следует практический вывод: заявленную моделью уверенность в ответе после дообучения по инструкциям нельзя воспринимать как надёжный показатель точности, уверенность меняется независимо от того, точнее модель или нет. Если продукт опирается на несколько сгенерированных моделью обоснований одного ответа, например чтобы выбрать более надёжный вариант, стоит учитывать, что после дообучения по инструкциям такие обоснования становятся более похожими друг на друга и хуже работают как независимые сигналы. При выборе модели для задач вопрос-ответ калибровку уверенности стоит проверять отдельно от точности, а не считать, что улучшение одного автоматически означает улучшение другого.

Можно ли доверять

Материал, препринт на HuggingFace Papers, по сути зеркало arXiv, идентификатор 2608.13430; в самом тексте не указаны ни имена авторов, ни организация, ни дата, ни площадка публикации, но карточка называет автора (Irina Proskurina) и дату подачи; организацию источник не называет. На момент публикации карточки у неё 7 отметок и 2 комментария, то есть внешняя реакция пока минимальна. Конкретные модели и бенчмарки, а также числовые значения точности, калибровки и разнообразия в тексте не приводятся, только качественное направление эффектов: «стабильно снижается», «меняется и в плюс, и в минус». При этом вывод сформулирован не как единичное наблюдение, а как результат, воспроизведённый на трёх разных парах моделей.

Риски и подводные камни

Авторы не объясняют, почему дообучение по инструкциям так действует на уверенность и разнообразие обоснований, механизм эффекта в доступном тексте не предложен. Результат получен всего на трёх парах моделей, и неизвестно, какие именно это модели и какой конкретно способ дообучения использовался, обобщать вывод на все модели, дообученные по инструкциям, стоит осторожно. Точных числовых значений эффекта, насколько именно меняется уверенность, насколько именно падает разнообразие, в доступном тексте нет, есть только направление изменений, поэтому судить о практической значимости эффекта по одному пересказу нельзя. Главный практический риск: если система полагается на заявленную моделью уверенность как индикатор надёжности ответа, дообучение по инструкциям может сделать этот индикатор менее информативным, а не более, и это стоит проверять отдельно, а не считать само собой разумеющимся.