CriticGen: фреймворк оценки ответов LLM, который сам их дорабатывает

Авторы работы указывают, что нынешние методы оценки больших языковых моделей грубые и оторваны от самой генерации: они выдают общие объяснения, из которых непонятно, что именно менять в ответе, чтобы его улучшить. Чтобы решить эту проблему, предложен CriticGen, фреймворк оценки, «осведомлённой о генерации» (generation-aware), который превращает саму оценку в инструмент доработки ответа.

Работает это так: для каждого конкретного ответа CriticGen сначала сам формирует индивидуальные измерения оценки и критерии по ним, отталкиваясь от трёх укрупнённых категорий, субъективных, объективных и «самостоятельно выведенных» ограничений (self-derived constraints; что именно стоит за третьей категорией, в тексте не раскрыто). Эти критерии складываются в динамический рубрик (набор правил оценки), который затем разом выдаёт четыре вещи: числовую оценку, объяснение этой оценки, конкретную исполнимую инструкцию по доработке и уже переписанный, доработанный ответ. Такая привязка доработки к рубрику, по замыслу авторов, позволяет модели точечно находить недостатки конкретного ответа и целенаправленно его улучшать.

В экспериментах качество самих сформированных рубриков выросло: релевантность критериев, с 3,33 до 3,97, полнота, с 4,03 до 4,24. Оценки CriticGen показали лучшую среди сравниваемых подходов корреляцию с эталоном, 0,9556 по Пирсону и 0,9560 по Спирмену (с чем именно сравнивали, в тексте не названо). Точность объяснений оценки, привязанных к критериям, и предлагаемых исправлений тоже выросла: F1 для объяснений, с 0,6369 до 0,7554, F1 для исполнимых рекомендаций, с 0,5994 до 0,7900. Главный практический результат: доработка ответа по обратной связи CriticGen улучшает 73,17% ответов, а в 93,28% случаев доработка не ухудшает ответ по сравнению с исходным.

Вывод авторов по итогам экспериментов: мелкогранулированная оценка должна быть одновременно привязанной к конкретному примеру и действенной (actionable), то есть давать не общую оценку, а конкретный путь улучшения, и именно такая обратная связь, как показали результаты, надёжно конвертируется в реальное улучшение ответа.

Ключевые факты

  • CriticGen формирует критерии оценки индивидуально под каждый ответ, а не применяет общую фиксированную шкалу.
  • Из критериев складывается «рубрик», который сразу выдаёт оценку, объяснение оценки, исполнимую инструкцию по доработке и переписанный ответ.
  • Качество формируемых рубриков выросло: релевантность, с 3,33 до 3,97, полнота, с 4,03 до 4,24.
  • Оценки CriticGen коррелируют с эталоном на уровне 0,9556 (Пирсон) и 0,9560 (Спирмен); F1 объяснений и рекомендаций вырос до 0,7554 и 0,7900 соответственно.
  • Доработка по обратной связи CriticGen улучшает 73,17% ответов, а в 93,28% случаев не делает ответ хуже исходного.

Почему это важно

Оценка ответов языковых моделей сегодня чаще всего грубая и не связана с самим процессом генерации: модель или человек выставляют общую оценку с общим комментарием, из которого неясно, что конкретно поправить. CriticGen устраняет именно этот разрыв, превращает оценку в источник конкретной, исполнимой инструкции по доработке, а не просто оценивает результат постфактум.

Кому это важно

Прежде всего команды, которые обучают и дообучают языковые модели и выстраивают для этого автоматизированные пайплайны оценки (в том числе схемы «модель судит модель», LLM-as-judge). Метод пригодится и разработчикам инструментов автоматической проверки и улучшения ответов ИИ, там, где нужна не просто оценка, а конкретная подсказка, как исправить конкретный ответ.

Как это применить

Это исследовательский метод из статьи на arXiv, а не готовый продукт: в тексте не названы ни открытый код, ни доступный сервис, ни условия использования. Сама схема воспроизводима по описанию: для каждого ответа генерируются свои критерии оценки по трём категориям (субъективные, объективные, самостоятельно выведенные ограничения), из них собирается рубрик, который одним проходом выдаёт оценку, объяснение, инструкцию по доработке и исправленный ответ, то есть доработку можно встроить прямо в цикл генерации, а не выносить оценку в отдельный этап.

Можно ли доверять

Это данные из аннотации к статье на arXiv, а не из независимого обзора: в тексте не названы ни авторы, ни их организации, ни конкретный бенчмарк или базовая модель, на которых получены цифры, ни то, с чем именно сравнивали корреляции 0,9556 и 0,9560. Все приведённые улучшения, самоотчёт авторов о собственном методе, без указания на независимую проверку или рецензирование.

Риски и подводные камни

Главный риск, отсутствие в тексте названия эталона для корреляций и конкретного бенчмарка, на котором измерялись показатели: без этого трудно понять, насколько результат переносится на другие задачи и модели. Кроме того, в тексте не сказано, какая модель выполняет оценку и доработку, если это та же модель, что генерирует ответ, самооценивание рискует унаследовать её слепые пятна. Наконец, 93,28% «неухудшения» означает, что в 6,72% случаев ответ после доработки всё же становится хуже исходного.