CoRT: токен-уровневое распределение кредита в GRPO-обучении

CoRT: токен-уровневое распределение кредита в GRPO-обучении

Rubric-based reinforcement learning (обучение с подкреплением по явным критериям-рубрикам) оценивает ответ языковой модели по набору конкретных требований. Но в GRPO-подобных схемах обучения эта детальная оценка сворачивается в одно число, скалярную награду за весь ответ целиком. Из неё считается общее преимущество (advantage), и это преимущество одинаково размазывается по всем токенам сгенерированного текста. В результате нет механизма, который отдельно поощрял бы или наказывал именно те токены, что отвечают за выполнение конкретного критерия рубрики, даже если разные критерии привязаны к разным участкам текста, к оформлению или к конкретным смысловым решениям.

Bo-Wen Zhang с соавторами предложили метод CoRT (Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization, контрфактическое воспроизведение для токен-уровневой оптимизации политики по рубрикам). Вместо обучения отдельной вспомогательной модели-скорера CoRT дважды пересчитывает (replay) один и тот же сгенерированный ответ: один раз, с исходным промптом, где заданы критерии рубрики, и второй раз, с тем же промптом, но без этих критериев. Разница в токен-уровневой лог-правдоподобности между двумя прогонами показывает, насколько конкретный токен зависит именно от присутствия рубрики в контексте. Эти разницы превращают в ограниченные, нормированные по ответу веса и с их помощью перераспределяют знаковое GRPO-преимущество по токенам, при этом сама награда на уровне всего ответа не меняется и никакая дополнительная модель-скорер не добавляется.

В экспериментах на нескольких instruction-tuned моделях и при разной степени детализации награды CoRT в подавляющем большинстве сравнений превзошёл обычный GRPO на уровне ответа, в среднем на 4,4 процентного пункта. По качеству метод остаётся конкурентоспособным с базовыми подходами, где токен-уровневый кредит обучается отдельной моделью, но при этом не требует отдельного этапа обучения релевантности и сохраняет простоту и стабильность обычного GRPO.

Ключевые факты

  • CoRT решает проблему GRPO: единая награда за весь ответ размазывается по всем токенам поровну, хотя разные критерии рубрики относятся к разным частям текста.
  • Метод не обучает отдельную модель-скорер, вместо этого дважды пересчитывает лог-правдоподобность одного и того же ответа: с критериями рубрики в промпте и без них.
  • Разница между двумя прогонами (counterfactual replay) даёт ограниченные, нормированные веса токенов, которыми перераспределяется GRPO-преимущество.
  • В экспериментах на нескольких instruction-tuned моделях CoRT обходит обычный response-level GRPO в среднем на 4,4 процентного пункта.
  • Метод конкурентен с обучаемыми токен-уровневыми базовыми подходами, но проще, не требует отдельного этапа обучения релевантности.

Почему это важно

Это методологическая работа для обучения с подкреплением языковых моделей по явным критериям (rubric-based RL), направления, которое всё чаще используют вместо обучения на предпочтениях людей (RLHF). Главная проблема, которую решает CoRT, «размазывание» одной общей награды по всем токенам ответа: сегодняшние GRPO-пайплайны не различают, какой именно токен отвечал за выполнение какого критерия. CoRT предлагает способ распределить кредит между токенами, не добавляя отдельную обучаемую модель-скорер и не меняя саму награду за ответ.

Кому это важно

Исследователям и инженерам, которые занимаются пост-тренингом языковых моделей методами обучения с подкреплением, в частности, теми, кто использует GRPO и rubric-based награды для выравнивания (alignment) моделей под конкретные требования к формату, стилю или содержанию ответа.

Как это применить

CoRT встраивается в существующий GRPO-пайплайн как замена способа распределения преимущества (advantage) по токенам, без обучения дополнительной модели и без изменения самой формулы награды за ответ. Это делает метод относительно недорогим для внедрения командами, у которых уже настроено обучение с рубриками.

Можно ли доверять

Работа опубликована как препринт на HuggingFace Papers (78 отметок, 3 комментария) и описывает эксперименты на нескольких instruction-tuned моделях с разной степенью детализации награды. Независимое рецензирование (peer review) в материале не упоминается, поэтому результаты стоит воспринимать как предварительные, хотя методология, сравнение с matched response-level GRPO и с обучаемыми токен-уровневыми базовыми подходами, выглядит корректно поставленной.

Риски и подводные камни

Метод требует двойного пересчёта (replay) лог-правдоподобности для каждого ответа, что добавляет вычислительные затраты по сравнению с обычным GRPO. Авторы сами отмечают, что CoRT лишь «конкурентен» с обучаемыми токен-уровневыми базовыми подходами, а не однозначно превосходит их, то есть выигрыш проявляется прежде всего в простоте и отсутствии отдельного этапа обучения релевантности, а не в безусловном приросте качества.