OPDVR: новый метод совместил дистилляцию и проверяемые награды в обучении LLM

Wenze Lin с соавторами описали метод OPDVR (On-policy Distillation with Verifiable Reward) для дообучения больших языковых моделей после базового обучения. Отправная точка, два широко используемых подхода к такому дообучению, у каждого своя слабость. Обучение с проверяемой наградой (RLVR) даёт сигнал только на уровне всей задачи целиком, и этот сигнал редкий (sparse). Дистилляция по действующей политике (on-policy distillation, OPD), наоборот, даёт плотный сигнал на уровне каждого токена, но не учитывает, была ли вся траектория рассуждения в итоге правильной, из-за этого качество модели-ученика ограничено сверху качеством модели-учителя, у которой она учится. Объединить оба подхода выглядело логичным шагом: OPD дал бы плотный сигнал, RLVR, проверку правильности на уровне задачи. Но по словам авторов, прежние попытки такого объединения сводились к взвешенной комбинации двух сигналов или к эвристическому переключению между ними, а это добавляет новые гиперпараметры и компромиссы, которые нужно подбирать вручную.
OPDVR решает это без единого нового гиперпараметра. Метод переформулирует неявную награду, которую подразумевает OPD на уровне отдельных токенов, так, чтобы она учитывала правильность всей траектории целиком. Затем поверх этой награды применяется гейтинг на основе функции ReLU: если траектория рассуждения оказалась правильной, награда становится неотрицательной, если неправильной, неположительной. Так сигнал дистилляции согласуется с фактическим успехом решения задачи, но не теряет то, что даёт исходная дистилляция, направляющее распределение вероятностей от модели-учителя. Побочный эффект этой переформулировки: сам OPD превращается в полноценный метод типа RLVR, который можно свободно сочетать с любым алгоритмом policy gradient, в тексте отдельно назван GRPO.
Авторы проверили OPDVR на шести тестах (бенчмарках) на способность модели рассуждать и сообщают, что метод стабильно превосходит стандартный OPD на всех них. Конкретные названия бенчмарков, численные показатели прироста и сравнение с RLVR по отдельности или с другими гибридными методами в тексте не приводятся, там дана только качественная формулировка о стабильном превосходстве. Код метода выложен в открытом доступе на GitHub, в репозитории LeapLabTHU/OPDVR.
Ключевые факты
- RLVR даёт редкую обратную связь на уровне всей задачи, OPD, плотную на уровне токенов, но без учёта правильности траектории и с ограничением по уровню модели-учителя
- OPDVR переформулирует неявную награду OPD с учётом правильности траектории и добавляет ReLU-гейтинг: правильные траектории получают неотрицательную награду, неправильные, неположительную
- Метод не добавляет ни одного нового гиперпараметра и превращает OPD в полноценный RLVR-метод, совместимый с любым алгоритмом policy gradient, включая GRPO
- На шести тестах на рассуждение OPDVR стабильно превосходит стандартный OPD; конкретные названия тестов и числовые показатели прироста в тексте не раскрыты
- Код метода опубликован в открытом доступе на GitHub (LeapLabTHU/OPDVR)
Почему это важно
Дообучение языковых моделей после базового обучения обычно опирается либо на RLVR, либо на дистилляцию по действующей политике, и у каждого подхода своя слабость: у первого редкий сигнал, у второго, потолок в виде качества модели-учителя. Прежние попытки скрестить оба подхода требовали взвешивания или эвристического переключения между ними, что добавляет ручной настройки. OPDVR устраняет этот компромисс за счёт математической переформулировки награды, а не добавления новых настроек.
Кому это важно
Метод адресован тем, кто занимается пост-тренингом больших языковых моделей, прежде всего для задач, где важна способность модели рассуждать пошагово и приходить к проверяемо правильному ответу.
Как это применить
Авторы выложили код на GitHub (LeapLabTHU/OPDVR). По их описанию, метод совместим с любым алгоритмом policy gradient, в тексте отдельно упомянут GRPO, то есть его можно встраивать в уже существующие пайплайны обучения с подкреплением, не меняя их архитектуру целиком.
Можно ли доверять
Материал, это описание метода на странице препринта на Hugging Face, без указания авторских аффилиаций, даты публикации и без таблицы с конкретными числами. Заявленное превосходство над стандартным OPD подтверждено экспериментами на шести тестах, но названия этих тестов и величина прироста в доступном тексте не приведены, качество проверки оценить по одному описанию нельзя.
Риски и подводные камни
В тексте нет ни одного числового показателя прироста, ни названий использованных бенчмарков, ни прямого сравнения с RLVR как таковым или с другими гибридными методами, только общая формулировка о том, что OPDVR «стабильно превосходит» базовый OPD. Насколько велик этот выигрыш и воспроизводится ли он за пределами выбранных шести тестов, по имеющемуся тексту судить нельзя.