RISE: метод рекурсивной самодистилляции ускоряет пост-обучение LLM без внешнего учителя

RISE: метод рекурсивной самодистилляции ускоряет пост-обучение LLM без внешнего учителя

Дистилляция по стратегии (on-policy distillation, OPD) даёт языковой модели плотную, потокенную обратную связь при пост-обучении, но упирается в качество «учителя»: внешние модели-учителя расходятся по распределению ответов с обучаемой моделью, а самодистилляция с привилегированным контекстом ограничена тем, сколько модель способна извлечь из подсказки в контексте (in-context learning).

Авторы предлагают RISE (Recursive Improvement via Self-Extrapolating Policy Distillation, рекурсивное улучшение через самоэкстраполирующую дистилляцию политики). Метод строит синтетического «учителя» прямо из собственной траектории обучения модели методом RLVR (reinforcement learning with verifiable rewards, обучение с подкреплением по проверяемым наградам). Для этого берётся смещение между текущим чекпоинтом модели и более ранним «опорным» чекпоинтом, в пространстве параметров или в пространстве выходных логитов, и это смещение экстраполируется вперёд. Так разреженное, основанное на итоговом результате обновление параметров превращается в плотную, потокенную цель для дистилляции, без привлечения внешней модели и без привилегированного контекста.

RISE объединяет RLVR и OPD в дополняющем друг друга цикле: награды за итоговый результат направляют экстраполяцию к правильным рассуждениям, а экстраполированный «учитель» уточняет решения на уровне отдельных токенов. Поскольку «учитель» пересчитывается заново на каждой итерации вслед за тем, как улучшается сама модель («ученик»), дистилляция становится не разовым сжатием знаний, а рекурсивным механизмом улучшения.

В экспериментах, охвативших математические рассуждения, разные области STEM, генерацию кода и многошаговые агентные задачи, RISE превзошёл и обучение только методом RLVR, и обычную самодистилляцию по стратегии, во всех рассмотренных постановках.

Ключевые факты

  • RISE строит «синтетического учителя» из собственной траектории обучения модели по RLVR, без внешней модели-учителя и без привилегированного контекста.
  • Экстраполяция смещения между текущим и предыдущим чекпоинтом (в пространстве параметров или логитов) превращает разреженное обновление после RLVR в плотный, потокенный сигнал для дистилляции.
  • RLVR и дистилляция по стратегии работают в едином цикле: награды направляют экстраполяцию, а «учитель» уточняет решения на уровне токенов.
  • «Учитель» обновляется на каждой итерации вместе с моделью, дистилляция становится рекурсивной, а не разовой процедурой.
  • В экспериментах по математике, STEM, генерации кода и агентным задачам RISE превзошёл и обучение только на RLVR, и обычную самодистилляцию по стратегии.

Почему это важно

Пост-обучение языковых моделей методом обучения с подкреплением по проверяемым наградам (RLVR) даёт модели редкий, разреженный сигнал, награду за итоговый результат целой генерации, а не за каждый токен. Дистилляция по стратегии (on-policy distillation, OPD) решает эту проблему плотной, потокенной обратной связью, но упирается в качество «учителя»: внешняя модель расходится по распределению ответов с обучаемой, а самодистилляция с привилегированным контекстом ограничена тем, что модель способна извлечь из подсказки в контексте. RISE предлагает третий путь, строить учителя не извне и не из привилегированной подсказки, а из собственной истории обучения модели, экстраполируя направление, в котором она движется между чекпоинтами. Так разреженный, но надёжный сигнал RLVR превращается в плотный, потокенный сигнал для дистилляции.

Кому это важно

Материал адресован исследователям и инженерам, занимающимся пост-обучением языковых моделей, прежде всего обучением с подкреплением по проверяемым наградам для задач с чёткими критериями правильности: математики, программирования, STEM-дисциплин и многошаговых агентных сценариев. Метод избавляет от необходимости держать отдельную модель-учителя большего размера или тщательно подбирать привилегированный контекст для самодистилляции, что снижает вычислительные и инженерные затраты на пайплайн пост-обучения.

Как это применить

RISE встраивается в существующий цикл RLVR-обучения: на каждой итерации берётся смещение между текущим чекпоинтом модели и более ранним «опорным» чекпоинтом (в пространстве параметров или в пространстве выходных логитов), это смещение экстраполируется вперёд, а результат используется как синтетический учитель для потокенной дистилляции очередного шага. Поскольку учитель пересчитывается заново на каждой итерации вслед за моделью, метод не требует хранения или обслуживания отдельной внешней модели-учителя, используется только сама обучаемая модель и история её чекпоинтов.

Можно ли доверять

Публикация описывает архитектуру и обоснование метода и приводит результаты экспериментов на нескольких типах задач, математических рассуждениях, разных областях STEM, генерации кода и многошаговых агентных задачах, где RISE превзошёл и обучение только на RLVR, и обычную самодистилляцию по стратегии. В доступном тексте аннотации нет конкретных числовых показателей, названий бенчмарков, размеров моделей и данных об аффилиации авторов, так что независимо оценить масштаб улучшений по одной аннотации нельзя, для этого нужен полный текст статьи.

Риски и подводные камни

Экстраполяция смещения между чекпоинтами, эвристический приём: он предполагает, что направление изменений модели между итерациями остаётся достаточно стабильным, а это может не выполняться на длинных горизонтах обучения или при резких сдвигах в данных. Рекурсивный цикл, где модель дистиллируется из собственной прошлой траектории, несёт и риск накопления и усиления систематических ошибок, если сигнал RLVR на каком-то этапе окажется смещённым.