Исследование дистилляции: направление KL важнее, чем on-policy

Считается, что обучение на собственных генерациях ученика (on-policy) снижает катастрофическое забывание, даёт более разреженные обновления параметров и улучшает обобщение. Авторы статьи отмечают, что существующие сравнения дообучения с учителем (SFT) и обучения с подкреплением меняют сразу много факторов, поэтому вклад политики генерации траекторий (rollout policy) трудно выделить.
Чтобы это исправить, они изучают эффект политики генерации в контролируемой постановке «сильный учитель, слабый ученик». Независимо друг от друга меняются три параметра: политика генерации, направление KL-дивергенции на уровне токенов и скорость обучения (learning rate). Эксперименты идут на семействах моделей Llama3 и Qwen2.5 и на задачах рассуждения из научной, медицинской и арифметической областей.
Главный вывод: политика генерации не обязательно играет центральную роль. Направление KL заметнее влияет на качество решения задач и на охват выходных данных (output coverage), а скорость обучения определяет забывание и разреженность обновлений.
Объяснение дают анализ KL-градиентов и эксперименты на непрерывной шкале политик генерации между учеником и учителем. Прямая KL (forward KL) удивительно устойчива к политике генерации: её результат остаётся стабильным и сильным при любых изменениях. Обратная KL (reverse KL) заметно чувствительнее и предпочитает генерации самого ученика.
Однако on-policy-данные всё же улучшают обобщение на более сложные варианты арифметической задачи Countdown при обоих направлениях KL. Это преимущество, впрочем, не всегда сохраняется после последующего обучения RLVR (обучение с подкреплением с проверяемыми наградами).
Широкие выводы сохраняются, если убрать ограничение градиентов (gradient clipping), использовать выборочные оценки KL (sampled KL estimators) и брать задачи с более длинными цепочками рассуждений. Итог авторов: взгляд, что on-policy-генерации по своей природе предпочтительнее, не подтверждается; их ценность критически зависит от целевой функции, условий оценки и гиперпараметров оптимизации.
Ключевые факты
- Исследование разделяет три фактора дистилляции: политику генерации (on-policy или off-policy), направление KL на уровне токенов и скорость обучения.
- Эксперименты проведены на семействах Llama3 и Qwen2.5 и на задачах рассуждения: научных, медицинских и арифметических.
- Направление KL сильнее влияет на качество и охват выходных данных, а скорость обучения определяет забывание и разреженность обновлений.
- Прямая KL устойчива к смене политики генерации, обратная KL чувствительнее и предпочитает генерации ученика.
- On-policy-данные улучшают обобщение на более сложные варианты Countdown, но выигрыш не всегда сохраняется после RLVR.
Почему это важно
Распространённое представление гласит, что обучение на собственных генерациях ученика предпочтительнее: оно якобы меньше забывает, даёт разреженные обновления и лучше обобщает. Работа проверяет это в контролируемой постановке и показывает, что политика генерации не обязательно играет центральную роль. Заметнее влияют направление KL и скорость обучения.
Кому это важно
Исследователям и инженерам, которые дообучают небольшие модели на ответах более сильных, а также тем, кто выбирает между дообучением с учителем и обучением с подкреплением. Результаты касаются моделей семейств Llama3 и Qwen2.5 и задач рассуждения.
Как это применить
Из аннотации следует ориентир: при выборе схемы дистилляции стоит отдельно подбирать направление KL и скорость обучения, а не опираться только на выбор между on-policy и off-policy. Если используется прямая KL, смена политики генерации мало влияет на результат. При обратной KL лучше работают генерации самого ученика. Скорость обучения связана с забыванием и разреженностью обновлений. Конкретные значения в аннотации не приведены.
Можно ли доверять
Выводы основаны на аннотации статьи с Hugging Face; сама работа не разбиралась. Авторы заявляют, что выводы устойчивы при отключении ограничения градиентов, при выборочных оценках KL и на задачах с более длинными цепочками рассуждений. В аннотации нет численных результатов, размеров моделей и пар «учитель, ученик», так что проверить масштаб эффектов по ней нельзя.
Риски и подводные камни
Авторы сами подчёркивают, что ценность on-policy-генераций зависит от целевой функции, условий оценки и гиперпараметров, поэтому выводы не стоит механически переносить на другие постановки. Выигрыш on-policy-данных на сложных вариантах Countdown не всегда сохраняется после последующего RLVR. Исследование охватывает два семейства моделей и три области задач.
«В целом наши результаты оспаривают мнение, что on-policy-генерации по своей природе предпочтительнее, и показывают, что их ценность критически зависит от целевой функции, условий оценки и гиперпараметров оптимизации.»
— Авторы статьи, аннотация