Новый метод OPSA обошёл дистилляцию OPD на тесте AIME24 без учителя

Авторы разобрали, как на самом деле работает on-policy дистилляция (OPD), способ обучать модель-«ученика» плотными потокенными оценками от модели-«учителя», в отличие от разреженных наград в обучении с подкреплением на проверяемых задачах (RLVR). Проблема в том, что учитель оценивает траектории, сгенерированные учеником, то есть по сути чужие для себя действия, поэтому насколько его оценки вообще надёжны, было неясно. Количественный анализ показал: в оценках учителя во время OPD-обучения много шума, и чем крупнее модель-учитель, тем шума больше. Неожиданно оказалось, что модель-ученик к этому шуму почти нечувствительна, она сходится к сопоставимому качеству независимо от того, оставляют зашумлённые оценки учителя или убирают их. Дальнейший разбор показал, где на самом деле кроется выигрыш OPD: обучение сосредоточено на токенах с низкой логарифмической вероятностью, а если заменить оценки учителя одним и тем же фиксированным отрицательным сигналом, результат получается тем же самым. Вывод авторов: OPD работает в основном за счёт подавления маловероятных токенов, и для этого учитель не нужен в принципе. На основе этого вывода авторы предложили On-Policy Self-Adaptation (OPSA), метод обучения вовсе без учителя, использующий адаптивные к энтропии отрицательные сигналы: более сильный обучающий сигнал ставится в позициях с высокой энтропией, «хвостовые» маловероятные токены подавляются, а вероятностная масса равномерно перераспределяется среди «головных» токенов. На базовой модели Qwen3-1.7B OPSA улучшает метрику Avg@32 на тесте AIME24 на 35,41 балла, это соответствует относительному приросту в 263%, и превосходит по этой же метрике сам OPD на 16,77 балла. По метрике Pass@32 OPSA более чем удваивает показатель сразу на всех трёх бенчмарках, на которых его проверяли (в тексте по имени назван только AIME24). Дополнительные эксперименты на разных семействах моделей и задачах, по утверждению авторов, подтверждают эффективность и обобщаемость метода.
Ключевые факты
- OPD оценивает ученика чужим учителем, и его оценки оказались зашумлёнными, тем сильнее, чем крупнее учитель
- Ученик почти нечувствителен к этому шуму: качество сопоставимо и с зашумлёнными оценками, и без них
- Выигрыш OPD объясняется подавлением токенов с низкой вероятностью, тот же эффект даёт один фиксированный отрицательный сигнал без всякого учителя
- Предложенный метод OPSA обучает модель вовсе без учителя, используя адаптивные к энтропии сигналы
- На Qwen3-1.7B OPSA даёт +35,41 балла Avg@32 на AIME24 (263% относительного прироста) и обгоняет OPD на 16,77 балла; Pass@32 более чем удваивается на всех трёх проверенных тестах
Почему это важно
On-policy дистилляция, популярный способ дообучать модели-рассуждатели дешёвыми потокенными оценками от более сильной модели-учителя, и предполагалось, что именно качество этих оценок определяет прирост. Работа показывает обратное: оценки учителя зашумлены, ученик их шум игнорирует, а реальный источник выигрыша, простое подавление маловероятных токенов, для которого учитель не требуется вовсе. Это меняет представление о том, что именно приносит пользу в таком обучении.
Кому это важно
Команды, которые обучают reasoning-модели через дистилляцию от более крупного учителя, и разработчики RL-пайплайнов для LLM, особенно те, у кого нет ресурсов держать большую модель-учителя во время обучения: результаты статьи указывают, что во многих случаях от неё можно отказаться без потери качества.
Как это применить
Предложенный OPSA, не требует модели-учителя вовсе. Метод использует адаптивные к энтропии отрицательные сигналы: усиливает обучение в позициях с высокой энтропией, подавляет маловероятные «хвостовые» токены и равномерно перераспределяет вероятностную массу среди «головных» токенов. Это прямая замена OPD в пайплайне обучения, без дополнительной модели, только за счёт устройства самого сигнала.
Можно ли доверять
Источник, аннотация препринта на HuggingFace Papers, она детальная и содержит конкретные числа по методике и результатам. Но в самой аннотации не названы авторы и их организации, не указаны абсолютные значения Avg@32/Pass@32 (только разности баллов и один относительный процент), не назван использованный учитель и его масштаб, и из трёх бенчмарков по имени указан только AIME24, это ограничивает независимую проверку до чтения полного текста статьи.
Риски и подводные камни
Все числовые результаты получены на одной базовой модели, Qwen3-1.7B; авторы заявляют об обобщаемости по дополнительным экспериментам, но конкретных цифр для других моделей и семейств в источнике нет, и оценить эффект на них по тексту нельзя. Само устройство отрицательного сигнала в OPSA (адаптация к энтропии) может требовать подбора под конкретную задачу, а без данных об использованном учителе и остальных двух бенчмарках трудно оценить, насколько результат воспроизводим за пределами условий эксперимента.