AMPLE-Math: эталонные решения почти не усиливают self-distillation Qwen3 и SmolLM3

Исследователи задались вопросом: при обучении методом on-policy self-distillation (OPSD, самодистилляция на собственных ответах модели) модель-учитель, замороженная копия самой модели-ученика, может видеть не только вопрос, но и готовый ответ или разобранное решение. Даёт ли эта «привилегированная информация» ученику что-то сверх того, что даёт сама дистилляция как таковая?
Чтобы отделить одно от другого, авторы построили AMPLE-Math, многоразовый набор из 5 319 математических задач, для каждой из которых существует шесть вариантов решения (reasoning views), приводящих к одному и тому же ответу. Каждый такой вариант сравнили с обычной дистилляцией без доступа к эталону (reference-free distillation) на двух моделях-учениках, Qwen3-1.7B и SmolLM3-3B.
Основной результат: когда учитель с включённым «размышлением» (thinking-enabled) supervised прямые ответы ученика (direct-response rollouts), почти всё улучшение Qwen3-1.7B при оценке с включённым размышлением, и внутри домена задач, и на внешних бенчмарках, объясняется именно дистилляцией без эталона, а не привилегированной информацией самой по себе. Дополнительная польза от привилегированного эталона у Qwen, скромная, и сильнее всего она проявляется для варианта «отшлифованное решение» (polished solution). У SmolLM3-3B картина иная: полные цепочки рассуждений учителя (complete traces) добавляют два процентных пункта на 50-м шаге обучения. Авторы подчёркивают, что этот эффект зависит от того, какая именно модель обучается, единого правила для обеих моделей нет.
Есть и контринтуитивный результат: если на том же чекпойнте заменить короткие прямые ответы ученика на длинные рассуждающие роллауты (thinking-enabled rollouts), при том, что задачи, эталонные решения и способ оценки остаются неизменными, выигрыш превращается в проигрыш у обеих моделей. Отдельно авторы проверили эффект от изменения супервизии на уровне токенов: профили учителя и подобранные вмешательства в функцию потерь (loss interventions) на Qwen показали, что такое изменение может почти не менять поведение модели-ученика.
Общий вывод авторов: OPSD скорее улучшает доступ к уже существующим у модели способностям к рассуждению, через параметры, общие для режима прямого ответа и режима размышления, чем добавляет что-то принципиально новое. Ценность привилегированного эталона, по их формулировке, определяется не тем, сколько решения он раскрывает, а тем, что он добавляет именно к этому переносу между режимами.
Ключевые факты
- Бенчмарк AMPLE-Math: 5 319 математических задач, для каждой, шесть вариантов решения с одним и тем же ответом, чтобы отделить пользу эталонной информации от обычной дистилляции
- На Qwen3-1.7B почти всё улучшение при оценке с включённым размышлением даёт уже дистилляция без эталона; добавка от привилегированной информации скромная, сильнее всего, от «отшлифованного решения»
- На SmolLM3-3B полные цепочки рассуждений учителя добавляют 2 процентных пункта на 50-м шаге обучения, эффект зависит от конкретной модели-ученика
- Замена коротких прямых ответов на длинные рассуждающие роллауты на том же чекпойнте превращает выигрыш в проигрыш у обеих моделей, хотя задачи, эталоны и оценка не менялись
- Изменение супервизии на уровне токенов через профили учителя и вмешательства в функцию потерь на Qwen почти не меняет поведение модели-ученика
Почему это важно
On-policy self-distillation, способ обучать модель на её же собственных ответах, но с учителем, которому доступна дополнительная, «привилегированная» информация: готовый ответ или разобранное решение. Интуитивно кажется, что чем больше учитель знает, тем больше выучит ученик. Это исследование проверяет интуицию напрямую и показывает: у Qwen3-1.7B основной прирост даёт сама дистилляция, а не привилегированная информация как таковая, добавка от неё скромная и зависит от модели.
Кому это важно
Тем, кто строит пайплайны обучения языковых моделей методом self-distillation и решает, стоит ли вкладываться в подготовку эталонных решений или полных цепочек рассуждений учителя вместо обычной дистилляции по прямым ответам.
Как это применить
Из результатов следует, что reference-free дистилляция уже даёт большую часть эффекта, как минимум для модели типа Qwen3-1.7B. Полные цепочки рассуждений учителя дали измеримую добавку (2 процентных пункта) только для SmolLM3-3B на определённом шаге обучения, то есть выигрыш от привилегированной информации не гарантирован и зависит от конкретной модели-ученика и настройки роллаутов.
Можно ли доверять
Источник, препринт с отдельной страницей на Hugging Face Papers, с описанным методом (собственный бенчмарк AMPLE-Math на 5 319 задач, две модели-ученики, контролируемое сравнение вариантов решения). В тексте не указаны авторы и организации, поэтому независимо оценить их репутацию по имеющемуся материалу нельзя.
Риски и подводные камни
Ключевые эффекты, «скромные» и различаются между Qwen3-1.7B и SmolLM3-3B: единственная количественно названная добавка (2 процентных пункта) относится только к одной модели и одному шагу обучения, поэтому обобщать её на другие модели или чекпойнты не стоит. Кроме того, замена длины роллаутов на том же чекпойнте превращает выигрыш в проигрыш, то есть результат чувствителен к деталям настройки обучения, а не только к наличию или отсутствию привилегированной информации.