SimpleOPD: метод дистилляции переносит рассуждения от SU-01 в компактные модели

Исследователи представили SimpleOPD, метод дистилляции по политике (on-policy distillation, OPD), не зависящий от токенизатора, для переноса способности к рассуждению от модели-учителя с длинным контекстом к моделям-ученикам с коротким контекстом. Прямое применение OPD в этом сценарии упирается в несколько практических проблем: несовпадение токенизаторов учителя и ученика, расхождение их распределений, взрывной рост длины ответов ученика и нестабильность обучения.
Авторы решают проблему токенизаторов, выполняя OPD в общем текстовом пространстве: выравниваются только те токены учителя и ученика, которые занимают идентичные фрагменты текста, так метод не зависит от того, какой именно токенизатор использует каждая из моделей. Чтобы не допустить чрезмерного роста длины генерации и частых обрывов ответа, добавлена KL-регуляризация относительно исходной (референсной) политики ученика, а выигрыш (advantage) специальных токенов завершения, таких как </think> и <|im_end|>, маскируется. Это удерживает ученика от чрезмерного отклонения от начальной политики, смягчает расхождение распределений учителя и ученика и обеспечивает плавный, а не взрывной рост длины ответов.
В качестве учителя выступает модель длинного контекста SU-01, от которой переносится способность к доказательству математических утверждений (proof-reasoning). Метод проверен на моделях-учениках как из того же семейства, так и из других: Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4. Во всех случаях зафиксирован стабильный прирост в математических рассуждениях, особенно в доказательстве утверждений на естественном языке. Отдельно выделена модель Intern-S2-Preview: на бенчмарке ProofBench она улучшилась на 21,2 пункта, достигнув 55,2, это превосходит результат Gemini-2.5-Pro. Прирост также заметен на научных бенчмарках HLE и HiPhO, что, по мнению авторов, говорит о переносе способности к рассуждению за пределы одной лишь математической области.
Ключевые факты
- SimpleOPD, метод дистилляции по политике (OPD) для переноса рассуждений от модели с длинным контекстом (учитель) к моделям с коротким контекстом (ученики)
- Токенизатор-агностичность достигается выравниванием токенов учителя и ученика по совпадающим фрагментам текста, а не по совпадению самих токенов
- KL-регуляризация относительно референсной политики ученика и маскирование специальных токенов остановки (
</think>,<|im_end|>) устраняют взрывной рост длины ответов и нестабильность обучения - Проверено на моделях Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4, во всех случаях стабильный прирост в математических рассуждениях
- Intern-S2-Preview вырос на 21,2 пункта на ProofBench (до 55,2), обогнав Gemini-2.5-Pro; заметны улучшения и на научных бенчмарках HLE и HiPhO
Почему это важно
Дистилляция обычно предполагает, что учитель и ученик работают в схожих условиях. Здесь учитель, модель с длинным контекстом, а ученики, компактные модели с коротким контекстом, что на практике ломает прямой перенос: у моделей разные токенизаторы, разное распределение ответов, а короткий ученик, пытаясь имитировать длинные цепочки рассуждений учителя, генерирует всё более длинные и нестабильные ответы. SimpleOPD решает именно эти практические препятствия, выравниванием по тексту вместо токенов и явным ограничением на отклонение ученика от исходной политики.
Кому это важно
Тем, кто занимается дистилляцией и сжатием моделей рассуждения, переносом способностей мощных, но дорогих и медленных моделей длинного контекста в компактные модели, которые дешевле обучать и запускать. Работа затрагивает разные семейства моделей (Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4), поэтому подход не привязан к одной архитектуре или одному токенизатору.
Как это применить
Ключевые технические приёмы метода переносимы отдельно друг от друга: выравнивание OPD по общему текстовому пространству снимает зависимость от конкретного токенизатора учителя и ученика; KL-регуляризация относительно референсной политики ученика вместе с маскированием токенов остановки (</think>, <|im_end|>) сдерживает разрастание длины ответа и нестабильность обучения. Оба приёма можно использовать порознь в других пайплайнах on-policy дистилляции, где учитель и ученик расходятся по длине контекста или токенизации.
Можно ли доверять
Источник, карточка препринта на Hugging Face с полным текстом аннотации; в самом тексте не указаны ни имена авторов, ни организации, ни дата публикации. Заявленный результат (обгон Gemini-2.5-Pro на ProofBench), это самостоятельно опубликованное авторами сравнение, не подтверждённое независимым тестированием или рецензированием. Числовые результаты приведены только для Intern-S2-Preview на ProofBench; для остальных моделей (Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4) в тексте есть лишь общая формулировка о «стабильном приросте» без конкретных цифр.
Риски и подводные камни
В тексте не раскрыты вычислительные затраты, размер обучающих данных и гиперпараметры, а также не сказано, будут ли открыты код или веса моделей. Сравнение с Gemini-2.5-Pro сделано на одном бенчмарке (ProofBench) и одной модели-ученике (Intern-S2-Preview), обобщать этот результат на остальные протестированные модели пока нельзя, поскольку числа для них не приведены.