U-OPSD: языковые модели дообучаются сами, без учителя и разметки

Метод из статьи называется U-OPSD (unsupervised on-policy self-distillation), несупервизируемая self-дистилляция по текущей политике модели. Дистилляция по текущей политике (on-policy distillation) уже показала себя как сильный способ дообучать большие языковые модели после предобучения, но существующие варианты всё ещё опираются на внешнюю разметку: эталонные ответы, обратную связь от среды или подсказки от более крупной модели-учителя, и потому не являются дистилляцией в чистом виде.
Авторы показывают, что self-дистилляция по текущей политике возможна вообще без внешнего учителя, только на собственных генерациях модели, за счёт их внутренней согласованности. U-OPSD сначала делает несколько прогонов (rollouts) на одну задачу и по большинству голосов, при заданном пороге согласованности между ответами, строит псевдо-решение. Затем модель обуславливает своё распределение ответов на этом псевдо-решении и дистиллирует себя на тех вариантах, которые с ним не согласны, так модель точечно исправляет именно те случаи, где она уверена, но ошибается.
На пяти бенчмарках математических рассуждений, AIME24, AIME25, HMMT25, MATH500 и AMC23, U-OPSD в среднем улучшает базовую модель Qwen3 в режиме без размышлений (non-thinking mode) на 8,5% при масштабе 4B и на 10,7% при масштабе 8B, и по этим же бенчмаркам обгоняет метод OPSD с эталонной разметкой (ground truth) на 3,2% и 2,3% соответственно. В режиме размышлений (thinking mode) U-OPSD держится вровень с OPSD, опережает его на 0,9% при 4B и идёт наравне при 8B, и обгоняет метод GRPO на 0,7% и 1,1% соответственно. Код метода выложен на GitHub.
Ключевые факты
- U-OPSD дообучает модель на её собственных генерациях, без эталонных ответов, обратной связи от среды и модели-учителя.
- Метод строит псевдо-решение большинством голосов среди нескольких прогонов и дистиллирует модель на несогласных с ним ответах.
- На пяти бенчмарках математических рассуждений (AIME24, AIME25, HMMT25, MATH500, AMC23) U-OPSD улучшает базовую модель Qwen3 на 8,5% (4B) и 10,7% (8B) в режиме без размышлений.
- В том же режиме U-OPSD обгоняет метод OPSD с эталонной разметкой на 3,2% и 2,3% на масштабах 4B и 8B соответственно.
- В режиме размышлений U-OPSD держится вровень с OPSD и опережает метод GRPO на 0,7, 1,1%.
Почему это важно
Дообучение больших языковых моделей для задач с рассуждением обычно требует эталонных ответов, разметчиков, проверяющей среды или более сильной модели-учителя, это дорого и не всегда доступно. U-OPSD показывает, что модель может дообучать себя, опираясь только на согласованность собственных ответов: если при нескольких попытках решения задачи большинство ответов модели сходится на одном варианте, этот вариант становится псевдо-эталоном, а модель дообучается на тех своих ответах, которые с ним разошлись, без единого внешнего источника сигнала.
Кому это важно
Исследователям и инженерам, которые дообучают большие языковые модели для задач с рассуждением (математика, логика, код) и упираются в стоимость или доступность размеченных данных и проверяющих сред. Метод особенно полезен там, где эталонного ответа для проверки нет вовсе или его дорого получить.
Как это применить
Авторы выложили код на GitHub (github.com/williamium3000/u-opsd). Метод проверен на моделях Qwen3 (4B и 8B) в двух режимах, с размышлениями и без, и встраивается как обычный шаг дообучения поверх готовой модели: несколько прогонов на задачу, голосование за псевдо-решение по порогу согласованности, дистилляция на несогласных ответах.
Можно ли доверять
Материал, препринт (страница на Hugging Face Papers); авторы и их принадлежность к организациям указаны на странице источника, Yijiang Li и Nuno Vasconcelos (Калифорнийский университет в Сан-Диего), Bingyang Wang (Технологический институт Джорджии), Yijun Liang (Мэрилендский университет), Yunjie Tian и Di Fu (ByteDance), но статус рецензирования и место публикации не указаны. Числа в статье, это только разница в процентах относительно базовой модели и конкурентных методов (OPSD, GRPO); абсолютные значения точности на бенчмарках не приведены, что затрудняет независимую проверку итоговых цифр.
Риски и подводные камни
В статье не раскрыты вычислительные затраты (сколько прогонов нужно на задачу, во что обходится дополнительный инференс), объём обучающих данных, гиперпараметры и конкретное значение порога согласованности для голосования. Результаты показаны только на пяти бенчмарках по математике и на моделях одного семейства (Qwen3 4B/8B), неясно, насколько метод переносится на другие домены и более крупные модели.