OPD²: новый метод дистилляции улучшил математику Qwen3 на корейском и японском

OPD²: новый метод дистилляции улучшил математику Qwen3 на корейском и японском

Авторы работы изучили метод On-Policy Distillation (OPD), подход к постобучению языковых моделей, который рассматривается как перспективная альтернатива обучению с подкреплением, но чья эффективность в многоязычных сценариях до этой работы почти не исследовалась. На основе OPD они предложили усовершенствованный вариант, On-Policy Delta Distillation (OPD²): вместо стандартного сигнала OPD он использует разницу между вероятностями, которые прогнозируют дообученная модель-учитель и её базовая (ещё не дообученная) версия, и берёт эту разницу как обучающий сигнал для модели-ученика. Метод проверили на семействе моделей Qwen3 в задачах математических рассуждений на трёх языках, английском, корейском и японском. По итогам экспериментов OPD² стабильно превзошёл исходный OPD, причём особенно сильный прирост показал именно на корейском и японском, и в целом сократил разрыв в качестве между английским и корейским языками. Отдельно авторы проверили, что будет, если обучать OPD только на английских данных: точность на корейском и японском тоже выросла, но модель при этом стала чаще отвечать по-английски вместо целевого языка, то есть улучшение качества рассуждений частично достигалось смещением языка ответа. Из этого исследователи делают вывод, что для сохранения ответов на целевом языке при дистилляции необходимы именно многоязычные обучающие данные, а не только английские.

Ключевые факты

  • On-Policy Distillation (OPD), альтернатива обучению с подкреплением для постобучения языковых моделей, но её работа в многоязычных условиях была почти не изучена
  • Авторы предложили вариант OPD², сигнал для дообучения строится на разнице вероятностей между дообученной моделью-учителем и её базовой версией
  • На модели Qwen3 в задачах математики OPD² стабильно обгоняет обычный OPD, особенно на корейском и японском языках, и сокращает разрыв с английским
  • Дистилляция только на английских данных тоже повышает качество на корейском и японском, но модель при этом чаще отвечает по-английски вместо целевого языка
  • Вывод авторов: чтобы сохранить ответы на нужном языке, в обучающих данных нужна многоязычность, а не только английский

Почему это важно

On-Policy Distillation заявлен как перспективная замена обучению с подкреплением при постобучении языковых моделей, но до этой работы почти никто не проверял, как он себя ведёт за пределами английского языка. Авторы закрывают этот пробел и показывают, что улучшенный вариант метода, OPD², даёт заметный прирост качества математических рассуждений именно в тех языках, которые обычно отстают от английского, то есть на корейском и японском.

Кому это важно

Работа адресована исследователям и инженерам, которые занимаются постобучением языковых моделей и хотят повысить их качество не только на английском, но и на других языках, в первую очередь на менее ресурсно обеспеченных, таких как корейский и японский. Полезна она и командам, которые берут англоцентричные модели (в эксперименте, Qwen3) и адаптируют их под многоязычные сценарии использования.

Как это применить

Вместо стандартного сигнала OPD предлагается использовать OPD²: сигналом для обучения модели-ученика служит разница между вероятностями, которые дообученная модель-учитель и её базовая версия присваивают одному и тому же ответу. Важный практический вывод для тех, кто применяет дистилляцию к многоязычным моделям: обучающий набор данных должен включать примеры на целевых языках, а не только на английском, иначе модель может научиться рассуждать точнее, но при этом начнёт отвечать по-английски вместо нужного языка.

Можно ли доверять

Речь идёт о реальной исследовательской работе с экспериментами на широко известном семействе моделей Qwen3, что соответствует обычной практике академических статей о постобучении языковых моделей. Вместе с тем в доступном тексте (аннотации) нет конкретных числовых результатов, процентов прироста точности, названий использованных бенчмарков или конкретного размера/варианта модели Qwen3, поэтому оценить масштаб заявленных улучшений по одному только тексту нельзя.

Риски и подводные камни

Главное ограничение, отсутствие в доступном материале точных цифр, что не позволяет судить, насколько велик реальный прирост качества OPD² над OPD. Сама работа также фиксирует риск для практиков: дистилляция только на английских данных может повышать оценки на других языках за счёт того, что модель незаметно переключается на ответы по-английски, а не за счёт настоящего улучшения рассуждений на целевом языке. Неясно и то, насколько результаты обобщаются за пределы связки английский-корейский-японский и задач математических рассуждений.