DN-MOPD: исследователи улучшили дистилляцию нескольких учителей на Qwen3.5

DN-MOPD: исследователи улучшили дистилляцию нескольких учителей на Qwen3.5

Обучение с подкреплением позволяет превратить одну языковую модель в нескольких специалистов, каждый из которых силён в одном навыке: математике, программировании или следовании инструкциям. Пользователям же нужна одна модель со всеми этими навыками. Многоучительская дистилляция на собственных ответах ученика (multi-teacher on-policy distillation, MOPD) объединяет специалистов так: ученик отвечает на каждый запрос, а специалист той области, к которой относится запрос, оценивает каждый токен ответа.

Авторы указывают на слабое место такой схемы. Маршрутизация решает, какой специалист учит, но не решает, насколько сильно его обратная связь сдвигает общего ученика. На моделях Qwen3.5 трёх размеров авторы обнаружили, что ученик MOPD не превосходит ученика, которого учил лучший из одиночных специалистов, и перенимает лишь малую часть преимущества математического специалиста.

Причина в несбалансированности обратной связи: обратная связь по следованию инструкциям разбросана в несколько раз сильнее, чем по математике, и доминирует в обновлениях ученика.

Предложенный метод, Domain-Normalized MOPD (DN-MOPD), сохраняет маршрутизацию и масштабирует обратную связь каждой области по её измеренному разбросу. На шести публичных бенчмарках DN-MOPD повышает средний балл относительно MOPD при каждом размере модели, на трёх случайных зёрнах (seed) и при двух ограничениях длины ответа, а также возвращает бóльшую часть утраченного выигрыша по математике.

Контрольные эксперименты с фиксированными весами областей показывают: выигрыш в основном даёт ослабление обратной связи по следованию инструкциям, а не одно лишь усиление математики. Фиксированные веса, близкие к тем, что вычисляет DN-MOPD, работают сопоставимо. Вывод авторов: при объединении специалистов важно решать не только, кто учит, но и насколько весома его обратная связь.

Ключевые факты

  • MOPD объединяет специалистов (математика, код, следование инструкциям) в одну модель: специалист области запроса оценивает каждый токен ответа ученика.
  • На Qwen3.5 трёх размеров ученик MOPD не превосходит ученика от лучшего одиночного специалиста и мало перенимает сильную сторону математического специалиста.
  • Обратная связь по следованию инструкциям разбросана в несколько раз сильнее, чем по математике, и доминирует в обновлениях ученика.
  • DN-MOPD сохраняет маршрутизацию и масштабирует обратную связь каждой области по измеренному разбросу; средний балл на шести публичных бенчмарках выше, чем у MOPD, при каждом размере, на трёх зёрнах и при двух ограничениях длины ответа.
  • Выигрыш в основном от ослабления обратной связи по инструкциям; фиксированные веса, близкие к вычисленным, работают сопоставимо.

Почему это важно

Сборка одной универсальной модели из нескольких специалистов, практическая задача, а MOPD служит одним из способов её решения. Работа показывает, что в этой схеме важна не только маршрутизация запросов, но и относительная сила обратной связи разных областей: без балансировки одна область (следование инструкциям) может доминировать в обновлениях и мешать усвоению других навыков, например математики.

Кому это важно

Исследователям и командам, которые обучают модели через дистилляцию с несколькими учителями или сливают в одну модель специалистов, обученных обучением с подкреплением.

Как это применить

Идея метода: оставить маршрутизацию по областям, но масштабировать обратную связь каждой области по её измеренному разбросу. Авторы также отмечают, что фиксированные веса, близкие к вычисленным DN-MOPD, работают сопоставимо, то есть веса можно задавать и заранее. Сведений о выпуске кода или моделей в тексте нет.

Можно ли доверять

Все утверждения, самоотчёт авторов по аннотации работы. Числовые значения баллов и размер улучшения над MOPD не приведены, размеры моделей и шесть бенчмарков не названы, измеряемая мера разброса не уточнена; независимой проверки в тексте нет. Устойчивость результата авторы подтверждают тремя случайными зёрнами и двумя ограничениями длины ответа.

Риски и подводные камни

Величина выигрыша неизвестна: сказано лишь, что средний балл выше и что возвращена бóльшая часть утраченного выигрыша по математике. Результаты получены на моделях Qwen3.5 трёх размеров; о других семействах моделей в тексте ничего не говорится. Сопоставимость фиксированных весов с вычисляемыми означает, что ценность именно адаптивного измерения разброса в тексте не выделена отдельно.

«Поэтому при объединении специалистов нужно решать не только, кто из них учит, но и насколько весома его обратная связь.»

— Из аннотации работы