Δ-MOPD: ученик перенимает у нескольких учителей сдвиг логитов, а не итоговую политику

Статья посвящена многоучительской дистилляции на собственных траекториях ученика (multi-teacher on-policy distillation, MOPD). Она применяется в двух постановках. В первой, «композиции в общей области», несколько учителей оценивают каждую пробную генерацию ученика по одному запросу из одной предметной области, и их сигналы сводятся в единую цель. Во второй, «маршрутизируемой дистилляции», запросы из разных областей направляют к соответствующим учителям-специалистам.
По словам авторов, в обеих постановках обычно переносят итоговую (endpoint) политику каждого учителя. Она смешивает то, что изменило дообучение, с предпочтениями, унаследованными от базовой модели учителя. Авторы предлагают Δ-MOPD: ученику передают не итоговую политику, а разность логитов учителя и его базовой модели (teacher-minus-base), заново привязанную к замороженной начальной точке ученика. Метод сравнивают с обычным переносом итоговой политики в обеих постановках, причём выбор учителей остаётся фиксированным.
Сначала авторы описывают механизм, мешающий обычному переносу: унаследованное притяжение базовой модели может превышать сдвиг, достигнутый дообучением. Если его убрать, снижаются отношение норм учительского слагаемого и расхождение KL между целью и учеником.
Из результатов, по формулировке авторов, следует, что сдвиговые цели особенно полезны там, где сигналы учителей объединяются в одном состоянии. При трёх объединённых учителях Δ-MOPD превосходит композицию итоговых политик на 4,11 пункта по Math и на 1,95 пункта по пяти бенчмаркам вместе; при двух учителях он лишь сравнивается с ней по точности. При поэтапной маршрутизации метод даёт более высокую среднюю результативность в обоих порядках этапов и сокращает наблюдаемый разрыв между порядками с 10,50 до 6,42 пункта. При чередующейся маршрутизации, где каждое обновление задействует одного учителя, обе цели работают сопоставимо. Результаты поэтапной маршрутизации авторы называют подтверждением того, что выгода может распространяться и на сигналы, накопленные за несколько этапов обучения. Вывод: способ построения цели, самостоятельная ось проектирования MOPD, дополняющая выбор учителей.
Ключевые факты
- Δ-MOPD передаёт ученику разность логитов учителя и его базовой модели, привязанную к замороженной начальной точке ученика, вместо итоговой политики учителя.
- Механизм проблемы по версии авторов: унаследованное притяжение базовой модели может превышать сдвиг от дообучения; его устранение снижает отношение норм учительского слагаемого и KL между целью и учеником.
- При трёх объединённых учителях Δ-MOPD обходит композицию итоговых политик на 4,11 пункта по Math и на 1,95 пункта по пяти бенчмаркам; при двух, только сравнивается с ней.
- При поэтапной маршрутизации разрыв между порядками этапов сокращается с 10,50 до 6,42 пункта, а средняя результативность выше в обоих порядках.
- При чередующейся маршрутизации, где в каждом обновлении участвует один учитель, обе цели работают сопоставимо.
Почему это важно
Дистилляция из нескольких специализированных учителей в одного ученика, распространённый способ собрать в одной модели разные навыки. Авторы утверждают, что привычный перенос итоговой политики учителя тянет за собой и то, что учитель унаследовал от своей базовой модели, а не только плоды дообучения. Идея Δ-MOPD в том, чтобы передавать именно сдвиг от дообучения. Авторы подчёркивают, что способ построения цели, независимая ось проектирования, не зависящая от выбора учителей.
Кому это важно
Исследователям и инженерам, которые дообучают одну модель по сигналам нескольких учителей или специалистов: как при объединении оценок нескольких учителей для одного запроса, так и при маршрутизации запросов разных областей к своим специалистам.
Как это применить
Из текста следует практическая рекомендация, но не готовый рецепт: при объединении сигналов нескольких учителей в одном состоянии стоит рассмотреть сдвиговую цель вместо итоговой политики. При чередующейся маршрутизации, где в обновлении участвует один учитель, заметного выигрыша авторы не заявляют. Готовых деталей реализации в тексте нет, поэтому для применения нужно обращаться к полной версии статьи.
Можно ли доверять
Это отчёт самих авторов об эксперименте, статус публикации в тексте не указан. В тексте нет имён авторов и организаций, названий моделей и их размеров, а из бенчмарков назван только Math. Абсолютные баллы не приведены, только разницы в пунктах, и не указано, процентные это пункты или иная единица. Сами авторы формулируют выводы осторожно: результаты «позволяют предположить», а выгода «может распространяться» на накопленные сигналы. Независимых проверок в тексте не упомянуто.
Риски и подводные камни
Преимущество показано не везде: при двух учителях Δ-MOPD лишь равен обычному переносу по точности, а при чередующейся маршрутизации цели сопоставимы. Выигрыш в 4,11 и 1,95 пункта относится к настройке с тремя учителями. Что именно за пять бенчмарков и какие исходные баллы стоят за этими цифрами, из текста не видно, так что масштаб улучшения оценить трудно. Вывод о пользе для накопленных за этапы сигналов авторы называют лишь подтверждающим свидетельством.
«Построение цели, таким образом, самостоятельная ось проектирования в MOPD, дополняющая выбор учителей.»
— Из аннотации статьи