Δ-MOPD: ученик перенимает у нескольких учителей сдвиг логитов, а не итоговую политику

Δ-MOPD: ученик перенимает у нескольких учителей сдвиг логитов, а не итоговую политику

Статья посвящена многоучительской дистилляции на собственных траекториях ученика (multi-teacher on-policy distillation, MOPD). Она применяется в двух постановках. В первой, «композиции в общей области», несколько учителей оценивают каждую пробную генерацию ученика по одному запросу из одной предметной области, и их сигналы сводятся в единую цель. Во второй, «маршрутизируемой дистилляции», запросы из разных областей направляют к соответствующим учителям-специалистам.

По словам авторов, в обеих постановках обычно переносят итоговую (endpoint) политику каждого учителя. Она смешивает то, что изменило дообучение, с предпочтениями, унаследованными от базовой модели учителя. Авторы предлагают Δ-MOPD: ученику передают не итоговую политику, а разность логитов учителя и его базовой модели (teacher-minus-base), заново привязанную к замороженной начальной точке ученика. Метод сравнивают с обычным переносом итоговой политики в обеих постановках, причём выбор учителей остаётся фиксированным.

Сначала авторы описывают механизм, мешающий обычному переносу: унаследованное притяжение базовой модели может превышать сдвиг, достигнутый дообучением. Если его убрать, снижаются отношение норм учительского слагаемого и расхождение KL между целью и учеником.

Из результатов, по формулировке авторов, следует, что сдвиговые цели особенно полезны там, где сигналы учителей объединяются в одном состоянии. При трёх объединённых учителях Δ-MOPD превосходит композицию итоговых политик на 4,11 пункта по Math и на 1,95 пункта по пяти бенчмаркам вместе; при двух учителях он лишь сравнивается с ней по точности. При поэтапной маршрутизации метод даёт более высокую среднюю результативность в обоих порядках этапов и сокращает наблюдаемый разрыв между порядками с 10,50 до 6,42 пункта. При чередующейся маршрутизации, где каждое обновление задействует одного учителя, обе цели работают сопоставимо. Результаты поэтапной маршрутизации авторы называют подтверждением того, что выгода может распространяться и на сигналы, накопленные за несколько этапов обучения. Вывод: способ построения цели, самостоятельная ось проектирования MOPD, дополняющая выбор учителей.

Ключевые факты

  • Δ-MOPD передаёт ученику разность логитов учителя и его базовой модели, привязанную к замороженной начальной точке ученика, вместо итоговой политики учителя.
  • Механизм проблемы по версии авторов: унаследованное притяжение базовой модели может превышать сдвиг от дообучения; его устранение снижает отношение норм учительского слагаемого и KL между целью и учеником.
  • При трёх объединённых учителях Δ-MOPD обходит композицию итоговых политик на 4,11 пункта по Math и на 1,95 пункта по пяти бенчмаркам; при двух, только сравнивается с ней.
  • При поэтапной маршрутизации разрыв между порядками этапов сокращается с 10,50 до 6,42 пункта, а средняя результативность выше в обоих порядках.
  • При чередующейся маршрутизации, где в каждом обновлении участвует один учитель, обе цели работают сопоставимо.

Почему это важно

Дистилляция из нескольких специализированных учителей в одного ученика, распространённый способ собрать в одной модели разные навыки. Авторы утверждают, что привычный перенос итоговой политики учителя тянет за собой и то, что учитель унаследовал от своей базовой модели, а не только плоды дообучения. Идея Δ-MOPD в том, чтобы передавать именно сдвиг от дообучения. Авторы подчёркивают, что способ построения цели, независимая ось проектирования, не зависящая от выбора учителей.

Кому это важно

Исследователям и инженерам, которые дообучают одну модель по сигналам нескольких учителей или специалистов: как при объединении оценок нескольких учителей для одного запроса, так и при маршрутизации запросов разных областей к своим специалистам.

Как это применить

Из текста следует практическая рекомендация, но не готовый рецепт: при объединении сигналов нескольких учителей в одном состоянии стоит рассмотреть сдвиговую цель вместо итоговой политики. При чередующейся маршрутизации, где в обновлении участвует один учитель, заметного выигрыша авторы не заявляют. Готовых деталей реализации в тексте нет, поэтому для применения нужно обращаться к полной версии статьи.

Можно ли доверять

Это отчёт самих авторов об эксперименте, статус публикации в тексте не указан. В тексте нет имён авторов и организаций, названий моделей и их размеров, а из бенчмарков назван только Math. Абсолютные баллы не приведены, только разницы в пунктах, и не указано, процентные это пункты или иная единица. Сами авторы формулируют выводы осторожно: результаты «позволяют предположить», а выгода «может распространяться» на накопленные сигналы. Независимых проверок в тексте не упомянуто.

Риски и подводные камни

Преимущество показано не везде: при двух учителях Δ-MOPD лишь равен обычному переносу по точности, а при чередующейся маршрутизации цели сопоставимы. Выигрыш в 4,11 и 1,95 пункта относится к настройке с тремя учителями. Что именно за пять бенчмарков и какие исходные баллы стоят за этими цифрами, из текста не видно, так что масштаб улучшения оценить трудно. Вывод о пользе для накопленных за этапы сигналов авторы называют лишь подтверждающим свидетельством.

«Построение цели, таким образом, самостоятельная ось проектирования в MOPD, дополняющая выбор учителей.»

— Из аннотации статьи