Предложен PMOPD: дистилляция из нескольких учителей против «качелей» навыков

Предложен PMOPD: дистилляция из нескольких учителей против «качелей» навыков

Multi-teacher on-policy distillation (MOPD, дистилляция из нескольких учителей по собственным траекториям) авторы статьи называют популярной парадигмой пост-обучения, с помощью которой в передовые языковые модели вносят специализированные навыки. Прежние работы по on-policy distillation (OPD), как пишут авторы, в основном оптимизировали дистилляцию для одной задачи: через устройство целевой функции, охват дистилляции и построение сигнала от учителя. В MOPD же несколько навыков приходится собирать в общих параметрах и справляться с «качелями навыков» (capability seesaw): улучшение в одной области подавляет навыки, полученные в другой.

Авторы обнаружили, что в ходе MOPD обновления параметров для разных задач быстро концентрируются в своих низкоразмерных подпространствах. По их словам, это даёт прямую геометрическую основу, чтобы находить и контролировать межзадачные помехи.

На этом наблюдении построен метод PMOPD (Projection-based Multi-Teacher On-Policy Distillation). Он формирует «память подпространств» из накопленных смещений параметров по каждой задаче и проецирует и градиенты, и обновления оптимизатора, убирая компоненты, которые мешают защищаемым направлениям других задач. Дополнительно авторы разработали лёгкий «зонд конфликтов» (conflict probe), который описывает взаимодействие задач и подсказывает порядок их прохождения, а также стратегию циклического возврата, балансирующую оценку подпространств и своевременное возвращение к задачам.

Эксперименты проведены на репрезентативных задачах Code, Reason и Math. По данным авторов, PMOPD улучшает каждый из оцениваемых навыков по сравнению с MOPD, а средний балл по трём задачам вырос на 2,54 пункта на Qwen2.5-7B и на 2,09 пункта на Llama-3.1-8B (абсолютные пункты оценки, не проценты). Авторы заключают, что эти стабильные улучшения подтверждают: оптимизация с учётом геометрии, эффективный и переносимый подход к сбалансированной дистилляции из нескольких учителей.

Ключевые факты

  • Проблема MOPD: при сборке нескольких навыков в общих параметрах улучшение одной области подавляет навыки другой («качели навыков»).
  • Наблюдение авторов: обновления параметров для разных задач быстро концентрируются в своих низкоразмерных подпространствах.
  • PMOPD строит память подпространств из накопленных смещений параметров и проецирует градиенты и обновления оптимизатора, убирая помехи защищаемым задачам.
  • Дополнительно предложены лёгкий зонд конфликтов для выбора порядка задач и стратегия циклического возврата к задачам.
  • Средний балл по Code, Reason и Math выше, чем у MOPD, на 2,54 пункта (Qwen2.5-7B) и на 2,09 пункта (Llama-3.1-8B); улучшены все оцениваемые навыки.

Почему это важно

Сборка нескольких специализированных навыков в одну модель, по словам авторов, популярный путь пост-обучения передовых моделей. Главная трудность, «качели»: прирост в коде или математике может стоить потери в другой области. Работа предлагает геометрический взгляд на эту проблему: если обновления разных задач лежат в низкоразмерных подпространствах, помехи можно находить и гасить проекцией.

Кому это важно

Прежде всего исследователям и инженерам, которые занимаются пост-обучением и дистилляцией языковых моделей из нескольких специализированных учителей. Для остальных читателей это, скорее, сигнал о направлении: внимание смещается от настройки дистилляции одной задачи к управлению конфликтами между задачами.

Как это применить

В аннотации описана идея: копить смещения параметров по задачам, строить из них подпространства и проецировать градиенты и обновления оптимизатора, а порядок задач выбирать с помощью зонда конфликтов и возвращаться к ним циклически. Внедрять это в собственный конвейер стоит после прочтения полного текста статьи: детали реализации и настройки в аннотации не приведены.

Можно ли доверять

Все результаты, заявления самих авторов в аннотации статьи на Hugging Face. Названы лишь две модели (Qwen2.5-7B и Llama-3.1-8B) и средние приросты по трём задачам. Названий бенчмарков, абсолютных баллов базовых методов, числа запусков и статистической значимости в аннотации нет, поэтому масштаб эффекта оценить трудно.

Риски и подводные камни

Прирост в 2,54 и 2,09 пункта среднего балла, умеренный, и проверен на моделях масштаба 7, 8 млрд параметров; про более крупные модели в аннотации ничего не сказано. Стоимость метода (вычисления, время обучения, память) не указана. Вывод авторов о «переносимости» подхода основан на двух моделях, так что его стоит проверять на своих данных.

«Эти стабильные улучшения подтверждают, что оптимизация с учётом геометрии, эффективный и переносимый подход к сбалансированной дистилляции из нескольких учителей.»

— Из аннотации статьи PMOPD