D³-MOPD: динамическое распределение доменов сократило обучение при дистилляции от нескольких ИИ-учителей почти втрое

В мультиучительской дистилляции с обучением на собственных ответах модели (multi-teacher on-policy distillation, MOPD) единую модель-студента обучают сразу у нескольких доменных экспертов-учителей, минимизируя расхождение (reverse-KL) между ответами студента и учителей по каждому домену отдельно. Проблема существующих подходов в том, что смесь доменов в обучающих данных задаётся заранее и фиксируется на весь прогон, хотя домены сходятся с разной скоростью: одни быстро выходят на плато, другие продолжают улучшаться до конца бюджета обучения. Из-за этого вычисления тратятся впустую на уже сошедшихся доменах, а более медленные остаются недообученными.
Авторы предлагают D³-MOPD (Dynamic Domain ScheDuling for MOPD), планировщик с нулевыми накладными расходами, который использует уже имеющийся в ходе обучения сигнал reverse-KL по каждому домену, чтобы онлайн менять пропорции доменов в выборке. Отдельный наблюдатель работает асинхронно, вне основного процесса обучения: периодически отслеживает траекторию KL по каждому домену, оценивает оставшийся потенциал улучшения и текущую скорость прогресса и на основе этого корректирует пропорции сэмплирования доменов, не меняя сам цикл обучения. Подход естественно масштабируется на произвольное число доменов, и ожидаемый выигрыш растёт вместе с их числом: чем больше доменов, тем разнообразнее паттерны сходимости, которые может использовать планировщик.
В эксперименте студента Qwen3.6-35B-A3B дистиллировали из четырёх доменных учителей-экспертов. D³-MOPD закрыл 97% среднего разрыва в качестве между студентом и учителями против 63% у обычного (без планировщика) MOPD. Того же пикового качества метод достигает примерно при трёхкратном сокращении числа шагов роллаута по сравнению с базовым подходом. На трёх из семи бенчмарков студент, обученный с D³-MOPD, превзошёл специализированных учителей-экспертов.
Ключевые факты
- D³-MOPD, планировщик доменов для мультиучительской дистилляции (MOPD), который меняет пропорции доменов в обучающей выборке онлайн, используя уже существующий сигнал reverse-KL по каждому домену
- Планировщик работает асинхронно, вне основного цикла обучения, и не требует его изменения, заявлены нулевые накладные расходы
- На студенте Qwen3.6-35B-A3B, дистиллированном из четырёх доменных учителей, D³-MOPD закрыл 97% разрыва в качестве между студентом и учителями против 63% у обычного MOPD
- Того же пикового качества D³-MOPD достигает примерно при трёхкратном сокращении числа шагов роллаута по сравнению с базовым подходом
- На трёх из семи бенчмарков студент с D³-MOPD превзошёл специализированных учителей-экспертов
Почему это важно
Дистилляция из нескольких доменных учителей в одну модель, стандартный способ собрать «универсального» студента из набора узких специалистов. Авторы показывают, что фиксированная заранее смесь доменов в обучающих данных, узкое место: домены сходятся с разной скоростью, и статичная пропорция либо тратит вычисления впустую на уже обученных доменах, либо недообучает более медленные. D³-MOPD снимает это ограничение, подстраивая распределение доменов на лету по сигналу, который и так уже считается в ходе обучения, без дополнительных вычислений и без изменения основного цикла обучения.
Кому это важно
Прежде всего командам, которые обучают компактные модели путём дистилляции сразу из нескольких доменных экспертов-учителей, это частый способ ужать набор узких моделей в одну более дешёвую в инференсе. Также релевантно всем, кто занимается on-policy дистилляцией и упирается в бюджет вычислений на обучение: подход напрямую отвечает на вопрос, как распределить этот бюджет между доменами эффективнее.
Как это применить
D³-MOPD описан как асинхронный, работающий вне основного процесса обучения компонент: отдельный наблюдатель периодически считывает reverse-KL по доменам, оценивает оставшийся потенциал улучшения и текущую скорость прогресса и на основе этого меняет пропорции сэмплирования доменов, сам цикл обучения не трогается. Заявлено, что подход масштабируется на произвольное число доменов, и выигрыш растёт по мере роста их числа. В источнике не раскрыты детали реализации наблюдателя за пределами общего описания его логики, а также не названы конкретные домены, учителя и бенчмарки, использованные в эксперименте, это ограничивает точное воспроизведение метода без обращения к полному тексту статьи.
Можно ли доверять
Результаты приведены по одному эксперименту: студент Qwen3.6-35B-A3B, дистиллированный из четырёх доменных учителей, оценённый на семи (не названных в источнике) бенчмарках, с одним базовым методом сравнения, обычным MOPD без планировщика. Источник не сообщает ни бюджет вычислений или время обучения в реальных часах, ни авторов и институты, ни сравнение с другими методами доменного планирования, кроме vanilla MOPD. Заявленные цифры (97% против 63%, троекратное сокращение шагов роллаута, три из семи бенчмарков) взяты дословно из текста и являются заявлениями самих авторов, независимо не перепроверены.
Риски и подводные камни
Все цифры получены на одной конфигурации, одном студенте, одном наборе из четырёх учителей и одном базовом методе сравнения; неясно, насколько результат переносится на другие модели, другое число доменов или другие типы задач. Отсутствие имён доменов, учителей и бенчмарков в тексте не позволяет оценить, насколько репрезентативна тестовая выборка. Метод оценивает «оставшийся потенциал улучшения» по косвенному сигналу (reverse-KL), точность этой оценки и её устойчивость к шуму на других данных источником не раскрыты.