D³-MOPD: динамическое распределение доменов сократило обучение при дистилляции от нескольких ИИ-учителей почти втрое

D³-MOPD: динамическое распределение доменов сократило обучение при дистилляции от нескольких ИИ-учителей почти втрое

В мультиучительской дистилляции с обучением на собственных ответах модели (multi-teacher on-policy distillation, MOPD) единую модель-студента обучают сразу у нескольких доменных экспертов-учителей, минимизируя расхождение (reverse-KL) между ответами студента и учителей по каждому домену отдельно. Проблема существующих подходов в том, что смесь доменов в обучающих данных задаётся заранее и фиксируется на весь прогон, хотя домены сходятся с разной скоростью: одни быстро выходят на плато, другие продолжают улучшаться до конца бюджета обучения. Из-за этого вычисления тратятся впустую на уже сошедшихся доменах, а более медленные остаются недообученными.

Авторы предлагают D³-MOPD (Dynamic Domain ScheDuling for MOPD), планировщик с нулевыми накладными расходами, который использует уже имеющийся в ходе обучения сигнал reverse-KL по каждому домену, чтобы онлайн менять пропорции доменов в выборке. Отдельный наблюдатель работает асинхронно, вне основного процесса обучения: периодически отслеживает траекторию KL по каждому домену, оценивает оставшийся потенциал улучшения и текущую скорость прогресса и на основе этого корректирует пропорции сэмплирования доменов, не меняя сам цикл обучения. Подход естественно масштабируется на произвольное число доменов, и ожидаемый выигрыш растёт вместе с их числом: чем больше доменов, тем разнообразнее паттерны сходимости, которые может использовать планировщик.

В эксперименте студента Qwen3.6-35B-A3B дистиллировали из четырёх доменных учителей-экспертов. D³-MOPD закрыл 97% среднего разрыва в качестве между студентом и учителями против 63% у обычного (без планировщика) MOPD. Того же пикового качества метод достигает примерно при трёхкратном сокращении числа шагов роллаута по сравнению с базовым подходом. На трёх из семи бенчмарков студент, обученный с D³-MOPD, превзошёл специализированных учителей-экспертов.

Ключевые факты

  • D³-MOPD, планировщик доменов для мультиучительской дистилляции (MOPD), который меняет пропорции доменов в обучающей выборке онлайн, используя уже существующий сигнал reverse-KL по каждому домену
  • Планировщик работает асинхронно, вне основного цикла обучения, и не требует его изменения, заявлены нулевые накладные расходы
  • На студенте Qwen3.6-35B-A3B, дистиллированном из четырёх доменных учителей, D³-MOPD закрыл 97% разрыва в качестве между студентом и учителями против 63% у обычного MOPD
  • Того же пикового качества D³-MOPD достигает примерно при трёхкратном сокращении числа шагов роллаута по сравнению с базовым подходом
  • На трёх из семи бенчмарков студент с D³-MOPD превзошёл специализированных учителей-экспертов

Почему это важно

Дистилляция из нескольких доменных учителей в одну модель, стандартный способ собрать «универсального» студента из набора узких специалистов. Авторы показывают, что фиксированная заранее смесь доменов в обучающих данных, узкое место: домены сходятся с разной скоростью, и статичная пропорция либо тратит вычисления впустую на уже обученных доменах, либо недообучает более медленные. D³-MOPD снимает это ограничение, подстраивая распределение доменов на лету по сигналу, который и так уже считается в ходе обучения, без дополнительных вычислений и без изменения основного цикла обучения.

Кому это важно

Прежде всего командам, которые обучают компактные модели путём дистилляции сразу из нескольких доменных экспертов-учителей, это частый способ ужать набор узких моделей в одну более дешёвую в инференсе. Также релевантно всем, кто занимается on-policy дистилляцией и упирается в бюджет вычислений на обучение: подход напрямую отвечает на вопрос, как распределить этот бюджет между доменами эффективнее.

Как это применить

D³-MOPD описан как асинхронный, работающий вне основного процесса обучения компонент: отдельный наблюдатель периодически считывает reverse-KL по доменам, оценивает оставшийся потенциал улучшения и текущую скорость прогресса и на основе этого меняет пропорции сэмплирования доменов, сам цикл обучения не трогается. Заявлено, что подход масштабируется на произвольное число доменов, и выигрыш растёт по мере роста их числа. В источнике не раскрыты детали реализации наблюдателя за пределами общего описания его логики, а также не названы конкретные домены, учителя и бенчмарки, использованные в эксперименте, это ограничивает точное воспроизведение метода без обращения к полному тексту статьи.

Можно ли доверять

Результаты приведены по одному эксперименту: студент Qwen3.6-35B-A3B, дистиллированный из четырёх доменных учителей, оценённый на семи (не названных в источнике) бенчмарках, с одним базовым методом сравнения, обычным MOPD без планировщика. Источник не сообщает ни бюджет вычислений или время обучения в реальных часах, ни авторов и институты, ни сравнение с другими методами доменного планирования, кроме vanilla MOPD. Заявленные цифры (97% против 63%, троекратное сокращение шагов роллаута, три из семи бенчмарков) взяты дословно из текста и являются заявлениями самих авторов, независимо не перепроверены.

Риски и подводные камни

Все цифры получены на одной конфигурации, одном студенте, одном наборе из четырёх учителей и одном базовом методе сравнения; неясно, насколько результат переносится на другие модели, другое число доменов или другие типы задач. Отсутствие имён доменов, учителей и бенчмарков в тексте не позволяет оценить, насколько репрезентативна тестовая выборка. Метод оценивает «оставшийся потенциал улучшения» по косвенному сигналу (reverse-KL), точность этой оценки и её устойчивость к шуму на других данных источником не раскрыты.