DistillAlign: метод дистилляции видеомоделей обошёл конкурентов с учителем почти в 11 раз меньше

Группа исследователей во главе с Цзясин Ли (Jiaxing Li) опубликовала на Hugging Face работу DistillAlign, посвящённую ускоренной (авторегрессионной) дистилляции видеомоделей. Речь о типовой схеме сжатия больших видеогенераторов в быстрые: сначала студенческую модель инициализируют, затем дообучают методом дистилляции по соответствию распределений (Distribution Matching Distillation, DMD), переносом поведения модели-учителя на модель меньшего размера. Авторы отмечают, что в существующих пайплайнах эти два этапа обычно разводят и качество промежуточной студенческой модели оценивают только визуальными метриками вроде VBench.
Авторы показывают: у функции потерь DMD есть свойство «погони за модой» (mode seeking), она стремится не охватить всё разнообразие распределения учителя, а сфокусироваться на его самых вероятных, «пиковых» областях. Из этого следует, что хорошая инициализация студенческой модели должна с самого начала совпадать по охвату мод (mode coverage) с распределением учителя-DMD, а не просто выдавать визуально качественные картинки. Чтобы это проверить, авторы ввели отдельный протокол оценки, который в общем скрытом пространстве измеряет точность и охват (precision and coverage) между распределениями студента и учителя. Протокол выявил случаи, скрытые визуальными метриками: некоторые варианты инициализации дают высокую точность, но низкий охват и в итоге хуже дообучаются, тогда как варианты с широким охватом мод сохраняют более разнообразное распределение.
Более того, даже когда распределения студента и учителя изначально согласованы, сама целевая функция DMD, обратная KL-дивергенция (reverse-KL), на поздних этапах обучения продолжает «стягивать» студенческую модель к самым вероятным областям учителя, снижая охват и разнообразие генерации. Для решения авторы предложили совместную дистилляцию (joint distillation): она объединяет исходную «охотящуюся за модой» цель DMD с ограничением на основе дистилляции согласованности (Consistency Distillation), которое, наоборот, заставляет модель охватывать моды шире. По данным экспериментов, метод повышает качество генерации, охват и разнообразие результатов; отдельно отмечается, что версия с меньшей моделью-учителем Wan-1.3B обошла базовые методы, дообученные с существенно более крупной моделью-учителем Wan-14B (почти в 11 раз больше по числу параметров), авторы называют это подтверждением важности согласования распределений в дистилляции видеомоделей.
Ключевые факты
- DistillAlign решает проблему типовых пайплайнов дистилляции видеомоделей: этап инициализации и этап DMD-дообучения оценивают только визуальными метриками (VBench), не проверяя охват распределения.
- Авторы ввели протокол оценки, измеряющий точность и охват (precision and coverage) между распределениями студенческой модели и модели-учителя в общем скрытом пространстве.
- Целевая функция DMD (обратная KL-дивергенция) сама по себе стремится к «погоне за модой» и на поздних этапах обучения снижает разнообразие генерации, даже если распределения изначально согласованы.
- Предложенная совместная дистилляция сочетает цель DMD с ограничением на основе дистилляции согласованности (Consistency Distillation), которое расширяет охват мод.
- В экспериментах версия метода с моделью-учителем Wan-1.3B обошла базовые подходы, дообученные с моделью-учителем Wan-14B (почти в 11 раз крупнее).
Почему это важно
Дистилляция, стандартный способ получить быструю видеомодель из тяжёлой: она позволяет генерировать видео за меньшее число шагов почти без потери качества. Но авторы показывают, что привычная практика, судить о промежуточной студенческой модели только по визуальным баллам вроде VBench, скрывает важный дефект: модель может выглядеть качественно, но фактически охватывать лишь узкую часть распределения учителя, теряя разнообразие результатов. Это меняет то, как стоит проектировать и оценивать пайплайны дистилляции видеогенераторов.
Кому это важно
Команды, которые разрабатывают и оптимизируют видеогенеративные модели (в том числе на основе моделей семейства Wan), а также исследователи, работающие с дистилляцией диффузионных и авторегрессионных генеративных моделей в целом, предложенный протокол оценки и метод применимы шире одного конкретного случая.
Как это применить
Ключевая практическая идея, не оценивать промежуточную модель только визуальными метриками, а дополнительно измерять точность и охват (precision and coverage) распределения в общем скрытом пространстве со связанным учителем ещё на этапе инициализации. Дальше вместо чистого DMD-дообучения предлагается совместная дистилляция: целевая функция DMD (быстро сходящаяся, но «охотящаяся за модой») комбинируется с ограничением на основе дистилляции согласованности, которое удерживает более широкий охват распределения на поздних этапах обучения.
Можно ли доверять
Материал опубликован как препринт на Hugging Face Papers; независимая проверка результатов сторонними исследователями пока не отражена в источнике. Заявленные результаты (в том числе превосходство над базовыми методами с более крупным учителем Wan-14B) приводятся авторами по собственным экспериментам, как это принято для препринтов, до рецензирования и воспроизведения третьими сторонами их стоит воспринимать как предварительные, хоть и подробно обоснованные протоколом оценки.
Риски и подводные камни
Метод балансирует две конкурирующие цели обучения (погоню за модой и охват мод), а такая балансировка обычно требует аккуратного подбора весов и может вести себя нестабильно на других архитектурах или доменах данных. Результаты пока проверены авторами на собственном наборе экспериментов с конкретными моделями семейства Wan, не факт, что выигрыш в охвате и качестве так же воспроизведётся на других видеомоделях или задачах.