Учёные нашли скрытый сбой CFG при дистилляции диффузионных моделей и предложили метод PDM

Исследователи разбирают, как метод on-policy дистилляции (OPD), когда компактная студенческая диффузионная модель обучается, «спрашивая» модель-учителя вдоль траекторий, которые она сама же генерирует, взаимодействует с classifier-free guidance (CFG, guidance без классификатора). CFG, стандартный компонент почти всех современных диффузионных генераторов изображений и видео: итоговое предсказание модели складывается из «позитивной» ветки (предсказание с учётом условия, например текстового промпта) и «негативной» ветки (предсказание без условия или с отрицательным условием), а их разница задаёт направление guidance.
Существующие методы OPD расширяют обычное сопоставление скоростей (velocity matching) на уже собранное CFG-предсказание целиком: студент просто подгоняет свой итоговый управляемый вывод под итоговый управляемый вывод учителя. Авторы показывают, что такая цель недоопределена на уровне отдельных веток: ошибки позитивной и негативной ветки могут компенсировать друг друга в итоговом (сложенном) предсказании, так что совпадение общих выводов ещё не значит, что обе ветки по отдельности предсказаны верно.
Авторы разбирают два противоположных случая. Когда негативное условие у учителя и студента общее (shared negative conditioning), ошибки обеих веток снижаются совместно, наивное сопоставление работает нормально. Но когда «родная» схема CFG модели хранит в негативной ветке учителя привилегированную информацию, недоступную студенту, совместное снижение ошибок ломается: возникает антагонистическая динамика, при которой ошибка позитивной ветки падает, а ошибка негативной ветки, наоборот, растёт. Этот режим сбоя авторы называют Negative Branch Asymmetry (асимметрия негативной ветки, NBA).
Чтобы устранить NBA, предложен метод Positive-Direction Matching (PDM), branch-aware (учитывающая ветки по отдельности) цель обучения OPD, которая раздельно ограничивает позитивное предсказание и направление CFG-guidance (разницу между ветками), вместо того чтобы сопоставлять итоговый сложенный вектор как единое целое. Метод протестирован на задаче dense-to-sparse видеоконтроля (перевод плотного управляющего сигнала в разреженный): наивное сопоставление управляемых предсказаний оказалось крайне чувствительно к масштабу guidance на этапе вывода (inference guidance scale), тогда как branch-aware-обучение по методу PDM дало более устойчивый и результативный перенос знаний от учителя к студенту.
Ключевые факты
- On-policy дистилляция (OPD) диффузионных моделей до сих пор наивно сопоставляла итоговые CFG-предсказания учителя и студента целиком, не разбирая их на позитивную и негативную ветки.
- Такая цель недоопределена: ошибки в позитивной и негативной ветке могут взаимно компенсироваться в общем предсказании, скрывая проблему.
- Когда негативная ветка учителя хранит информацию, недоступную студенту, возникает асимметричный сбой: ошибка позитивной ветки падает, а негативной, растёт (авторы называют это Negative Branch Asymmetry).
- Предложенный метод Positive-Direction Matching (PDM) раздельно обучает позитивное предсказание и направление guidance, а не итоговый сложенный вектор.
- На задаче dense-to-sparse видеоконтроля PDM показал устойчивость к изменению масштаба guidance на этапе вывода, в отличие от наивного метода, который к этому масштабу очень чувствителен.
Почему это важно
Classifier-free guidance, базовый механизм почти всех современных диффузионных генераторов изображений и видео, а on-policy дистилляция, один из ключевых способов сделать такие модели быстрее, обучив компактного студента на траекториях, которые он сам же и генерирует. Работа показывает, что применяемый сейчас способ обучения студента скрыто ломается в определённых, довольно типичных схемах CFG: студент выглядит обученным (итоговое предсказание совпадает с учителем), а на деле одна из веток guidance деградирует. Это структурная, а не косметическая проблема самого способа постановки цели обучения.
Кому это важно
Исследователям и инженерам, которые строят пайплайны дистилляции диффузионных моделей для ускорения инференса, в первую очередь для генерации и редактирования видео и изображений с управляющими сигналами (control), а также всем, кто использует CFG-подобные схемы guidance при обучении компактных студенческих моделей на базе более крупных учителей.
Как это применить
Вместо того чтобы сопоставлять итоговое CFG-предсказание студента и учителя как единый вектор, авторы предлагают разделить цель обучения на две: отдельно подгонять позитивную (условную) ветку предсказания и отдельно, направление guidance (разницу между позитивной и негативной ветками). Такой branch-aware подход (метод PDM) авторы проверили на задаче перевода плотного видеоуправляющего сигнала в разреженный (dense-to-sparse video control) и получили более устойчивый к изменению масштаба guidance и более результативный перенос знаний от учителя к студенту, чем при наивном сопоставлении.
Можно ли доверять
Материал, препринт (Bingnan Li с соавторами), опубликованный на площадке Hugging Face Papers; на момент сбора у поста 67 отметок и 2 комментария, то есть независимой проверки сообществом или рецензирования пока немного. Выводы в тексте основаны на теоретическом разборе и на экспериментах авторов, описанных в аннотации; полные детали методики, датасетов и численных результатов в предоставленном тексте не приводятся, для полной проверки нужно читать саму статью и, если доступен, код.
Риски и подводные камни
Аннотация не приводит конкретных числовых показателей улучшения (метрики качества, размер выигрыша), оценить масштаб эффекта PDM по сравнению с наивным методом на предоставленном тексте нельзя. Эксперименты описаны только для одной прикладной задачи (dense-to-sparse видеоконтроль), поэтому насколько общий выигрыш переносится на другие типы диффузионных моделей и задач генерации, из текста не следует. Проблема NBA, судя по описанию, проявляется не при любой схеме CFG, а именно там, где негативная ветка учителя хранит информацию, недоступную студенту.