DiffusionOPSD: самодистилляция снижает расходы на обучение диффузионных моделей на 40, 63%

Исследователи представили DiffusionOPSD, фреймворк самодистилляции по актуальной политике модели для дообучения диффузионных моделей генерации изображений с помощью обучения с подкреплением (RL). Проблема, которую он решает: обучение с подкреплением умеет выравнивать диффузионные модели под предпочтения людей и задачные цели, но награда обычно даётся только за итоговое изображение, она не говорит модели, как именно должно измениться промежуточное предсказание на каждом шаге устранения шума (denoising). DiffusionOPSD превращает такую награду за итог в явные цели для предсказаний чистого изображения в выбранных точках траектории.
Механика метода: на каждой внешней итерации замороженная копия модели («поведенческая политика») генерирует траектории генерации и выдаёт состояния-запросы и опорные предсказания («якоря»). Градиенты функции награды строят вокруг каждого якоря ограниченные положительную и отрицательную цели. Обучаемая модель подгоняется под эти цели как под отсоединённую (не через обратное распространение по всей цепочке) супервизию за конечное число шагов подгонки, после чего экспоненциальное скользящее среднее (EMA) обновляет замороженную поведенческую политику для следующей итерации. Такая схема позволяет отдельно измерять качество построения целей и то, насколько хорошо модель реализует эти цели за один шаг подгонки. Контролируемые эксперименты с одинаковыми запросами показали: более сильный прирост при построении целей не всегда даёт больший фактический прирост качества после одного шага подгонки.
Метод проверили на двух диффузионных бэкбонах, SD 3.5-M и уже дистиллированной по шагам Z-Image-Turbo, с десятью оценщиками, всего 20 настроек, сопоставленных по типу награды. DiffusionOPSD показал лучший итоговый результат на отложенной выборке в 19 из 20 настроек и обошёл сильнейший конкурирующий метод на величину до 44,0%. При этом обучение требует меньше GPU-часов, чем у метода DiffusionNFT: на 40% на модели SD 3.5-M и на 63% на модели Z-Image-Turbo. По выводу авторов, результаты подтверждают, что самодистилляция по актуальной политике, эффективный и поддающийся анализу подход к дообучению диффузионных моделей после базового обучения, открывающий путь к более эффективному и диагностируемому выравниванию.
Ключевые факты
- DiffusionOPSD, метод RL-дообучения диффузионных моделей, который превращает награду за итоговое изображение в явные цели для промежуточных предсказаний на шагах устранения шума.
- Замороженная копия модели генерирует траектории и опорные предсказания (якоря); градиенты награды строят вокруг них ограниченные цели, обучаемая модель под них подгоняется, затем EMA обновляет замороженную копию.
- На бэкбонах SD 3.5-M и Z-Image-Turbo, с десятью оценщиками (20 настроек), метод дал лучший итоговый результат в 19 из 20 настроек и обошёл сильнейший конкурирующий метод на величину до 44,0%.
- Обучение требует меньше GPU-часов, чем метод DiffusionNFT: на 40% меньше на SD 3.5-M и на 63% меньше на Z-Image-Turbo.
- Отдельные контролируемые эксперименты показали: более качественные целевые значения не всегда дают больший прирост в реальном обучении за один шаг подгонки.
Почему это важно
При обучении диффузионных моделей с подкреплением награда обычно приходит только за итоговое, полностью сгенерированное изображение, она ничего не говорит о том, как должно измениться промежуточное предсказание на конкретном шаге устранения шума. Это делает обучающий сигнал непрямым и затрудняет понимание того, что именно модель улучшает на каждом шаге. DiffusionOPSD превращает такую награду за итог в явную, вычисляемую цель для предсказания чистого изображения прямо в точке запроса, а заодно разделяет качество построения этой цели и качество её фактического усвоения моделью, это делает процесс дообучения более прозрачным и поддающимся анализу.
Кому это важно
Исследователям и инженерам, которые дообучают диффузионные модели генерации изображений под предпочтения или конкретные задачи методами обучения с подкреплением; командам, которые считают GPU-часы на дообучение и ищут более дешёвые способы выравнивания моделей; тем, кто работает с уже дистиллированными по шагам быстрыми моделями вроде Z-Image-Turbo, поскольку метод показал выигрыш и на такой модели.
Как это применить
DiffusionOPSD, это метод/фреймворк для этапа дообучения (post-training) уже готовой диффузионной модели, а не отдельный продукт. Он требует функции награды с вычисляемым градиентом и работает как на полноразмерном бэкбоне (SD 3.5-M), так и на уже дистиллированном по шагам (Z-Image-Turbo). В тексте источника не сказано о выпуске кода, весов модели или датасета, судить о готовой к использованию реализации по имеющимся данным нельзя.
Можно ли доверять
Источник, аннотация препринта на Hugging Face, а не полный текст научной работы, результаты приведены с конкретными числами по 20 настройкам (два бэкбона, десять оценщиков), что даёт достаточно широкую проверку внутри самой работы. При этом в тексте не указаны ни имена авторов, ни организация, ни дата публикации, ни независимая верификация результатов, все цифры получены и заявлены самими авторами метода, без стороннего воспроизведения.
Риски и подводные камни
Улучшение «до 44,0%», это верхняя граница по лучшим случаям, а не типичный средний результат по всем 20 настройкам. Метод сравнения, DiffusionNFT, в тексте отдельно не описан, поэтому оценить базу для сравнения читателю со стороны сложно. Результаты получены и заявлены самими исследователями без указания на независимое воспроизведение, а перенос выигрыша за пределы двух проверенных бэкбонов и десяти оценщиков источником не подтверждён.