Self Gradient Forcing: новый метод обучения нейросетей для генерации видео произвольной длины

Современные авторегрессивные видео-диффузионные модели чаще всего обучаются по схеме Self Forcing: модель учится на истории, сгенерированной ею же самой в ходе собственного развёртывания (rollout), а не на эталонном видео. Это снижает так называемое экспозиционное смещение (exposure bias), расхождение между тем, на чём модель обучалась, и тем, с чем она сталкивается на инференсе. Но у подхода есть проблема: исторический кэш ключей и значений (KV-cache), который передаётся будущим кадрам, используется как замороженное состояние, по нему не текут градиенты. Из-за этого функция потерь на будущих кадрах не может научить модель тому, как правильно записывать уже сгенерированные латентные представления в более полезные ключи и значения для последующей генерации. Авторы называют это "пробелом исторического контекстного градиента" (historical context-gradient gap).
Чтобы закрыть этот пробел, авторы во главе с Джунхао Чжуаном предложили Self Gradient Forcing (SGF), двухпроходную стратегию обучения, которая восстанавливает недостающий сигнал обучения, не требуя обратного распространения градиента через всю последовательную цепочку развёртывания (это было бы слишком затратно по памяти и вычислениям). Первый проход выполняется без градиентов и повторяет инференс: на случайно выбранном шаге удаления шума фиксируются и сгенерированный моделью контекст, и зашумлённые латенты, поданные на вход. Второй проход выполняет параллельную реконструкцию контекстного градиента именно для этого зафиксированного шага: сгенерированный контекст подаётся как "чистый" вход с остановленным градиентом (stop-gradient), а модель заново пересчитывает представления ключей и значений для контекста и каузальное внимание (causal attention) между будущими кадрами и контекстом. Таким образом SGF встраивает недостающую обучающую сигнализацию "записи памяти" прямо в исходную авторегрессивную задачу обучения, потери на будущих видео-латентах учат модель кодировать контекст в более полезную для дальнейшей генерации причинно-следственную память.
В обширных экспериментах на длинных временных горизонтах, как покадровых, так и блочных (chunk-wise), при разных начальных условиях, SGF показал более сильную экстраполяцию длинных видео по сравнению с исходным Self Forcing: лучше сохраняется идентичность объекта, консистентность фона и композиции кадра, временная стабильность. Отдельно отмечается, что обучаясь всего на 5-секундном окне, SGF способен экстраполировать генерацию на видео длительностью в несколько минут. Авторы обещают опубликовать код и веса моделей, чтобы продвинуть исследования в области авторегрессивной генерации видео.
Ключевые факты
- SGF устраняет "пробел исторического контекстного градиента", проблему метода Self Forcing, при которой будущие потери не могут научить модель правильно записывать историю в KV-кэш
- Метод двухпроходный: первый проход без градиентов повторяет инференс и фиксирует состояние на случайном шаге удаления шума, второй, пересчитывает контекст с градиентом только для этого шага, без разворачивания всей цепочки
- Обучаясь только на 5-секундном окне, SGF экстраполирует генерацию до видео длиной в несколько минут
- По сравнению с Self Forcing SGF заметно лучше сохраняет идентичность объекта, консистентность фона и композиции, временную стабильность на длинных горизонтах
- Авторы обещают опубликовать код и веса моделей
Почему это важно
Авторегрессивные видео-диффузионные модели, обучающиеся по схеме Self Forcing, страдают от скрытого дефекта: исторический контекст, который модель передаёт себе от кадра к кадру, никак не учится под давлением будущих ошибок, он просто заморожен. Из-за этого качество генерации со временем деградирует: съезжает идентичность персонажа, фон, временная согласованность. SGF впервые даёт этому контексту обучающий сигнал, не удорожая обучение полным разворачиванием цепочки, и это системное улучшение самого метода обучения, а не разовый трюк для конкретной модели.
Кому это важно
В первую очередь, исследователям и инженерам, которые разрабатывают модели генерации видео на основе авторегрессивной диффузии и уже используют или рассматривают Self Forcing как базовый подход. Также интересно командам, которые упираются в ограничение по длине генерируемого видео и ищут способ продлевать ролики без переобучения на длинных последовательностях.
Как это применить
SGF, это метод обучения, а не готовый продукт: применить его можно, только переобучив собственную видео-диффузионную модель по предложенной двухпроходной схеме поверх Self Forcing. Практическая ценность в том, что не нужно собирать длинные обучающие видео, достаточно 5-секундного окна, а модель на инференсе сможет экстраполировать генерацию на несколько минут. Авторы обещают выложить код и веса моделей, что снизит порог входа для воспроизведения.
Можно ли доверять
Материал, препринт с HuggingFace Papers, результаты представлены самими авторами по итогам собственных экспериментов на разных инициализациях и горизонтах; независимой проверки или рецензирования на момент публикации нет. Код и модели пока не выложены (только обещаны), поэтому сторонним исследователям пока нечем воспроизвести заявленные результаты.
Риски и подводные камни
Заявленные улучшения (идентичность объекта, консистентность фона, временная стабильность) измерены авторами по собственной методологии, до релиза кода и независимых тестов их обобщаемость на другие архитектуры и датасеты не подтверждена. Экстраполяция с 5-секундного окна до нескольких минут снимает не все проблемы длинной генерации видео (например, вычислительную стоимость самого инференса), а только часть, связанную с обучающим сигналом.