LiveAnimate: система в реальном времени анимирует человека по одному фото

LiveAnimate генерирует видео человека по одному референсному фото и потоку поз (pose-driven human animation), задача, актуальная для лайв-стриминга, телеприсутствия и виртуальных аватаров, где нужна мгновенная реакция. Обычные диффузионные системы тратят на клип от минут до часов, что исключает интерактивность. Юйсюань Чжан с соавторами представляют LiveAnimate, по их словам, первую систему, которая сочетает потоковую генерацию в реальном времени со стабильной генерацией длинных роликов на масштабе в миллиард с лишним параметров. Модель построена на видео-диффузионном трансформере (DiT) с 14 млрд параметров.
Обучение проходит в два этапа. Сначала предобученный двунаправленный DiT адаптируют в блочно-каузальный авторегрессионный генератор методом Reference-Anchored Teacher-Forcing Adaptation (адаптация через принудительное обучение, заякоренное на референсном кадре). Затем бюджет сэмплирования сокращают до трёх шагов с помощью Block-wise Self-Forcing Distillation (блочной дистилляции с самопринуждением).
Чтобы сохранять внешность персонажа на длинных роликах, авторы предложили механизм Pose-Retrieval Sink Attention (PR-Sink), ограниченный по размеру KV-кэш, который сочетает статический якорь (Static Sink), постоянно удерживающий самый первый сгенерированный блок, динамический якорь (Dynamic Sink), хранящий исторический блок, найденный по совпадению позы, и скользящее окно из трёх слотов (Rolling Window). Когда поза повторяется, PR-Sink восстанавливает нужный контекст внешности, не храня всю последовательность целиком, поэтому память и задержка на блок остаются постоянными независимо от длины потока.
Вместе с параллелизмом по последовательности Ulysses и слиянием операторов (operator fusion) эти решения дают скорость потокового вывода 19,63 кадра в секунду на двух GPU NVIDIA H100. На трёхминутном тестовом ролике LiveAnimate сохраняет почти постоянное визуальное качество и узнаваемость личности от первых 30 секунд до последней минуты, тогда как, по утверждению авторов, существующие системы на этом же ролике заметно деградируют или требуют часов офлайн-вычислений для сравнимого результата.
Ключевые факты
- LiveAnimate строится на видео-диффузионном трансформере (DiT) с 14 млрд параметров и генерирует анимацию человека по одному референсному фото и потоку поз.
- Двухэтапное обучение: адаптация в блочно-каузальный авторегрессионный генератор (Reference-Anchored Teacher-Forcing Adaptation), затем дистилляция бюджета сэмплирования до трёх шагов (Block-wise Self-Forcing Distillation).
- Механизм PR-Sink, статический якорь, динамический якорь и скользящее окно из трёх слотов, удерживает внешность персонажа на длинных роликах при постоянном объёме KV-кэша.
- Скорость потокового вывода, 19,63 кадра в секунду на двух GPU NVIDIA H100.
- На трёхминутном тесте качество и узнаваемость личности остаются почти неизменными от 30-й секунды до последней минуты, по заявлению авторов, лучше, чем у прежних систем.
Почему это важно
Диффузионные модели обычно тратят от минут до часов на генерацию одного клипа, что делает их непригодными для интерактивных сценариев. LiveAnimate, по словам авторов, первая система, которая одновременно даёт потоковую генерацию в реальном времени и стабильное качество на длинных роликах при масштабе модели в миллиард с лишним параметров. Именно сочетание скорости и устойчивости на длинной дистанции авторы называют главным результатом работы.
Кому это важно
Разработчикам продуктов для лайв-стриминга, телеприсутствия и виртуальных аватаров, где нужна анимация человека по видео или потоку поз без задержки в минуты. Инженерам, которые строят или оптимизируют потоковые диффузионные системы, полезны конкретные приёмы, блочно-каузальная адаптация, дистилляция шагов сэмплирования и ограниченный по памяти KV-кэш.
Как это применить
Заявленная скорость, 19,63 кадра в секунду при потоковом выводе на двух GPU NVIDIA H100 с параллелизмом по последовательности Ulysses и слиянием операторов; это ориентир по требуемому железу для похожих систем. Ключевые компоненты, PR-Sink с постоянным объёмом KV-кэша и дистилляция до трёх шагов сэмплирования, можно рассматривать как отдельные приёмы для собственных потоковых диффузионных пайплайнов, если решается похожая задача сохранения внешности персонажа на длинных роликах.
Можно ли доверять
Все цифры и выводы в этом пересказе взяты из текста самой работы, независимой проверки, стороннего сравнения или упоминания конкретных систем-конкурентов в тексте нет. Заявление о превосходстве над «прежними системами» не подкреплено ни их названиями, ни числовым значением показателя качества: «почти постоянное качество» описано только качественно, без метрики или процента. В тексте также не указаны ни организация или аффилиация авторов, ни факт публикации кода или модели, ни дата и площадка публикации.
Риски и подводные камни
Работа не раскрывает, будут ли код или веса модели выпущены в открытый доступ, что затрудняет независимую проверку и воспроизведение. Сравнение с «прежними системами» не называет конкретных аналогов, поэтому оценить реальный отрыв невозможно. Заявленная скорость получена на двух GPU NVIDIA H100, это дорогое и не всегда доступное железо, так что практическое применение вне исследовательской лаборатории пока под вопросом.