LiveAnimate: диффузионная модель анимирует человека в реальном времени

Анимация человека по позе синтезирует видео персонажа из одного референсного изображения и потока управляющих поз, это нужно для интерактивных сценариев вроде прямых трансляций, телеприсутствия и виртуальных аватаров. Проблема в том, что диффузионные системы генерации видео обычно тратят на клип от минут до часов, что исключает отклик в реальном времени.
Авторы представляют LiveAnimate, по их словам, первую систему, которая совмещает потоковую генерацию в реальном времени со стабильной генерацией длинных роликов на модели миллиардного масштаба. В основе, видео-диффузионный трансформер (DiT) на 14 млрд параметров. Обучение идёт в два этапа: сначала предобученный двунаправленный DiT через процедуру Reference-Anchored Teacher-Forcing Adaptation превращается в блочно-каузальный авторегрессивный генератор, затем метод Block-wise Self-Forcing Distillation сокращает бюджет сэмплирования до трёх шагов.
Чтобы внешность персонажа не «плыла» на длинных потоках, авторы вводят механизм внимания PR-Sink (Pose-Retrieval Sink Attention), ограниченный по размеру KV-кэш из трёх частей: Static Sink навсегда закрепляет самый первый сгенерированный блок, Dynamic Sink хранит один исторический блок, подобранный по совпадающей позе, и добавлен «скользящий» буфер на три слота. Когда поза повторяется, PR-Sink восстанавливает нужный контекст внешности, не храня всю последовательность целиком, из-за этого расход памяти и задержка на блок остаются постоянными независимо от длительности потока.
В сочетании с последовательным параллелизмом Ulysses и слиянием операторов эти решения дают 19,63 кадра в секунду потокового вывода на двух GPU NVIDIA H100. На трёхминутном бенчмарке LiveAnimate удерживает почти неизменное перцептивное качество и узнаваемость личности персонажа от 30-й секунды до последней минуты ролика, тогда как прежние системы заметно деградируют по ходу генерации или требуют часов офлайн-расчёта для того же результата.
Ключевые факты
- LiveAnimate генерирует видео человека из одного референсного фото и потока поз в реальном времени, на модели диффузионного трансформера в 14 млрд параметров
- Двухэтапное обучение превращает готовый двунаправленный DiT в блочно-каузальный авторегрессивный генератор и сокращает число шагов сэмплирования до трёх
- Механизм внимания PR-Sink удерживает внешность персонажа стабильной на длинных потоках при постоянном расходе памяти и задержке на блок
- На двух GPU NVIDIA H100 система выдаёт 19,63 кадра в секунду потоковой генерации
- На трёхминутном бенчмарке качество и узнаваемость личности остаются почти неизменными от 30-й секунды до последней минуты, прежние системы заметно деградируют или требуют часов офлайн-расчёта
Почему это важно
Диффузионная генерация видео долго была слишком медленной для интерактивных сценариев, клип требовал от минут до часов расчёта, что исключало живой отклик. LiveAnimate, по утверждению авторов, первая система, которая совмещает потоковую генерацию в реальном времени со стабильным качеством на длинных роликах при модели миллиардного масштаба, то есть закрывает разрыв между качеством диффузионных моделей и скоростью, нужной для живого взаимодействия.
Кому это важно
Разработчикам приложений с живыми цифровыми аватарами, стриминговых платформ, виртуальных ведущих и VTuber-сервисов, систем телеприсутствия и виртуальных собеседников, где персонаж должен двигаться синхронно с реальным человеком без задержки в минуты или часы на генерацию.
Как это применить
Практическое использование описано с конкретными цифрами: 19,63 кадра в секунду потоковой генерации достигаются на двух GPU NVIDIA H100 благодаря сочетанию трёхшагового сэмплирования, механизма внимания PR-Sink и последовательного параллелизма Ulysses с операторным слиянием, то есть развёртывание требует серьёзного, но не экзотического мульти-GPU-стенда. В тексте работы нет упоминания о публикации кода, весов модели или датасета, так что на данный момент это описание метода, а не готовый к использованию релиз.
Можно ли доверять
Это препринт-работа без указанных в тексте имён авторов и организаций, без даты публикации, без выложенных кода или весов модели, самостоятельно проверить или воспроизвести результат по этой публикации пока нельзя. Сравнение приводится только с обобщёнными "прежними системами" без названия конкретных методов-конкурентов, а прирост качества на бенчмарке описан качественно ("почти неизменное восприятие"), без численной метрики, то есть заявления опираются на собственное описание авторов, независимой проверки в тексте нет.
Риски и подводные камни
Область применения узкая, только анимация человека по позе, а не генерация видео в целом. Для воспроизведения заявленной скорости нужны два GPU NVIDIA H100, конкретное и не общедоступное аппаратное требование. Без кода и весов, без поимённого сравнения с конкретными конкурентами и без численной метрики качества реальный уровень результата и его устойчивость за пределами трёхминутного бенчмарка пока нельзя оценить независимо.