UniSwap подменяет лицо и голос в видео с говорящим человеком в потоковом режиме

UniSwap подменяет лицо и голос в видео с говорящим человеком в потоковом режиме

Юйсюань Чжан с соавторами представили UniSwap, фреймворк для замены персонажа в видео с говорящим человеком, который впервые совмещает подмену внешности и подмену голоса в одной системе, работающей в потоковом режиме. Задача подмены персонажа требует согласованного переноса и внешности, и голоса при сохранении исходных движений, сцены, содержания речи и синхронизации звука с видео. По словам авторов, существующие методы решают эту задачу раздельными моделями для картинки и для звука, из-за чего добиться согласованности изображения и звука сложно.

UniSwap получает на входе исходное видео, референсное изображение лица и референсный аудиоклип голоса и переносит внешность и тембр голоса из референсов в видео при помощи единого аудиовизуального диффузионного трансформера, сохраняя при этом движения, сцену, содержание речи и тайминг из исходного ролика. Чтобы обучить модель в условиях нехватки выровненных пар «один и тот же клип с разными личностями», авторы предложили pipeline swap-and-reconstruct: из реальных клипов удаляют визуальную и голосовую идентичность, а затем требуют от модели восстановить исходный клип, используя его как цель обучения.

Модель строится поэтапно на основе двунаправленного backbone: сначала идёт In-context Pretraining для совместной замены обеих модальностей, затем Conditional Streaming Adaptation переводит модель на блочно-каузальную генерацию с кэшированием ключей и значений (KV-cache), и наконец Efficient Self-forcing DMD борется с накоплением ошибок при автогенерации (exposure bias) и сокращает число шагов шумоподавления с 30 до 3 на блок. Три роли DMD-обучения используют общий замороженный backbone за счёт Efficient Multi-LoRA Switching, а Feature-RoPE Decomposition удерживает позиции в кэше в пределах диапазона обучения, что обеспечивает стабильную генерацию длинных роликов.

Согласно экспериментам авторов, UniSwap показывает сильную синхронизацию звука и видео, конкурентоспособное сохранение внешности, эффективную потоковую генерацию и стабильность на длинных роликах, конкретные числовые метрики и сравнения с другими методами в материале не приводятся.

Ключевые факты

  • UniSwap, первый (по заявлению авторов) фреймворк для потоковой совместной подмены внешности и голоса в видео с говорящим человеком внутри одного аудиовизуального диффузионного трансформера
  • На входе, исходное видео, референсное изображение лица и референсный аудиоклип голоса; на выходе сохраняются исходные движения, сцена, содержание речи и синхронизация звука с видео
  • Для обучения при нехватке выровненных данных предложен pipeline swap-and-reconstruct: из реальных клипов удаляют идентичность и учат модель восстанавливать оригинал
  • Техника Efficient Self-forcing DMD сокращает число шагов шумоподавления с 30 до 3 на блок и борется с накоплением ошибок при автогенерации (exposure bias)
  • Efficient Multi-LoRA Switching и Feature-RoPE Decomposition позволяют трём ролям DMD делить один замороженный backbone и обеспечивают стабильную генерацию длинных роликов

Почему это важно

Существующие методы подмены лица и голоса на видео используют раздельные модели для картинки и звука, из-за чего трудно добиться синхронности между движением губ, сменой внешности и новым голосом. UniSwap, по заявлению авторов, первый фреймворк, который делает обе замены внутри одной аудиовизуальной диффузионной модели-трансформера, причём в потоковом режиме, а не только офлайн-обработкой уже готового ролика целиком.

Кому это важно

Инженерам и исследователям, занимающимся генерацией видео с говорящими людьми: дубляж и локализация, синтетические аватары и ведущие, инструменты монтажа. Также разработчикам систем реального времени, стриминга и видеозвонков с заменой лица и голоса, и специалистам по безопасности, которым важно следить за прогрессом в потоковой генерации дипфейков.

Как это применить

На вход система берёт исходное видео, референсное изображение лица и референсный аудиоклип голоса; на выходе, то же видео с теми же движениями, сценой, словами и таймингом, но с внешностью и тембром голоса из референсов. Обучение идёт поэтапно: сначала in-context-предобучение для совместной замены обеих модальностей, затем адаптация под потоковую генерацию с блочно-каузальным кэшированием ключей и значений, и наконец Efficient Self-forcing DMD, сокращающая число шагов шумоподавления с 30 до 3 на блок. В источнике не сказано, планируют ли авторы открыть код, веса модели или обучающий датасет.

Можно ли доверять

Заявления о результатах, это оценка самих авторов: сильная синхронизация звука и видео, конкурентоспособное сохранение внешности, эффективная потоковая генерация и стабильность на длинных роликах. В тексте нет ни одной числовой метрики или сравнения с конкретными методами-конкурентами, которые подтверждали бы эти формулировки, а также не указаны полный состав авторов и их организации, независимо проверить результаты по этому материалу нельзя.

Риски и подводные камни

Технология для потоковой синхронной подмены лица и голоса в видео с говорящим человеком снижает порог для реалистичных дипфейков в реальном времени, то, что раньше требовало офлайн-обработки, здесь работает как потоковый процесс. В материале ничего не сказано об ограничениях на использование, водяных знаках или защите от злоупотребления.