UniSwap: нейросеть меняет лицо и голос в видео в реальном времени

UniSwap, новый фреймворк для замены персонажа в видео с говорящим человеком: по исходному видео, референсному изображению лица и референсному голосовому клипу система одновременно переносит внешность и тембр голоса, сохраняя движение, окружение, произносимый текст и синхронизацию звука и видео. Авторы называют его первым решением для потоковой (в реальном времени) совместной замены лица и голоса: существующие подходы используют отдельно обученные модели для картинки и звука, из-за чего трудно добиться согласованности между внешностью и голосом персонажа.
Чтобы обучить модель при нехватке размеченных пар «до/после» с разными личностями, авторы предложили пайплайн swap-and-reconstruct: у реальных видеоклипов алгоритмически убирают визуальную и голосовую идентичность, а исходные клипы используют как цель для реконструкции.
Модель строится поэтапно поверх двунаправленного бэкбона: сначала контекстное предобучение (In-context Pretraining) учит совместной замене лица и голоса; затем Conditional Streaming Adaptation переводит генерацию на блочно-каузальную схему с кэшированием ключей и значений (KV-cache) для потокового вывода; далее Efficient Self-forcing DMD снижает смещение экспозиции (exposure bias) и сокращает число шагов шумоподавления с 30 до 3 на блок. Приём Efficient Multi-LoRA Switching позволяет трём ролям DMD работать через один общий замороженный бэкбон, а Feature-RoPE Decomposition удерживает позиции в кэше в пределах диапазона, на котором модель обучалась, это обеспечивает стабильную генерацию длинных видео.
По заявлению авторов, эксперименты показали сильную синхронизацию звука и видео, конкурентоспособное сохранение идентичности, эффективную потоковую генерацию и устойчивость на длинных роликах, но конкретных числовых результатов (метрик точности, сравнения с базовыми методами) в тексте статьи не приведено, как и имён авторов, их принадлежности к организациям, сроков выпуска и доступности кода или модели.
Ключевые факты
- UniSwap, первый фреймворк для потоковой совместной замены лица и голоса персонажа в видео с говорящим человеком, работающий через единый аудиовизуальный диффузионный трансформер.
- Вход системы: исходное видео, референсное изображение лица и референсный голосовой клип; выход сохраняет движение, сцену, произносимый текст и синхронизацию звука с видео.
- Для обучения при нехватке парных данных с разными личностями применён пайплайн swap-and-reconstruct, убирающий идентичность из реальных клипов и использующий их как цель реконструкции.
- Благодаря Efficient Self-forcing DMD число шагов шумоподавления на блок сокращено с 30 до 3, что и даёт потоковую скорость генерации.
- Численных результатов тестов, имён авторов и данных о выпуске кода или модели в статье не приведено, только качественные оценки.
Почему это важно
Большинство систем подмены лица и подмены голоса в видео построены как отдельные модели, которые синхронизируют постфактум, из-за этого рассинхрон между картинкой и звуком остаётся частой проблемой. UniSwap решает обе задачи одной моделью и одним проходом, да ещё и в потоковом режиме, а не только для готового видеофайла целиком, такого решения раньше почти не было.
Кому это важно
Исследователям в области генеративного видео и синтеза говорящих голов, как ориентир по совмещению лица и голоса в одной архитектуре. Индустрии дубляжа и локализации контента, где нужна синхронная замена и внешности, и голоса. Специалистам по обнаружению дипфейков, потоковая генерация такого уровня усложняет детекцию в реальном времени.
Как это применить
Статья не сообщает о планах выпуска кода, весов модели или сроках публикации, доступность UniSwap за пределами исследовательской статьи неизвестна.
Можно ли доверять
Работа опубликована как препринт на Hugging Face Papers. В хранимом тексте статьи нет имён авторов и их принадлежности к организациям, нет числовых результатов экспериментов и сравнения с конкретными базовыми методами, есть только качественные формулировки вроде «сильная синхронизация» и «конкурентоспособное сохранение идентичности».
Риски и подводные камни
Технология объединяет потоковую подмену и лица, и голоса в видео с говорящим человеком в одном инструменте, это напрямую снижает технический порог для правдоподобных дипфейков в реальном времени: раньше для убедительной одновременной подмены внешности и голоса требовались две согласованные системы, а не одна.