UniSwap: нейросеть меняет лицо и голос в видео в реальном времени

UniSwap: нейросеть меняет лицо и голос в видео в реальном времени

UniSwap, новый фреймворк для замены персонажа в видео с говорящим человеком: по исходному видео, референсному изображению лица и референсному голосовому клипу система одновременно переносит внешность и тембр голоса, сохраняя движение, окружение, произносимый текст и синхронизацию звука и видео. Авторы называют его первым решением для потоковой (в реальном времени) совместной замены лица и голоса: существующие подходы используют отдельно обученные модели для картинки и звука, из-за чего трудно добиться согласованности между внешностью и голосом персонажа.

Чтобы обучить модель при нехватке размеченных пар «до/после» с разными личностями, авторы предложили пайплайн swap-and-reconstruct: у реальных видеоклипов алгоритмически убирают визуальную и голосовую идентичность, а исходные клипы используют как цель для реконструкции.

Модель строится поэтапно поверх двунаправленного бэкбона: сначала контекстное предобучение (In-context Pretraining) учит совместной замене лица и голоса; затем Conditional Streaming Adaptation переводит генерацию на блочно-каузальную схему с кэшированием ключей и значений (KV-cache) для потокового вывода; далее Efficient Self-forcing DMD снижает смещение экспозиции (exposure bias) и сокращает число шагов шумоподавления с 30 до 3 на блок. Приём Efficient Multi-LoRA Switching позволяет трём ролям DMD работать через один общий замороженный бэкбон, а Feature-RoPE Decomposition удерживает позиции в кэше в пределах диапазона, на котором модель обучалась, это обеспечивает стабильную генерацию длинных видео.

По заявлению авторов, эксперименты показали сильную синхронизацию звука и видео, конкурентоспособное сохранение идентичности, эффективную потоковую генерацию и устойчивость на длинных роликах, но конкретных числовых результатов (метрик точности, сравнения с базовыми методами) в тексте статьи не приведено, как и имён авторов, их принадлежности к организациям, сроков выпуска и доступности кода или модели.

Ключевые факты

  • UniSwap, первый фреймворк для потоковой совместной замены лица и голоса персонажа в видео с говорящим человеком, работающий через единый аудиовизуальный диффузионный трансформер.
  • Вход системы: исходное видео, референсное изображение лица и референсный голосовой клип; выход сохраняет движение, сцену, произносимый текст и синхронизацию звука с видео.
  • Для обучения при нехватке парных данных с разными личностями применён пайплайн swap-and-reconstruct, убирающий идентичность из реальных клипов и использующий их как цель реконструкции.
  • Благодаря Efficient Self-forcing DMD число шагов шумоподавления на блок сокращено с 30 до 3, что и даёт потоковую скорость генерации.
  • Численных результатов тестов, имён авторов и данных о выпуске кода или модели в статье не приведено, только качественные оценки.

Почему это важно

Большинство систем подмены лица и подмены голоса в видео построены как отдельные модели, которые синхронизируют постфактум, из-за этого рассинхрон между картинкой и звуком остаётся частой проблемой. UniSwap решает обе задачи одной моделью и одним проходом, да ещё и в потоковом режиме, а не только для готового видеофайла целиком, такого решения раньше почти не было.

Кому это важно

Исследователям в области генеративного видео и синтеза говорящих голов, как ориентир по совмещению лица и голоса в одной архитектуре. Индустрии дубляжа и локализации контента, где нужна синхронная замена и внешности, и голоса. Специалистам по обнаружению дипфейков, потоковая генерация такого уровня усложняет детекцию в реальном времени.

Как это применить

Статья не сообщает о планах выпуска кода, весов модели или сроках публикации, доступность UniSwap за пределами исследовательской статьи неизвестна.

Можно ли доверять

Работа опубликована как препринт на Hugging Face Papers. В хранимом тексте статьи нет имён авторов и их принадлежности к организациям, нет числовых результатов экспериментов и сравнения с конкретными базовыми методами, есть только качественные формулировки вроде «сильная синхронизация» и «конкурентоспособное сохранение идентичности».

Риски и подводные камни

Технология объединяет потоковую подмену и лица, и голоса в видео с говорящим человеком в одном инструменте, это напрямую снижает технический порог для правдоподобных дипфейков в реальном времени: раньше для убедительной одновременной подмены внешности и голоса требовались две согласованные системы, а не одна.