OmniVAE: единый VAE синхронизирует аудио и видео при совместной генерации

Современные генеративные модели переходят от отдельной генерации немого видео или изолированного аудио к совместной генерации синхронизированных аудио и видео. Проблема в том, что большинство существующих подходов обучают VAE (вариационный автокодировщик) для аудио и VAE для видео раздельно. В итоге два скрытых (латентных) пространства получаются невыровненными друг с другом, и последующей генеративной модели приходится с нуля учиться синхронизировать аудио и видео между собой, это тяжело из-за фундаментальных структурных различий между модальностями.
Авторы предлагают OmniVAE, совместно обучаемый аудио-видео VAE, который учится тонкому (fine-grained) семантическому выравниванию между латентными представлениями аудио и видео ещё на этапе самого VAE, до запуска генеративной модели. Помимо обычной задачи реконструкции, OmniVAE использует два дополнительных обучающих сигнала. Первый, контрастная задача на уровне сегментов (segment-level audio-video contrastive objective): она заставляет модель улавливать временно-смысловое соответствие между кусками аудио и видео и тем самым выравнивает два латентных пространства. Второй, дистилляция признаков: в каждую модальность (аудио и видео) переносятся признаки из предобученных энкодеров, специализированных именно на этой модальности, что повышает пригодность («обучаемость») обоих латентных пространств для последующих генеративных моделей.
По словам авторов, обширные эксперименты показывают, что оба обучающих сигнала последовательно улучшают качество латентных пространств, а это, в свою очередь, приводит к более высокому качеству генерации и более точной кросс-модальной синхронизации в задаче генерации аудио и видео по тексту (text-to-audio-video). Конкретных числовых метрик или сравнений с другими методами в доступном тексте (аннотации к работе) не приведено, они, вероятно, содержатся в полной версии статьи. Авторы делают вывод, что обучение унифицированных представлений, важная основа для омнимодального (объединяющего сразу несколько модальностей) моделирования в целом.
Ключевые факты
- Проблема: большинство существующих систем обучают VAE для аудио и VAE для видео раздельно, из-за чего их латентные пространства не выровнены и генеративной модели приходится учить синхронизацию с нуля
- OmniVAE, совместно обучаемый аудио-видео VAE, который выравнивает латентные представления двух модальностей ещё на этапе самого VAE
- Используются два дополнительных сигнала: контрастная задача на уровне сегментов для временно-смыслового соответствия аудио и видео и дистилляция признаков из предобученных энкодеров каждой модальности
- По заявлению авторов, эксперименты показывают: оба сигнала улучшают качество латентных пространств, что даёт более высокое качество генерации и более точную синхронизацию в генерации по тексту (text-to-audio-video)
- Вывод авторов: обучение унифицированных представлений, необходимая основа для омнимодального моделирования
Почему это важно
Совместная генерация синхронизированных аудио и видео сложнее, чем генерация каждой модальности по отдельности, из-за фундаментальных структурных различий между звуком и изображением. Пока большинство систем обучают VAE для аудио и VAE для видео раздельно, их латентные пространства получаются невыровненными, и генеративной модели, которая работает поверх этих VAE, приходится учиться синхронизации аудио и видео полностью с нуля. OmniVAE решает эту проблему на более раннем этапе, совместно обучая единый VAE так, чтобы латентные пространства аудио и видео были семантически выровнены ещё до того, как за дело возьмётся генеративная модель.
Кому это важно
Работа адресована исследователям и инженерам, которые разрабатывают модели генерации видео со звуком, синхронной речи и изображения или другие омнимодальные (объединяющие несколько модальностей) генеративные системы, в частности генерацию по тексту (text-to-audio-video). OmniVAE не самостоятельный продукт для конечного пользователя, а строительный блок, компонент, который может заменить собой раздельные аудио- и видео-VAE внутри более крупного генеративного конвейера.
Как это применить
OmniVAE обучается двумя дополнительными сигналами поверх обычной задачи реконструкции. Первый, контрастная задача на уровне сегментов, которая заставляет модель сопоставлять кусочки аудио и видео по времени и смыслу, выравнивая тем самым два латентных пространства. Второй, дистилляция признаков из предобученных энкодеров, специализированных под аудио и под видео по отдельности: их знания переносятся в соответствующую часть OmniVAE, повышая пригодность обоих латентных пространств для последующего обучения генеративных моделей. На практике такой VAE предполагается использовать как замену раздельным аудио- и видео-VAE в конвейере генерации аудио и видео по текстовому запросу.
Можно ли доверять
Источник, страница препринта на Hugging Face Papers (23 голоса, 2 комментария на момент сбора), первый автор, Jun Zhan; полный список соавторов и их принадлежность в доступном тексте не указаны. Доступный текст, это аннотация к работе, а не полная статья: заявления об «обширных экспериментах» и улучшении качества принадлежат авторам работы и пока не подкреплены в пересказе конкретными числовыми метриками или сравнением с другими методами, эти детали, предположительно, есть в полной версии статьи.
Риски и подводные камни
Из доступного текста не видно конкретных цифр, датасетов или сравнения с базовыми методами, только общее утверждение авторов об улучшении качества латентных пространств. Не указано, опубликованы ли код и веса модели и прошла ли работа рецензирование. Итоговое качество совместной генерации аудио и видео зависит не только от VAE, но и от самой генеративной модели, которая работает поверх него, поэтому улучшения на уровне VAE не гарантируют автоматического скачка качества готовой генерации без проверки на полном конвейере.
«Эти результаты подчёркивают важность обучения унифицированных представлений как основы для омнимодального моделирования.»
— Jun Zhan и соавторы, авторы работы об OmniVAE