DreamX-Creator 1.0: компактная 7B-модель для совместной генерации видео и звука

Большинство современных генераторов видео либо вовсе не создают звук, либо синтезируют его отдельным этапом после видео, из-за этого видео- и аудиоряд не влияют друг на друга напрямую. Авторы работы представили DreamX-Creator 1.0, компактную систему совместной («нативной») генерации видео и звука, построенную вокруг генератора на 7 миллиардов параметров (7B).
Система получает на вход первый кадр и текстовый промпт и совместно, одним процессом шумоподавления, генерирует видео- и аудиопоток. Технически потоки обрабатываются независимо в первой половине сети, а во второй половине соединяются через механизм Gated Cross-Modal Attention («управляемое перекрёстно-модальное внимание»), его вентили (gates), работающие на уровне отдельных токенов и «голов» внимания, регулируют вклад каждой активной кросс-модальной головы внимания.
Для обучения авторы построили единую Audio-Video Data System, систему, которая собирает и фильтрует временно согласованные видеоклипы, снабжает их структурированной мультимодальной разметкой и раскладывает по пулам данных под конкретные задачи (навыки) модели. Само обучение идёт в несколько этапов: Progressive Joint Training состоит из двух этапов совместного аудио-видео предобучения, за которыми следует высококачественная доводка (High-Quality Finetuning). Далее модель дополнительно дообучается через Audio-Video Reinforcement Learning, обучение с подкреплением, где Modality-Aware Multimodal Feedback («мультимодальная обратная связь с учётом модальности») направляет обратную связь по видео, по звуку и по кросс-модальным аспектам в соответствующие потоки модели отдельно.
Для получения видео высокого (2K) разрешения без больших вычислительных затрат авторы предложили конвейер Autoregressive 1-Step 2K Refinement: двунаправленную многошаговую модель-«учителя» переделывают в авторегрессивный многошаговый уточнитель (refiner), а затем дистиллируют его в модель-«ученика», которой достаточно одной оценки шумоподавления на каждый временной фрагмент (temporal chunk) видео, то есть итоговое повышение резкости до 2K требует минимум вычислений на шаг.
По заявлению авторов, DreamX-Creator 1.0 в результате достигает нативной синхронизированной генерации видео и звука с качеством, сопоставимым с существующими открытыми (open-source) системами того же назначения, конкретных числовых сравнений с названными системами-конкурентами в тексте не приводится, оценка качественная. Выкладывая в открытый доступ компактный 7B-генератор и 2K-уточнитель, авторы говорят, что хотят сделать нативную генерацию видео со звуком более доступной и дать сообществу базу для дальнейших исследований в этой области.
Ключевые факты
- DreamX-Creator 1.0, компактная система на генераторе с 7 млрд параметров (7B), которая по первому кадру и текстовому промпту совместно генерирует видео и синхронный звук одним процессом, а не раздельными этапами
- Видео- и аудиопотоки обрабатываются независимо в первой половине сети и соединяются во второй половине через Gated Cross-Modal Attention, вентили на уровне токенов и голов внимания регулируют вклад каждой кросс-модальной головы
- Обучение проходит через собственную систему сбора и разметки данных (Audio-Video Data System), два этапа совместного предобучения плюс доводку, а затем через обучение с подкреплением с раздельной обратной связью по видео, звуку и кросс-модальным аспектам
- Резкость до 2K достигается конвейером Autoregressive 1-Step 2K Refinement: дистиллированной модели достаточно одной оценки шумоподавления на каждый временной фрагмент видео
- Авторы заявляют качество, сопоставимое с открытыми аналогами (без конкретных цифр сравнения), и выкладывают 7B-генератор и 2K-уточнитель в открытый доступ ради доступности технологии для дальнейших исследований
Почему это важно
Большинство генераторов видео либо не делают звук вовсе, либо добавляют его отдельным этапом поверх готового видео, из-за этого звук и картинка не влияют друг на друга и хуже синхронизированы по смыслу и по времени. DreamX-Creator 1.0 показывает архитектуру, где видео и звук денойзятся одновременно в одной модели с явным механизмом обмена информацией между модальностями (Gated Cross-Modal Attention), это шаг к тому, чтобы генеративное видео с ходу звучало «в такт» происходящему на экране, а не получало звук постфактум.
Кому это важно
В первую очередь исследователям и инженерам, которые работают над генеративным видео и мультимодальными моделями: подход и обученная модель дают конкретный компактный (7B) пример нативной аудио-видео генерации, который можно изучать и на который можно опираться. Полезно и разработчикам инструментов, которым нужна открытая, а не закрытая API-модель для экспериментов с видео и звуком.
Как это применить
Авторы выкладывают в открытый доступ сам 7B-генератор и отдельный модуль 2K-уточнения (2K Refiner), которые можно использовать или дорабатывать как основу для собственных экспериментов с совместной генерацией видео и звука. При этом в тексте работы не указаны ни дата релиза, ни условия лицензии, ни то, где именно размещены веса или код, эти детали для практического использования придётся уточнять отдельно, когда модель станет доступна.
Можно ли доверять
Источник, публикация на HuggingFace Papers, то есть текст аннотации самой исследовательской работы; фактура полная и прямо описывает архитектуру и пайплайн обучения. Но заявление о качестве «на уровне современных открытых систем», качественное, без единой числовой метрики или названного бенчмарка для сравнения, то есть проверить его напрямую по тексту нельзя. Имена авторов и организация-разработчик в самом тексте аннотации не указаны.
Риски и подводные камни
В описании нет данных о скорости инференса, требованиях к железу, размере обучающего датасета или вычислительном бюджете, а также нет определения того, что именно считается «временным фрагментом» (temporal chunk) в конвейере уточнения до 2K, то есть оценить практическую применимость и стоимость запуска модели по имеющемуся тексту нельзя. Заявление о конкурентоспособности с открытыми системами исходит от самих авторов и не подкреплено независимым бенчмарком.