AV-GRPO: новый метод обучения с подкреплением обошёл LTX-2.3 в генерации аудио и видео

Учёные предложили AV-GRPO, модальность-ориентированный диффузионный фреймворк обучения с подкреплением (reinforcement learning) для совместной генерации аудио и видео, а также набор данных 5DAV для его обучения. Проблема, которую решает работа: существующие модели совместной генерации аудио и видео страдают от недостаточной точности по каждой модальности отдельно, слабого согласования с текстовым описанием и плохой синхронизации звука с изображением. Обучение с подкреплением выглядит перспективным решением, но его прямое применение к совместной генерации аудио-видео авторы называют сложной задачей: разнородные награды для разных модальностей перепутывают сигналы обучения и затрудняют распределение вклада в награду (credit assignment); совместная оптимизация двух модальных «башен» (веток сети под аудио и видео) вычислительно дорога из-за разной динамики каждой из них; а оценка синхронизации требует парных образцов, что мешает честному сравнению наград.
AV-GRPO включает три ключевых модуля: (1) привязанные к модальности проходы генерации (rollouts), которые разделяют сигналы обучения и стабилизируют сложность задачи; (2) оптимизацию с зафиксированной траекторией и замороженной «башней» одной из модальностей, она снижает вычислительные затраты и позволяет корректнее распределять вклад в награду; (3) адаптивные целевые функции и силу возмущений, подобранные под динамику конкретной модальности. Вместе это превращает связанное обучение предпочтений сразу по двум модальностям в отдельные одномодальные подзадачи, что даёт более точное распределение награды и лучшую синхронизацию. Дополнительно авторы собрали датасет 5DAV, который декомпозирует обучающие примеры по пяти измерениям для системного и управляемого по сложности обучения.
В экспериментах на бенчмарках JavisBench и VABench AV-GRPO, по утверждению авторов, превосходит модель LTX-2.3 по качеству генерации, семантическому согласованию и кросс-модальной синхронизации, как при дообучении методом LoRA, так и при полном дообучении. Конкретных числовых показателей или процентов улучшения в тексте не приводится, только качественное утверждение о превосходстве. Абляционные эксперименты, по словам авторов, подтверждают выбранные архитектурные решения. Код и данные проекта выложены в открытом доступе на GitHub.
Ключевые факты
- AV-GRPO, модальность-ориентированный диффузионный фреймворк обучения с подкреплением для совместной генерации аудио и видео
- Фреймворк включает три модуля: привязанные к модальности проходы генерации, оптимизацию с замороженной модальной «башней» и зафиксированной траекторией, адаптивные целевые функции под динамику каждой модальности
- Датасет 5DAV декомпозирует обучающие примеры по пяти измерениям для управляемого по сложности обучения
- На бенчмарках JavisBench и VABench AV-GRPO, по заявлению авторов, превосходит модель LTX-2.3 по качеству, согласованию с текстом и синхронизации звука и видео, при LoRA и при полном дообучении
- Код и данные проекта опубликованы в открытом доступе на GitHub
Почему это важно
Совместная генерация аудио и видео, одна из сложных задач мультимодального ИИ: модели должны одновременно выдавать реалистичную картинку, реалистичный звук и синхронизировать их между собой и с текстовым описанием. Обучение с подкреплением помогает дотягивать качество генеративных моделей после базового обучения, но при двух разнородных модальностях сразу оно упирается в проблему разнородных наград и дорогую совместную оптимизацию. AV-GRPO предлагает разложить эту задачу на управляемые одномодальные подзадачи, что, по заявлению авторов, даёт заметный прирост качества и синхронизации по сравнению с моделью LTX-2.3.
Кому это важно
Работа адресована исследователям и инженерам, занимающимся генеративными моделями видео и аудио, а также тем, кто разрабатывает методы обучения с подкреплением для диффузионных моделей и мультимодальных систем.
Как это применить
Код и обучающие данные (набор 5DAV) выложены авторами в открытом доступе на GitHub, что позволяет другим командам воспроизвести эксперименты, протестировать фреймворк на своих моделях совместной генерации аудио-видео или адаптировать отдельные модули (например, привязанные к модальности проходы генерации) под собственные задачи.
Можно ли доверять
Это исследовательская публикация с открытым кодом и данными, что повышает возможность независимой проверки. Однако в доступном тексте нет конкретных числовых результатов бенчмарков, только качественное утверждение о превосходстве над LTX-2.3, а также отсутствуют имена авторов, их организация и дата публикации, что затрудняет независимую оценку контекста работы.
Риски и подводные камни
Заявленное превосходство над LTX-2.3 не подкреплено в тексте конкретными цифрами или процентами прироста, что не позволяет оценить масштаб улучшения. Также неясно, насколько результаты на бенчмарках JavisBench и VABench обобщаются на реальные сценарии использования за пределами тестовых наборов, и независимого воспроизведения результатов третьими сторонами пока не проводилось.