JoyAI-Echo-1.5: система генерации аудио и видео возглавила рейтинг WBench

JoyAI-Echo-1.5: система генерации аудио и видео возглавила рейтинг WBench

Генерация видео развивается от отдельных коротких клипов к связным долгим историям и интерактивным мирам. Для этого моделям нужно сохранять внешность и голос персонажей на протяжении всего повествования, следовать управлению пользователя и оставаться стабильными на длинных прогонах генерации. Чтобы решить эту задачу, исследователи представили JoyAI-Echo-1.5, единую систему генерации аудио и видео с двумя специализированными вариантами.

Первый вариант, для «длинного видео», нацелен на связные истории из нескольких кадров-сцен (shots). В его основе, составная межкадровая память (cross-shot memory), которая накапливает визуальные свидетельства сразу из нескольких предыдущих кадров, и подсказки о говорящем, извлечённые из отфильтрованной по речи звуковой дорожки всего кадра целиком. Это позволяет сохранять устойчивую внешность персонажа и его голос на протяжении истории при гибких комбинациях текстового, визуального и «памятного» управления генерацией.

Второй вариант, «модель мира», превращает разнородные команды навигации в откалиброванные метрические траектории камеры с шестью степенями свободы (6-DoF) и передаёт их модели через геометрически осведомлённый канал обусловливания. Это делает взаимодействие независимым от типа контроллера ввода и позволяет свободно менять точку обзора.

Чтобы генерация на длинном горизонте была эффективной, авторы преобразовали двунаправленную аудиовизуальную базовую модель (backbone) в каузальный генератор с малым числом шагов. Для этого использовались прогрессивное обучение с учителем (teacher forcing) и метод Self-Gradient Forcing на коротком и длинном горизонте, применённый к прогонам генерации, произведённым самой моделью.

По заявлению авторов, JoyAI-Echo-1.5 превосходит существующие базовые модели для длинного видео по согласованности между кадрами, визуальному качеству, соответствию тексту и качеству воспроизведения речи, конкретных числовых показателей для этого сравнения в статье не приведено. Вариант «модель мира» занял первое место в бенчмарке WBench со средним баллом 81,7 и показал лучшее визуальное качество и устойчивость на длинном горизонте в бенчмарке SANA-WM-Bench. Авторы делают вывод, что память, геометрическое управление и обучение с учётом прогонов генерации образуют практическую основу для создания связных историй и постоянно развивающихся интерактивных миров.

Имена авторов и организация-разработчик в тексте статьи не указаны, как и сроки выпуска, наличие кода, весов модели или публичного демо, доступна только страница проекта.

Ключевые факты

  • JoyAI-Echo-1.5, единая система генерации аудио и видео с двумя вариантами: для длинных историй и для интерактивных миров
  • Вариант для длинных историй использует межкадровую память и голосовые подсказки из речи, чтобы сохранять внешность и голос персонажа на протяжении сюжета
  • Вариант «модель мира» превращает команды навигации в 6-DoF траектории камеры и работает независимо от типа контроллера
  • Вариант «модель мира» занял первое место в бенчмарке WBench (81,7 балла) и лидирует по визуальному качеству и устойчивости в SANA-WM-Bench
  • Имена авторов, организация и сроки выпуска кода/весов/демо в статье не указаны, доступна только страница проекта

Почему это важно

Генерация видео сейчас упирается в две проблемы: персонажи «плывут» в лице и голосе от кадра к кадру, а взаимодействовать со сгенерированным миром почти невозможно, камерой нельзя управлять предсказуемо. JoyAI-Echo-1.5 нацелена ровно на эти два узких места сразу: устойчивую идентичность персонажа на длинной истории и предсказуемое, геометрически точное управление точкой обзора в интерактивном мире.

Кому это важно

Инженерам и исследователям, работающим над генерацией видео и аудио; студиям и разработчикам интерактивных медиа и игр, которые изучают ИИ-генерируемые миры; создателям длинного видеоконтента и анимации, для которых критична согласованность персонажей на протяжении сюжета.

Как это применить

Практически применить систему пока нельзя: в статье не указаны ни код, ни веса модели, ни публичное демо, только ссылка на страницу проекта. Сроки и условия возможного релиза не раскрыты, поэтому речь пока идёт об исследовательской публикации, а не о доступном инструменте.

Можно ли доверять

Заявленные результаты, первое место в WBench (81,7 балла) и лидерство в SANA-WM-Bench, приведены авторами самими, независимой проверки третьей стороной в статье нет. Улучшения над базовыми моделями для длинного видео описаны только качественно, без конкретных цифр сравнения. Имена авторов и организация-разработчик в тексте не названы, что не позволяет оценить репутацию команды.

Риски и подводные камни

Метрики самоотчётные и не проверены независимо; без опубликованного кода или весов воспроизвести и протестировать результаты нельзя. Сама способность системы стабильно сохранять внешность и голос персонажа на протяжении длинной истории, это же свойство, которое потенциально может использоваться для создания правдоподобного длинного видео с чужой внешностью и голосом без согласия человека.