MMLVE-Agent обошёл Seedance 2.0 в согласованном монтаже многокадрового видео

Генеративный ИИ заметно продвинул редактирование видео по текстовым инструкциям, но существующие методы рассчитаны в основном на один кадр или короткий ролик целиком. Как только видео становится длинным и состоит из нескольких кадров (отдельных непрерывных сцен, из которых оно смонтировано), а править его нужно сразу по нескольким инструкциям, эти методы перестают справляться. Простая нарезка длинного ролика на куски фиксированной длительности с раздельным редактированием каждого куска на практике ломает результат: сущности (например, персонажи или предметы) фрагментируются и теряют целостность на стыках кусков, у модели возникают серьёзные «галлюцинации» правки, она вносит изменения, которых не просили, а временная непрерывность видео разрывается.
Чтобы закрыть этот разрыв, авторы формализуют новую задачу, Multi-Instruction Multi-Shot Long-Video Editing (MMLVE, монтаж длинных многокадровых видео сразу по нескольким инструкциям). Она строится вокруг трёх целей: согласованность правок между кадрами (Cross-Shot Editing Consistency, CSEC), отредактированная сущность должна выглядеть одинаково во всех кадрах, где появляется; разделение нескольких инструкций (Multi-Instruction Decoupling, MID), правки по разным командам не должны путаться или накладываться друг на друга; и нулевое разрушение пространственно-временной структуры (Zero-Destruction on Spatiotemporal Structure, ZDSS), исходная геометрия сцены и течение времени там, где правки не просили, должны остаться нетронутыми.
Чтобы решить все три задачи разом, авторы предлагают агентный фреймворк для редактирования, MMLVE-Agent, который использует связку больших языковых моделей (LLM) и визуально-языковых моделей (VLM): LLM разбирает и разделяет несколько текстовых инструкций, VLM отвечает за визуальное понимание содержимого, а вместе они разбивают длинное видео на кадры как отдельные единицы обработки и точно сопоставляют каждую инструкцию с нужным кадром и сущностью.
Для всесторонней оценки задачи авторы также построили MMLVE-Bench, датасет, отличающийся сложной реалистичной пространственно-временной динамикой, плотными и разнородными по типу инструкциями и редким, случайным расположением сущностей в кадре. Качество результатов правки на этом датасете дополнительно измеряется тремя специализированными метриками, разработанными именно под задачу MMLVE; их конкретные названия и методика расчёта в тексте не раскрываются.
По словам авторов, обширные эксперименты показывают, что MMLVE-Agent превосходит существующие передовые закрытые решения, в частности Seedance 2.0: система устраняет галлюцинации правки, сохраняет согласованность между кадрами и обеспечивает бесшовные пространственно-временные переходы между ними. Конкретных цифр, процентов или таблиц сравнения в тексте не приведено, это качественное заявление по итогам экспериментов самих авторов, без сопровождающих чисел.
Ключевые факты
- Новая задача, Multi-Instruction Multi-Shot Long-Video Editing (MMLVE): редактирование длинных видео из нескольких кадров сразу по нескольким инструкциям; строится вокруг трёх целей, согласованность правок между кадрами (CSEC), разделение нескольких инструкций (MID) и нулевое разрушение пространственно-временной структуры видео (ZDSS).
- Наивная нарезка длинного видео на куски фиксированной длительности дробит сущности на стыках, провоцирует «галлюцинации» правки и рвёт временную непрерывность, именно эту проблему решает работа.
- Предложенное решение, MMLVE-Agent, агентный фреймворк на связке LLM (разбор и разделение инструкций) и VLM (визуальное понимание), который разбивает видео на кадры для раздельной, но согласованной обработки.
- Для оценки построен датасет MMLVE-Bench со сложной реалистичной пространственно-временной динамикой, плотными разнородными инструкциями и редким случайным расположением сущностей в кадре, плюс три специализированные метрики качества правки.
- По словам авторов, MMLVE-Agent превосходит существующие передовые закрытые решения, включая Seedance 2.0: устраняет галлюцинации правки, сохраняет согласованность между кадрами и обеспечивает бесшовные пространственно-временные переходы, но точных цифр сравнения в статье нет.
Почему это важно
Сегодняшние инструменты редактирования видео по текстовым инструкциям хорошо справляются с одним кадром или коротким роликом целиком, но как только видео становится длинным и состоит из нескольких кадров, а править его нужно сразу по нескольким инструкциям, они начинают ошибаться: простая нарезка на куски фиксированной длины дробит сущности на стыках, провоцирует «галлюцинации» правки и рвёт временную непрерывность. Это реальный разрыв между тем, что умеют модели генеративного видео сегодня, и тем, как на самом деле устроен монтаж, фильм, влог или рекламный ролик почти никогда не состоят из одного кадра. Работа впервые формализует эту задачу как MMLVE с тремя конкретными целями и предлагает агентный ответ на связке LLM и VLM, это шаг от демонстраций «один ролик, одна правка» к редактированию, которое остаётся согласованным на протяжении целой многокадровой сцены.
Кому это важно
В первую очередь, исследователям и инженерам, которые занимаются генеративным видео и редактированием по инструкциям: для них MMLVE даёт формальную постановку задачи и метрики, а MMLVE-Agent, конкретную архитектуру для сравнения. В перспективе это важно и командам, которые строят инструменты пост-продакшена для создателей контента, блогеров и рекламы, где видео почти всегда состоит из нескольких кадров, а правки нужно вносить сразу по нескольким пунктам технического задания. Но поскольку в тексте не упомянуты ни код, ни веса модели, ни релиз датасета, сегодня прямая аудитория работы, исследовательское сообщество, которое следит за развитием генеративного видео, а не конечные пользователи, которые могли бы попробовать систему уже сейчас.
Как это применить
Готового инструмента для использования нет: в тексте не упомянуты ни код, ни веса модели MMLVE-Agent, ни релиз датасета MMLVE-Bench. Переносимая идея, архитектурная: разбивать длинное видео на кадры как отдельные единицы обработки, поручать LLM разбор и разделение нескольких текстовых инструкций, а VLM, визуальное понимание содержимого каждого кадра. Этот принцип в теории может лечь в основу будущих инструментов редактирования видео, коммерческих или открытых, которым нужно обрабатывать длинные многокадровые ролики сразу по нескольким правкам. До публикации кода или релиза это остаётся архитектурной идеей, а не готовым к использованию решением.
Можно ли доверять
Источник, карточка статьи на Hugging Face Papers, то есть, по сути, препринт. Сам текст аннотации не называет ни авторов, ни организацию, стоящую за работой: в служебных метаданных страницы значится имя Chenyang Wu, но в тексте абстракта оно не встречается, и неизвестно, идёт ли речь об одном авторе или о более широком коллективе. Ключевое заявление, что MMLVE-Agent превосходит существующие передовые закрытые решения вроде Seedance 2.0, сформулировано качественно: ни чисел, ни процентов, ни таблицы сравнения в тексте нет, это вывод самих авторов по итогам их собственных «обширных экспериментов», не подкреплённый публично видимыми цифрами. Сам бенчмарк MMLVE-Bench, на котором измеряется это превосходство, построен теми же авторами, что предлагают метод. Пока код, веса модели и датасет не опубликованы, независимо перепроверить результат нельзя, к заявлению стоит относиться с осторожностью.
Риски и подводные камни
Главный риск, полное отсутствие количественных данных: утверждение о превосходстве над Seedance 2.0 не подкреплено в тексте ни одним числом, процентом или таблицей, оценить реальный масштаб улучшения невозможно. Бенчмарк MMLVE-Bench, на котором измеряется это превосходство, создан теми же авторами, что предлагают сам метод, а независимой проверки или стороннего воспроизведения результатов пока нет. Размер MMLVE-Bench, сколько в нём видео, кадров или инструкций, в тексте не указан, как и статус публикации, кода, весов модели или датасета: воспроизвести эксперимент самостоятельно сейчас нельзя. Для сравнения используется закрытая система Seedance 2.0, доступа к которой у сторонних наблюдателей нет, проверить именно этот пункт независимо нельзя.
«Обширные эксперименты показывают, что наш MMLVE-Agent превосходит существующие передовые закрытые решения (например, Seedance 2.0), успешно устраняя галлюцинации правки, сохраняя согласованность между кадрами и достигая бесшовных пространственно-временных переходов.»
— авторы статьи