InfinityEdit научился бесконечно редактировать видеопоток

InfinityEdit научился бесконечно редактировать видеопоток

Большинство существующих методов редактирования видео по текстовой инструкции исходят из того, что ролик уже полностью отснят и статичен: они покадрово выравнивают отредактированную версию с исходным клипом в пределах фиксированного отрезка времени. Для открытых видеопотоков без заранее известного конца, например, при стилизации прямой трансляции игры или изменении движения камеры в уже идущей съёмке, такой подход не работает: правка должна распространяться на кадры, которые ещё не сгенерированы, по мере их появления, а не применяться к уже целиком заданному статичному клипу.

Авторы формализуют этот сценарий как «бесконечное редактирование видео»: получив предыдущий сегмент потока и новый запрос на правку, модель должна сгенерировать следующий сегмент, который продолжает поток и одновременно применяет запрошенную правку, и так при неограниченной последовательности запросов. У задачи два вызова: правка обязана быть достоверным продолжением потока, а не покадровой переписью, а качество генерации не должно проседать по мере накопления правок.

Чтобы решить эту задачу, авторы сначала построили конвейер сбора данных для бесконечного редактирования видео, а на основе собранных данных предложили InfinityEdit, лёгкий адаптер, который наделяет потоковую модель генерации видео способностью редактировать поток без ограничения по времени. Адаптер состоит из трёх модулей внимания: History cross-attention (кросс-внимание к истории кадров) направляет шумоподавление новых кадров, опираясь на уже сгенерированные входные кадры; Temporal causal self-attention (каузальное самовнимание по времени) заставляет временные признаки перетекать только от более ранних кадров к более поздним; Edit cross-attention (кросс-внимание к правке) встраивает запрошенную правку в процесс генерации.

При выводе адаптер включается только в том фрагменте потока, где поступает новый запрос на правку; все последующие фрагменты снова генерирует исходная потоковая модель, с обновлённым, сброшенным опорным кадром. Такая схема применяет правку, не теряя способности исходной модели генерировать видео бесконечно. Авторы сообщают, что обширные эксперименты показали: InfinityEdit достоверно продолжает поток при каждой правке и остаётся стабильным при неограниченной последовательности правок, но конкретных цифр, сравнений с другими методами или данных о размере адаптера в тексте не приведено.

Ключевые факты

  • Новая постановка задачи, «бесконечное редактирование видео»: правка применяется к продолжающемуся потоку кадров, а не к уже целиком готовому клипу.
  • Проблема существующих методов: они выравнивают отредактированную версию с исходником покадрово в пределах фиксированного отрезка времени и не годятся для открытых потоков, например, для стилизации прямой трансляции игры или изменения движения камеры в уже идущей съёмке.
  • Решение, InfinityEdit, лёгкий адаптер с тремя модулями внимания: History cross-attention (учитывает предыдущие кадры при подавлении шума), Temporal causal self-attention (не даёт информации течь из будущих кадров в прошлые) и Edit cross-attention (встраивает команду правки в генерацию).
  • При выводе адаптер работает только в том фрагменте потока, где поступила новая правка; дальше поток снова ведёт исходная модель с обновлённым опорным кадром, так сохраняется её способность генерировать видео без ограничения по времени.

Почему это важно

Большинство инструментов правки видео по инструкции считают ролик уже готовым и статичным: они выравнивают отредактированную версию с исходным клипом покадрово в пределах заранее известного отрезка времени. Для открытых, ещё не завершённых потоков, прямой трансляции игры, съёмки с движущейся камерой, это не работает: там правка должна распространяться на кадры, которых ещё не существует, а не переписывать уже отснятый материал. Авторы формализуют такой сценарий как «бесконечное редактирование видео» и называют два вызова, которые он ставит: правка обязана быть достоверным продолжением, а не покадровой переписью, а качество генерации не должно проседать по мере накопления правок.

Кому это важно

В первую очередь, исследователям и инженерам, которые занимаются потоковой генерацией видео и живым редактированием: стилизацией трансляций, эффектами для игровых стримов, правкой движения камеры «на ходу». Кода, модели или датасета в тексте не упомянуто, поэтому конечным пользователям видеосервисов работа пока не даёт ничего практического, её аудитория узкая, это специалисты, которые следят за развитием генеративных видеомоделей.

Как это применить

Готового инструмента для использования нет: в тексте не указаны ни код, ни веса модели, ни датасет, ни даже название базовой потоковой модели, на которую ставится адаптер. Практическая ценность работы, в самой идее: раз InfinityEdit описан как лёгкий адаптер, а не отдельная модель, обученная с нуля, тот же принцип, три модуля внимания плюс включение адаптера только в момент прихода новой команды правки, в теории можно переносить на другие потоковые генераторы видео, не переобучая их целиком. Но до публикации кода это остаётся идеей, а не готовым к использованию решением.

Можно ли доверять

Источник, карточка статьи на Hugging Face Papers. Сама аннотация не называет исследователей или организацию текстом: в служебных данных страницы значится имя Yunze Tong, но в тексте абстракта оно не встречается; место и дата публикации тоже не указаны. Числовых результатов, сравнений с другими методами или данных о размере адаптера в тексте нет, утверждения о «достоверном продолжении потока» и «стабильности» опираются на слова самих авторов, а не на приведённые показатели. Это повод отнестись к результатам с осторожностью до независимой проверки или публикации кода.

Риски и подводные камни

Конкретных цифр, сравнения с другими методами и данных о размере адаптера в тексте нет, заявления о «достоверном продолжении» и «стабильности» пока не подкреплены измеримыми показателями. Базовая потоковая модель генерации видео, на которую ставится адаптер, в тексте не названа, поэтому неясно, насколько подход переносится на другие системы. Код, веса модели или датасет для проверки результатов не упомянуты, независимо повторить эксперимент сейчас нельзя. Это одна научная работа по узкой, только формирующейся задаче, и до стороннего подтверждения её выводы стоит считать предварительными.

«Правки должны распространяться на будущие кадры по мере их появления, а не применяться к статичному входному клипу.»

— авторы статьи