FlowMimic: новый метод генерирует данные для редактирования видео без масок

Группа исследователей во главе с Dingyun Zhang представила FlowMimic, подход к обучению моделей, которые одновременно генерируют и редактируют изображения и видео в рамках одной сети.
Основная проблема, которую решает работа: сбор обучающих данных для редактирования видео сегодня очень трудоёмкий. Обычный пайплайн требует ручной разметки масок объектов, синтеза пар «до/после» через модель генерации видео из изображения (I2V) в связке с ControlNet-подобным управлением, что вносит собственные ошибки, а затем ещё и фильтрации или доработки результата через VLM (модель, понимающую изображения и текст). Из-за такой дороговизны набор задач редактирования видео, на которых можно обучать модели, получается заметно уже, чем для редактирования обычных изображений, для которых данных много.
Авторы предлагают попиксельное деформированное временное поле потока (warped flow field, аналог оптического потока): оно в реальном времени напрямую превращает уже существующие примеры редактирования изображений в соответствующие примеры редактирования видео, без ручной курации. В работе показано, что модель можно обучить редактированию видео, используя ИСКЛЮЧИТЕЛЬНО такие сгенерированные данные, то есть подход снимает узкое место с дорогим сбором датасетов.
Вторая идея, рассматривать изображение как частный случай видео (кадр из одного элемента). Для этого авторы вводят две функции потерь «имитации модальности», для генерации и для редактирования, которые взаимно выравнивают возможности и распределения выходов модели для изображений и видео через их взаимную имитацию друг другом.
Третья часть работы касается редактирования по текстовой инструкции: модели нужно понять инструкцию, найти в кадре область, к которой она относится, и изменить только эту область. Существующие методы обычно решают это с помощью внешних костылей, дообучают дополнительную MLLM (мультимодальную языковую модель) или явно подают маску нужной области как отдельный вход при инференсе. FlowMimic вместо этого учит модель находить нужную область самостоятельно: в обучение добавлены вспомогательные «сенсорные» задачи вроде referring expression segmentation (сегментация объекта по текстовому описанию) вместе со специальными функциями потерь на уровне латентного пространства и внимания, которые привязаны именно к области редактирования.
Ключевые факты
- Сбор данных для редактирования видео сегодня трудоёмкий: разметка масок, синтез пар через I2V-модель и ControlNet-подобное управление (с ошибками), фильтрация через VLM, из-за этого набор задач редактирования видео заметно уже, чем для изображений
- FlowMimic вводит попиксельное деформированное поле потока, которое в реальном времени превращает данные для редактирования изображений в данные для редактирования видео
- Показано, что модель можно обучить редактированию видео, используя исключительно такие сгенерированные данные, без ручной курации
- Изображение трактуется как частный случай видео; две функции потерь «имитации модальности» выравнивают возможности модели между изображениями и видео
- Для локализации области редактирования без внешних масок или отдельной MLLM добавлены задачи вроде referring expression segmentation и специальные функции потерь на уровне латентного пространства и внимания
Почему это важно
Обучение моделей редактированию видео упирается не в архитектуру, а в данные: собрать качественные пары «исходное видео → отредактированное видео» дорого и медленно, нужны маски объектов, синтез через I2V-модели с ControlNet-подобным управлением (который вносит собственные ошибки) и последующая фильтрация через VLM. Из-за этого набор задач, которым можно обучить модель редактирования видео, заметно уже, чем для редактирования изображений. FlowMimic предлагает способ генерировать такие данные автоматически и в реальном времени из уже существующих датасетов редактирования изображений, что снимает это узкое место.
Кому это важно
Работа адресована исследователям и инженерам, которые строят генеративные модели для видео, редактирование, монтаж, спецэффекты на основе ИИ, а также командам, разрабатывающим мультимодальные модели, способные работать и с изображениями, и с видео в одной сети.
Как это применить
Это исследовательская работа, а не готовый продукт: она описывает метод генерации обучающих данных и набор функций потерь, а не сервис или инструмент с ценой. Применение, методологическое: команда, обучающая модель редактирования видео, может использовать попиксельное поле потока, чтобы автоматически расширять датасет редактирования видео из уже размеченных пар для изображений, и добавить предложенные потери «имитации модальности» и потери, привязанные к области редактирования, чтобы модель сама локализовала нужный участок кадра без внешних масок.
Можно ли доверять
Материал, препринт на HuggingFace Papers (25 очков, 2 комментария на момент сбора), то есть свежая публикация, не прошедшая полноценное рецензирование. В доступном тексте аннотации нет количественных результатов сравнения с другими методами, заявления о качестве и масштабируемости подхода пока опираются на описание метода, а не на приведённые в тексте цифры или бенчмарки.
Риски и подводные камни
Данные, сгенерированные через деформацию поля потока, синтетические по своей природе, они могут содержать собственные артефакты, отличные от ошибок ручной разметки, но не обязательно устранённые полностью. В тексте не упоминаются код или веса модели в открытом доступе, что затрудняет независимую проверку. Способность модели самостоятельно локализовать область редактирования без масок может давать сбои на неоднозначных или сложных текстовых инструкциях, насколько надёжно это работает на разнообразных реальных задачах, по одной аннотации судить нельзя.