CoinVE-200K, датасет и модель для составного редактирования видео по инструкциям

Большинство датасетов для редактирования видео по текстовым инструкциям устроены под одну правку за раз: убрать один объект, поменять один фон. Авторы новой работы указывают на пробел, реальные задачи редактирования почти всегда составные: несколько разных намерений нужно понять и честно исполнить в одном и том же видео одновременно. Чтобы закрыть этот пробел, они представляют CoinVE-200K, крупный датасет для составного редактирования видео по инструкциям.
CoinVE-200K состоит из пар «видео до / видео после» в разрешении 1080p и длиной до 201 кадра; в каждом примере нужно выполнить от 2 до 5 элементарных правок сразу. Правки затрагивают людей, отдельные объекты и фон, а среди типов правок в тексте названы добавление, удаление, изменение и стилизация, с оговоркой «такие как», то есть список не заявлен как исчерпывающий. По описанию авторов, все примеры прошли через тщательно спроектированный пайплайн генерации и фильтрации (generation and filtering pipeline), который должен обеспечивать точное следование инструкции, визуальное качество, временную согласованность кадров и разнообразие сочетаний правок. Точное число пар в датасете в тексте отдельно не приводится, на масштаб «200 тысяч» указывает только само название CoinVE-200K.
Вместе с датасетом авторы выпускают бенчмарк CoinVE-Bench, набор для оценки составного редактирования видео на разных сюжетах, типах операций и уровнях сложности инструкций. А также модель CoinVE-Edit, 22-миллиардную (22B) модель редактирования видео, построенную поверх видеогенератора Wan2.1-T2V-14B (14 млрд параметров) и визуально-языковой модели Qwen3-VL-8B-Instruct (8 млрд параметров). Ключевая идея архитектуры, внимание, разделённое по регионам кадра (region-aware attention), для разных инструкций: оно должно позволять точно править несколько зон кадра по отдельности, не затрагивая остальное содержимое и сохраняя связность видео во времени.
По утверждению авторов, в экспериментах на CoinVE-Bench модель CoinVE-Edit показывает высокое качество по всем ключевым параметрам, точности следования инструкциям, точности составного редактирования, визуальному качеству и временной согласованности кадров. Конкретные числовые оценки, баллы, проценты, сравнение с другими моделями, в тексте не приведены.
Ключевые факты
- CoinVE-200K, видео в разрешении 1080p длиной до 201 кадра, где в каждом примере нужно выполнить от 2 до 5 правок сразу: это и есть составное редактирование по нескольким инструкциям.
- Правки затрагивают людей, объекты и фон; среди типов названы добавление, удаление, изменение и стилизация (список открытый, не исчерпывающий).
- Вместе с датасетом выходит бенчмарк CoinVE-Bench для оценки составного редактирования видео по разным сюжетам и уровням сложности инструкций.
- Модель CoinVE-Edit на 22 млрд параметров построена на видеогенераторе Wan2.1-T2V-14B и визуально-языковой модели Qwen3-VL-8B-Instruct, с вниманием, разделённым по регионам кадра, для разных инструкций.
- Авторы, дата выхода, доступность кода и точное число примеров в датасете в тексте не указаны; заявленные результаты на CoinVE-Bench даны без конкретных цифр.
Почему это важно
Большинство существующих датасетов для редактирования видео по инструкциям рассчитаны на одну правку за раз. Но реальные сценарии редактирования почти всегда составные: нужно одновременно изменить несколько элементов кадра так, чтобы модель верно поняла и выполнила все намерения сразу, не потеряв качество картинки и связность видео во времени. CoinVE-200K, бенчмарк CoinVE-Bench и модель CoinVE-Edit, попытка закрыть именно этот пробел: инфраструктура, спроектированная под несколько одновременных правок, а не под единичную операцию.
Кому это важно
В первую очередь, исследовательским командам и инженерам, которые обучают модели редактирования видео по текстовым инструкциям: у них появляется готовый датасет и отдельный бенчмарк именно под составные правки. Также это может быть интересно разработчикам инструментов генеративного видео и монтажа, которые ищут архитектурные решения для точечного редактирования нескольких зон кадра без искажения остального содержимого.
Как это применить
Практически это три связанных, но разных инструмента. CoinVE-200K подходит для обучения и дообучения моделей редактирования видео на составных инструкциях. CoinVE-Bench, отдельный набор для проверки таких моделей на разных сюжетах, типах операций и уровнях сложности, то есть общая линейка сравнения разных подходов. CoinVE-Edit показывает один из вариантов архитектуры: взять готовый видеогенератор (Wan2.1-T2V-14B) и визуально-языковую модель (Qwen3-VL-8B-Instruct), добавить поверх внимание, разделённое по регионам кадра, так, чтобы каждая инструкция применялась к своей части кадра, не задевая остальное. В тексте не указаны ни дата выхода, ни доступность кода, весов модели или самого датасета, ни условия использования, это стоит уточнять отдельно, прежде чем на что-то опираться.
Можно ли доверять
Это описание самих авторов работы. Текст не называет ни одного человека или организации по имени, в карточке HuggingFace как автор указан Fuchen Long, но в самом тексте статьи это имя не встречается: похоже, это запись каталога, а не факт из текста. Не указаны ни дата публикации, ни доступность кода, весов модели или датасета, ни сравнение с показателями других датасетов и моделей. Оценка «высокое качество по всем ключевым параметрам» дана без конкретных числовых значений, а измерена она на бенчмарке CoinVE-Bench, который создали те же авторы, независимой проверки этих результатов пока нет.
Риски и подводные камни
Датасет и бенчмарк построены через собственный пайплайн генерации и фильтрации, то есть видео и правки, судя по формулировке, скорее сгенерированы и автоматически отобраны, чем сняты и размечены вручную; насколько это переносится на реальное видео пользователей, в тексте не разбирается. Модель оценена на бенчмарке, который сделали те же, кто делал модель, типичный риск такой связки в том, что собственный бенчмарк может оказаться удобнее именно для своей модели, чем для сторонних решений. Сравнительных чисел с предыдущими датасетами или моделями в тексте нет, поэтому оценить реальный масштаб улучшения, а не только факт его наличия, пока невозможно. Доступность самого датасета, кода и весов модели тоже никак не оговорена, без этого стороннему разработчику сложно воспроизвести или проверить результаты.