VideoCoCo научился генерировать видео через код Blender для физической точности

Модели генерации видео по тексту научились выдавать красивую картинку, но плохо соблюдают физику происходящего: как именно сцена должна развиваться во времени, модели приходится домысливать из короткого и сильно сжатого текстового промпта. Прежние подходы с цепочкой рассуждений (chain-of-thought) пытались решить это через промежуточные планы или визуальные состояния, но такие представления обычно неисполняемы и слишком редки по времени, поэтому не позволяют задать и проконтролировать весь пространственно-временной процесс целиком.
Авторы предлагают VideoCoCo, агентную систему с двумя движками, где роль цепочки рассуждений играет исполняемый код для Blender. По текстовому промпту кодирующий агент пишет программу для Blender, которая явно описывает сцену и то, как она меняется во времени. Движок симуляции запускает эту программу и получает детерминированный пространственно-временной черновик сцены. Затем отдельный генеративный видео-движок превращает этот черновик в фотореалистичное видео методом редактирования, обусловленного черновиком (draft-conditioned editing). Такое разделение выносит рассуждение о процессе на уровень кода, а фотореалистичную картинку доверяет отдельной генеративной модели.
Чтобы адаптировать видео-редактор к работе именно с такими черновыми симуляциями, авторы собрали и обучили модель на датасете VideoCoCo-3K, наборе троек «черновик, инструкция, целевой кадр».
На бенчмарке PhyGenBench метод поднял результат базовой модели OmniWeaving с 0,475 до 0,558, а на VBench-2.0, с 52,18 до 77,88, показав лучший средний результат среди сравниваемых методов на обоих тестах. Авторы делают вывод, что исполняемый код, эффективное, управляемое и проверяемое промежуточное представление для физически достоверной генерации видео.
Ключевые факты
- Text-to-video модели плохо соблюдают физику сцены, потому что её развитие во времени приходится домысливать из сжатого текстового промпта.
- VideoCoCo решает это агентной системой из двух движков: кодирующий агент пишет исполняемую программу для Blender, движок симуляции считает по ней черновую пространственно-временную раскладку сцены, а генеративный видео-движок превращает черновик в фотореалистичное видео.
- Для адаптации видео-редактора к таким черновикам авторы собрали датасет VideoCoCo-3K из троек «черновик, инструкция, целевой кадр».
- На PhyGenBench метод поднял оценку базовой модели OmniWeaving с 0,475 до 0,558, а на VBench-2.0, с 52,18 до 77,88, показав лучший средний результат на обоих бенчмарках.
- Вывод авторов: исполняемый код, эффективное, управляемое и проверяемое промежуточное представление для физически достоверной генерации видео.
Почему это важно
Главная проблема генерации видео по тексту, не картинка, а физика: объекты проходят сквозь друг друга, движение не подчиняется законам механики, потому что модель вынуждена домысливать развитие сцены во времени из короткого промпта. VideoCoCo предлагает не улучшать саму генеративную модель, а вставить между промптом и видео исполняемый код для Blender, программу, которая явно и детерминированно задаёт, как сцена меняется во времени, прежде чем к делу подключается генеративная модель.
Кому это важно
Разработчикам систем генерации видео и исследователям в области физически достоверного моделирования сцен, подход даёт способ проверять и контролировать процесс, а не только конечную картинку. Потенциально полезно и индустриям, где важна физическая правдоподобность симуляции: спецэффектам, играм, обучению роботов через синтетическое видео.
Как это применить
Работа пока академическая: авторы описывают архитектуру и публикуют код и собранный ими датасет VideoCoCo-3K с тройками «черновик, инструкция, целевой кадр», на котором обучался видео-редактор. Готового продукта или публичного доступа к самой системе в тексте не упомянуто, это исследовательский прототип, показывающий работоспособность подхода на бенчмарках.
Можно ли доверять
Результаты измерены на признанных в индустрии бенчмарках PhyGenBench и VBench-2.0, с конкретными числами до и после. Материал опубликован в разделе научных статей Hugging Face, набрал 60 очков и всего 1 комментарий, независимой проверки или широкого обсуждения результатов пока не было, это заявление одной исследовательской группы, а не подтверждённый индустрией стандарт.
Риски и подводные камни
Подход завязан на возможности Blender: сложные или абстрактные сцены, которые нельзя явно описать симуляционным кодом, могут остаться вне охвата метода. Улучшение на двух конкретных бенчмарках не гарантирует такого же выигрыша на других сценариях и в проде. Двухдвижковая архитектура, сначала код и симуляция, потом отдельная генеративная модель, добавляет вычислительные шаги по сравнению с прямой генерацией видео по тексту, и цена этого пайплайна в тексте не оценивается.