VideoCoCo научился генерировать видео через код Blender для физической точности

VideoCoCo научился генерировать видео через код Blender для физической точности

Модели генерации видео по тексту научились выдавать красивую картинку, но плохо соблюдают физику происходящего: как именно сцена должна развиваться во времени, модели приходится домысливать из короткого и сильно сжатого текстового промпта. Прежние подходы с цепочкой рассуждений (chain-of-thought) пытались решить это через промежуточные планы или визуальные состояния, но такие представления обычно неисполняемы и слишком редки по времени, поэтому не позволяют задать и проконтролировать весь пространственно-временной процесс целиком.

Авторы предлагают VideoCoCo, агентную систему с двумя движками, где роль цепочки рассуждений играет исполняемый код для Blender. По текстовому промпту кодирующий агент пишет программу для Blender, которая явно описывает сцену и то, как она меняется во времени. Движок симуляции запускает эту программу и получает детерминированный пространственно-временной черновик сцены. Затем отдельный генеративный видео-движок превращает этот черновик в фотореалистичное видео методом редактирования, обусловленного черновиком (draft-conditioned editing). Такое разделение выносит рассуждение о процессе на уровень кода, а фотореалистичную картинку доверяет отдельной генеративной модели.

Чтобы адаптировать видео-редактор к работе именно с такими черновыми симуляциями, авторы собрали и обучили модель на датасете VideoCoCo-3K, наборе троек «черновик, инструкция, целевой кадр».

На бенчмарке PhyGenBench метод поднял результат базовой модели OmniWeaving с 0,475 до 0,558, а на VBench-2.0, с 52,18 до 77,88, показав лучший средний результат среди сравниваемых методов на обоих тестах. Авторы делают вывод, что исполняемый код, эффективное, управляемое и проверяемое промежуточное представление для физически достоверной генерации видео.

Ключевые факты

  • Text-to-video модели плохо соблюдают физику сцены, потому что её развитие во времени приходится домысливать из сжатого текстового промпта.
  • VideoCoCo решает это агентной системой из двух движков: кодирующий агент пишет исполняемую программу для Blender, движок симуляции считает по ней черновую пространственно-временную раскладку сцены, а генеративный видео-движок превращает черновик в фотореалистичное видео.
  • Для адаптации видео-редактора к таким черновикам авторы собрали датасет VideoCoCo-3K из троек «черновик, инструкция, целевой кадр».
  • На PhyGenBench метод поднял оценку базовой модели OmniWeaving с 0,475 до 0,558, а на VBench-2.0, с 52,18 до 77,88, показав лучший средний результат на обоих бенчмарках.
  • Вывод авторов: исполняемый код, эффективное, управляемое и проверяемое промежуточное представление для физически достоверной генерации видео.

Почему это важно

Главная проблема генерации видео по тексту, не картинка, а физика: объекты проходят сквозь друг друга, движение не подчиняется законам механики, потому что модель вынуждена домысливать развитие сцены во времени из короткого промпта. VideoCoCo предлагает не улучшать саму генеративную модель, а вставить между промптом и видео исполняемый код для Blender, программу, которая явно и детерминированно задаёт, как сцена меняется во времени, прежде чем к делу подключается генеративная модель.

Кому это важно

Разработчикам систем генерации видео и исследователям в области физически достоверного моделирования сцен, подход даёт способ проверять и контролировать процесс, а не только конечную картинку. Потенциально полезно и индустриям, где важна физическая правдоподобность симуляции: спецэффектам, играм, обучению роботов через синтетическое видео.

Как это применить

Работа пока академическая: авторы описывают архитектуру и публикуют код и собранный ими датасет VideoCoCo-3K с тройками «черновик, инструкция, целевой кадр», на котором обучался видео-редактор. Готового продукта или публичного доступа к самой системе в тексте не упомянуто, это исследовательский прототип, показывающий работоспособность подхода на бенчмарках.

Можно ли доверять

Результаты измерены на признанных в индустрии бенчмарках PhyGenBench и VBench-2.0, с конкретными числами до и после. Материал опубликован в разделе научных статей Hugging Face, набрал 60 очков и всего 1 комментарий, независимой проверки или широкого обсуждения результатов пока не было, это заявление одной исследовательской группы, а не подтверждённый индустрией стандарт.

Риски и подводные камни

Подход завязан на возможности Blender: сложные или абстрактные сцены, которые нельзя явно описать симуляционным кодом, могут остаться вне охвата метода. Улучшение на двух конкретных бенчмарках не гарантирует такого же выигрыша на других сценариях и в проде. Двухдвижковая архитектура, сначала код и симуляция, потом отдельная генеративная модель, добавляет вычислительные шаги по сравнению с прямой генерацией видео по тексту, и цена этого пайплайна в тексте не оценивается.