Представлена WorldGuide: видеомодель сама планирует шаги задачи

Видеогенераторы и видеомодели мира умеют создавать правдоподобные визуальные траектории, но для длинных процедурных задач этого мало: модель должна по уже сгенерированному состоянию определить следующее действие, выполнить его и понять, что задача завершена. Открытая (разомкнутая) генерация не умеет подстраиваться под результат выполнения, а существующие системы с обратной связью, по словам авторов, часто опираются на заранее обученные исполнители или косвенную проверку. Из-за этого остаётся разрыв между решением о действии и его реальным воплощением.
Авторы формулируют процедурную генерацию видео как выполнение задачи в замкнутом цикле в визуальном пространстве мира и предлагают WorldGuide. На входе только начальное изображение и цель задачи. Модель предсказывает атомарное действие, генерирует соответствующий видеоклип и по сгенерированному результату выбирает следующее действие или завершает работу. Планировщик и Исполнитель обучены на одних и тех же пошаговых процедурных демонстрациях: Планировщик учится по визуальному прогрессу предсказывать следующее действие или завершение задачи, а Исполнитель обучен напрямую воплощать предсказанные действия. Иерархическая визуальная память хранит состояние на длинном горизонте выполнения при ограниченной стоимости истории в токенах.
Поскольку пошаговой разметки «действие, видео» для совместного обучения планировщика и исполнителя не хватало, авторы создали WorldGuide Bench: около 59 тыс. видео с разметкой по шагам, 245 задач и 27 процедурных категорий.
Результаты: на WorldGuide-Bench успешность выполнения задачи (Task Success) у WorldGuide составила 33,33% против 29,90% у недавней сильной видеомодели MiniMax-H3, причём MiniMax-H3 получала эталонные планы действий. На VideoCraft-Bench WorldGuide набрала 47,69% против 32,73% у MiniMax-H3 при условии «только цель». Авторы делают вывод, что результаты показывают важность связки планирования с обучаемым исполнением для целенаправленной генерации процедурных видео.
Ключевые факты
- WorldGuide работает в замкнутом цикле: по начальному изображению и цели предсказывает атомарное действие, генерирует клип и по результату выбирает следующее действие или завершает задачу.
- Планировщик и Исполнитель обучены на одних и тех же пошаговых демонстрациях; иерархическая визуальная память держит состояние на длинном горизонте при ограниченной стоимости истории в токенах.
- Для обучения создан WorldGuide Bench: около 59 тыс. видео с пошаговой разметкой, 245 задач, 27 процедурных категорий.
- На WorldGuide-Bench WorldGuide набрала 33,33% Task Success против 29,90% у MiniMax-H3, которой дали эталонные планы действий.
- На VideoCraft-Bench результат 47,69% против 32,73% у MiniMax-H3 при условии «только цель».
Почему это важно
Работа затрагивает слабое место видеомоделей: они хорошо рисуют правдоподобные кадры, но длинные процедурные задачи требуют, чтобы каждое следующее действие зависело от того, что уже получилось, а модель сама понимала, когда остановиться. WorldGuide замыкает этот цикл внутри одной системы: планирует, генерирует результат и по нему решает, что делать дальше. Авторы утверждают, что именно связка планирования с обучаемым исполнением даёт выигрыш.
Кому это важно
Исследователям видеомоделей и моделей мира, а также тем, кто занимается генерацией длинных пошаговых процедур. Работа затрагивает вопрос, как совместно обучать планировщик и исполнитель. Новый набор WorldGuide Bench с пошаговой разметкой видео может пригодиться как пример данных для такой задачи, но в источнике не сказано, будет ли он опубликован.
Как это применить
Практического применения в текущем виде нет: в источнике не упомянуты выпуск кода, весов модели или датасета, не приведены размер модели, вычислительные затраты на обучение и стоимость вывода. Идею можно взять как схему: пошаговый цикл «действие, клип, оценка результата, следующее действие или остановка» с общими демонстрациями для планировщика и исполнителя.
Можно ли доверять
Это самоотчёт авторов: результаты получены на собственном бенчмарке WorldGuide-Bench и на VideoCraft-Bench, о котором в источнике нет подробностей. В тексте не определено, как именно считается Task Success. Условия для MiniMax-H3 на двух бенчмарках различались: на WorldGuide-Bench она получала эталонные планы действий, на VideoCraft-Bench работала при условии «только цель». Разрыв на WorldGuide-Bench невелик: 3,43 п.п. (33,33% против 29,90%), на VideoCraft-Bench, 14,96 п.п. (47,69% против 32,73%). Других результатов, абляций и сравнений с иными базовыми моделями в источнике нет; авторы и организации в аннотации не названы.
Риски и подводные камни
Абсолютные значения успешности невысоки: 33,33% на собственном бенчмарке означает, что большинство задач выполнено не было. Работа касается именно сгенерированного видео, сведений о применении в реальных или роботизированных системах в источнике нет. Преимущество над MiniMax-H3 показано в разных условиях подачи информации на двух бенчмарках, поэтому прямое сравнение двух цифр между тестами некорректно.
«Эти результаты демонстрируют важность сочетания планирования с обучаемым исполнением для целенаправленной генерации процедурных видео.»
— из аннотации статьи о WorldGuide