Представлена WorldGuide: видеомодель сама планирует шаги задачи

Представлена WorldGuide: видеомодель сама планирует шаги задачи

Видеогенераторы и видеомодели мира умеют создавать правдоподобные визуальные траектории, но для длинных процедурных задач этого мало: модель должна по уже сгенерированному состоянию определить следующее действие, выполнить его и понять, что задача завершена. Открытая (разомкнутая) генерация не умеет подстраиваться под результат выполнения, а существующие системы с обратной связью, по словам авторов, часто опираются на заранее обученные исполнители или косвенную проверку. Из-за этого остаётся разрыв между решением о действии и его реальным воплощением.

Авторы формулируют процедурную генерацию видео как выполнение задачи в замкнутом цикле в визуальном пространстве мира и предлагают WorldGuide. На входе только начальное изображение и цель задачи. Модель предсказывает атомарное действие, генерирует соответствующий видеоклип и по сгенерированному результату выбирает следующее действие или завершает работу. Планировщик и Исполнитель обучены на одних и тех же пошаговых процедурных демонстрациях: Планировщик учится по визуальному прогрессу предсказывать следующее действие или завершение задачи, а Исполнитель обучен напрямую воплощать предсказанные действия. Иерархическая визуальная память хранит состояние на длинном горизонте выполнения при ограниченной стоимости истории в токенах.

Поскольку пошаговой разметки «действие, видео» для совместного обучения планировщика и исполнителя не хватало, авторы создали WorldGuide Bench: около 59 тыс. видео с разметкой по шагам, 245 задач и 27 процедурных категорий.

Результаты: на WorldGuide-Bench успешность выполнения задачи (Task Success) у WorldGuide составила 33,33% против 29,90% у недавней сильной видеомодели MiniMax-H3, причём MiniMax-H3 получала эталонные планы действий. На VideoCraft-Bench WorldGuide набрала 47,69% против 32,73% у MiniMax-H3 при условии «только цель». Авторы делают вывод, что результаты показывают важность связки планирования с обучаемым исполнением для целенаправленной генерации процедурных видео.

Ключевые факты

  • WorldGuide работает в замкнутом цикле: по начальному изображению и цели предсказывает атомарное действие, генерирует клип и по результату выбирает следующее действие или завершает задачу.
  • Планировщик и Исполнитель обучены на одних и тех же пошаговых демонстрациях; иерархическая визуальная память держит состояние на длинном горизонте при ограниченной стоимости истории в токенах.
  • Для обучения создан WorldGuide Bench: около 59 тыс. видео с пошаговой разметкой, 245 задач, 27 процедурных категорий.
  • На WorldGuide-Bench WorldGuide набрала 33,33% Task Success против 29,90% у MiniMax-H3, которой дали эталонные планы действий.
  • На VideoCraft-Bench результат 47,69% против 32,73% у MiniMax-H3 при условии «только цель».

Почему это важно

Работа затрагивает слабое место видеомоделей: они хорошо рисуют правдоподобные кадры, но длинные процедурные задачи требуют, чтобы каждое следующее действие зависело от того, что уже получилось, а модель сама понимала, когда остановиться. WorldGuide замыкает этот цикл внутри одной системы: планирует, генерирует результат и по нему решает, что делать дальше. Авторы утверждают, что именно связка планирования с обучаемым исполнением даёт выигрыш.

Кому это важно

Исследователям видеомоделей и моделей мира, а также тем, кто занимается генерацией длинных пошаговых процедур. Работа затрагивает вопрос, как совместно обучать планировщик и исполнитель. Новый набор WorldGuide Bench с пошаговой разметкой видео может пригодиться как пример данных для такой задачи, но в источнике не сказано, будет ли он опубликован.

Как это применить

Практического применения в текущем виде нет: в источнике не упомянуты выпуск кода, весов модели или датасета, не приведены размер модели, вычислительные затраты на обучение и стоимость вывода. Идею можно взять как схему: пошаговый цикл «действие, клип, оценка результата, следующее действие или остановка» с общими демонстрациями для планировщика и исполнителя.

Можно ли доверять

Это самоотчёт авторов: результаты получены на собственном бенчмарке WorldGuide-Bench и на VideoCraft-Bench, о котором в источнике нет подробностей. В тексте не определено, как именно считается Task Success. Условия для MiniMax-H3 на двух бенчмарках различались: на WorldGuide-Bench она получала эталонные планы действий, на VideoCraft-Bench работала при условии «только цель». Разрыв на WorldGuide-Bench невелик: 3,43 п.п. (33,33% против 29,90%), на VideoCraft-Bench, 14,96 п.п. (47,69% против 32,73%). Других результатов, абляций и сравнений с иными базовыми моделями в источнике нет; авторы и организации в аннотации не названы.

Риски и подводные камни

Абсолютные значения успешности невысоки: 33,33% на собственном бенчмарке означает, что большинство задач выполнено не было. Работа касается именно сгенерированного видео, сведений о применении в реальных или роботизированных системах в источнике нет. Преимущество над MiniMax-H3 показано в разных условиях подачи информации на двух бенчмарках, поэтому прямое сравнение двух цифр между тестами некорректно.

«Эти результаты демонстрируют важность сочетания планирования с обучаемым исполнением для целенаправленной генерации процедурных видео.»

— из аннотации статьи о WorldGuide