Wonder: видео-модель мира с управлением камерой и долгой памятью о сцене

Цзякун Сюй (Jiacong Xu) с соавторами представили Wonder, видео-модель мира (world model) общего назначения для интерактивного исследования пространства в реальном времени с полным управлением камерой. На входе, одно изображение или условное видео; модель строит по нему «играбельный» мир, в котором пользователь двигает камеру, открывает ранее не показанные участки и возвращается в уже просмотренные места, причём и то и другое происходит в реальном времени и на длинном горизонте генерации, без потери связности мира.
Чтобы это заработало, авторы решали задачу совместно на трёх уровнях: способ управления, механизм памяти и стратегия обучения. Во-первых, предложено новое кондиционирование по камере через плотное координатное поле (dense coordinate field): его рендеры дают пространственно согласованные подсказки о движении и ориентации, поэтому модель воспринимает движение камеры не как абстрактный параметр, а как прямое визуальное свидетельство. Во-вторых, для быстрого и точного поиска по памяти при растущем контексте генерации авторы предложили эффективный механизм памяти на основе разрежённого внимания (sparse attention): модель на этапе вывода выборочно обращается лишь к небольшому набору релевантных токенов контекста, независимо от того, насколько длинным стал реальный контекст. В-третьих, авторы доработали конвейер дистилляции по схеме self-forcing (когда модель-ученик обучается предсказывать собственные, а не эталонные кадры): это улучшило способность ученика точно следовать управляющим сигналам камеры и одновременно сохранить от модели-учителя разнообразие режимов генерации и долгосрочную память.
В результате Wonder синтезирует разнообразные видео минутной длины со скоростью 16 кадров в секунду, сохраняя согласованные геометрию, внешний вид и динамику сцены на протяжении длинных прогонов генерации. Помимо генерации видео по изображению, модель поддерживает и генерацию, обусловленную видео (video-conditioned generation): существующую динамическую сцену можно «переснять» заново в реальном времени, то есть сгенерировать альтернативный ролик по той же сцене с другим движением камеры.
Ключевые факты
- Wonder строит по одному изображению или видео исследуемый «играбельный» мир: камера двигается свободно, новые участки открываются, а уже увиденные места можно посетить снова, всё в реальном времени и на длинном горизонте генерации.
- Новое кондиционирование по камере через плотное координатное поле даёт модели пространственно согласованные подсказки о движении и ориентации, движение камеры воспринимается как прямое визуальное свидетельство, а не абстрактный параметр.
- Механизм памяти на основе разрежённого внимания позволяет модели на этапе вывода выбирать лишь релевантные токены контекста, независимо от того, насколько вырос реальный контекст генерации.
- Доработанная self-forcing-дистилляция улучшила следование управляющим сигналам камеры и при этом сохранила от модели-учителя разнообразие режимов генерации и долгосрочную память.
- Итог: связные видео минутной длины на 16 кадрах в секунду с устойчивой геометрией, внешним видом и динамикой; модель также умеет «переснимать» существующую динамическую сцену в реальном времени по видео-условию.
Почему это важно
Большинство видео-генераторов делают короткие ролики без устойчивой памяти о пространстве: стоит камере отвернуться и вернуться, сцена «переписывается» заново. Wonder решает именно эту проблему, совместным дизайном управления камерой, памяти и обучения он держит единый, согласованный мир на протяжении минутных прогонов генерации в реальном времени, а не только на нескольких секундах.
Кому это важно
Разработчикам интерактивных видео-миров и генеративных игровых движков, исследователям встроенного ИИ и робототехники, которым нужны дешёвые симуляции окружения для обучения агентов, а также командам, работающим над генеративными моделями мира, направлением, где связность пространства и памяти долго оставалась узким местом.
Как это применить
Источник, научная публикация с описанием архитектуры и метода обучения, а не готовый продукт: в тексте нет ни цены, ни лицензии, ни информации о публикации кода или весов модели, поэтому судить о доступности Wonder для практического использования пока нельзя. Ценность материала, в самих технических приёмах (кондиционирование по камере, разрежённая память, доработанная self-forcing-дистилляция), которые команды, строящие похожие системы, могут переиспользовать в своих моделях.
Можно ли доверять
Материал размещён на HuggingFace Papers, это предпечатная публикация (препринт) в духе arXiv, а не рецензируемая статья в журнале или на конференции; независимой проверки заявленных результатов сторонними лабораториями в источнике нет. Само описание метода детальное и техническое, что повышает доверие к содержанию, но количественные сравнения с другими моделями мира в доступном тексте отсутствуют.
Риски и подводные камни
В тексте нет количественных бенчмарков и прямого сравнения с конкурирующими видео-моделями мира, поэтому оценить реальный прирост качества и связности сложно. Не указаны ни вычислительная стоимость обучения и инференса, ни планы публикации кода или весов, без них независимо воспроизвести и проверить результаты нельзя. Заявленная долгосрочная связность геометрии и динамики на минутных роликах, сильное утверждение, которое стоит воспринимать с поправкой на то, что оно исходит от самих авторов работы.