ReWorld: интерактивная world model научилась помнить сцену на минуты вперёд

Интерактивная world model должна одновременно следовать за действиями пользователя, помнить уже показанные места сцены и стримить видео в реальном времени. Это противоречие структурное: управление (control) требует короткого горизонта внимания, а память, практически неограниченного. ReWorld разводит эти две задачи по разным этапам: во время обучения они разделены, а на инференсе обе жёстко ограничены по бюджету.
Архитектурно это устроено через смешанные окна внимания по головам (per-head attention): большинство голов модели видят только недавнее прошлое, а небольшая группа «глобальных» голов держит в поле внимания всю историю сцены. Случайная маршрутизация голов не даёт какой-то конкретной голове жёстко закрепиться за одной из этих двух функций, а случайное прореживание фрагментов истории в обучении приучает модель к разреженным, неполным воспоминаниям, так, как они и выглядят на практике.
На инференсе вся прошлая история помещается в фиксированный по размеру кэш ключей-значений (KV-кэш), опирающийся на банк «ориентиров» (landmarks), индексированных по позе камеры: модель подтягивает из банка те ориентиры, что ближе всего к текущей позиции камеры, а не хранит всю историю целиком.
Данные для обучения приведены к единому физическому масштабу действия с помощью специального конвейера: восемь источников, рендеры облётов в Unreal Engine, запись перемещений в играх и съёмки реального мира, сведены так, что одно и то же нажатие клавиши сдвигает камеру на одинаковое расстояние независимо от источника. Отдельно в данные добавлены «палиндромные» траектории (когда камера возвращается тем же путём, каким пришла), они дают модели материал для проверки того, что она действительно помнит пройденное место.
Для скорости используется дистилляция с согласованием распределений (distribution-matching distillation), ограниченная LoRA-адаптером: она сжимает генерацию до четырёх шагов сэмплирования. Один и тот же backbone обслуживает при этом два режима, многошаговый, с высокой детализацией, и упрощённый интерактивный в реальном времени, стримя видео 704×1280 в фотореалистичных, игровых и стилизованных мирах.
В проверке по трём осям, следование за действиями пользователя, память на длинной дистанции и качество видео, ReWorld сравнили с шестью недавними интерактивными world models (их названия в источнике не приведены). ReWorld показала лучшую точность управления (ошибка поворота камеры 11.95 градуса, наименьшая среди всех), лучшую консистентность движения камеры и лучшее качество генерации. В отдельном тесте на минутных «туда-обратно» проходах сцены (64 секунды, 384 латента) фиксированный кэш ReWorld из 12 чанков всё ещё способен восстановить стартовый вид сцены, на той длине ролл-аута, где у моделей со скользящим окном (sliding window) нужные данные уже давно вытеснены из памяти, а модели с полным вниманием (full-KV attention) упираются в нехватку памяти видеокарты.
Ключевые факты
- ReWorld разводит управление и память по разным этапам: в обучении часть attention-голов видит только недавнее прошлое, часть, всю историю сцены, а случайная маршрутизация не даёт им жёстко специализироваться
- На инференсе используется фиксированный по размеру KV-кэш с банком «ориентиров», индексированных по позе камеры, модель подтягивает ближайшие к текущей позиции ориентиры вместо хранения всей истории
- Обучающие данные, восемь источников (рендеры Unreal Engine, игровые перемещения, реальные съёмки), приведённые к единому физическому масштабу движения камеры, плюс «палиндромные» траектории для проверки памяти
- Дистилляция через LoRA-адаптер сжимает сэмплирование до 4 шагов; один backbone обслуживает и режим высокого качества, и интерактивный стриминг 704×1280 в реальном времени
- Против шести недавних интерактивных world models ReWorld показала лучшую точность управления (ошибка поворота 11.95°), лучшую консистентность камеры и лучшее качество генерации; в минутных ролл-аут-тестах (64с, 384 латента) её кэш из 12 чанков всё ещё восстанавливает стартовый вид сцены, тогда как у скользящего окна данные уже вытеснены, а у полного внимания заканчивается память
Почему это важно
Интерактивные world models, видеогенераторы, реагирующие на действия пользователя в реальном времени, упираются в фундаментальное противоречие: чтобы точно следовать за управлением, модели нужен короткий горизонт внимания, а чтобы не забывать уже показанные места сцены, практически неограниченный. ReWorld предлагает конкретную архитектурную развязку этого противоречия: разделение на этапе обучения и жёсткое ограничение бюджета на этапе инференса, с retrieval-механизмом (банк ориентиров по позе камеры) вместо хранения всей истории. Это решает проблему, из-за которой длинные интерактивные сессии в существующих world models либо забывают пройденное, либо упираются в нехватку памяти видеокарты.
Кому это важно
Прежде всего, исследователям и инженерам, разрабатывающим интерактивные world models: генеративные видеосимуляторы для игр, обучения агентов и робототехники, где нужно и следовать за действиями пользователя, и удерживать в памяти пройденную сцену на длинных сессиях. Также интересно командам, которые собирают обучающие данные из разнородных источников (рендеры, игры, реальные съёмки) и сталкиваются с проблемой их согласования по физическому масштабу движения.
Как это применить
В источнике не приведены ни цена, ни лицензия, ни доступность кода или весов модели, это исследовательская работа с описанием архитектуры и её оценкой на бенчмарках, а не готовый к использованию продукт. Практическая ценность здесь, сама архитектурная идея: разделение управления и памяти на этапе обучения, ограниченный по бюджету KV-кэш с retrieval по позе камеры на инференсе и LoRA-дистилляция для ускорения сэмплирования до четырёх шагов, эти решения переносимы на другие интерактивные генеративные модели видео.
Можно ли доверять
Все приведённые результаты, точность управления, консистентность камеры, качество генерации, устойчивость памяти на минутных ролл-аутах, это собственные заявленные результаты авторов работы, полученные на их же протоколе оценки из трёх осей. Независимой проверки или воспроизведения третьей стороной в источнике нет. Имена авторов, их организация и точная дата публикации в тексте не указаны, как и названия шести моделей, с которыми сравнивался ReWorld, это ограничивает возможность независимо сопоставить условия сравнения.
Риски и подводные камни
Сравнение приведено только по трём метрикам качества (точность управления, консистентность, качество видео), данных о скорости инференса, задержке или вычислительных затратах ReWorld относительно шести моделей-аналогов в источнике нет, хотя именно эти параметры критичны для реального интерактивного применения. Названия моделей-аналогов не раскрыты, что не позволяет проверить, насколько сильны были соперники в сравнении. Масштаб обучения, размер модели, объём вычислений, объём датасета сверх восьми источников, в тексте тоже не указан.