ABot-World-0: интерактивная видео-модель мира стримит на одной GPU

Команда во главе с Фань Цзяном (Fan Jiang) представила ABot-World-0, управляемую действиями видео-модель мира (action-conditioned video world model) для длительного замкнутого взаимодействия в реальном времени: пользователь подаёт команды, например с клавиатуры, а модель на лету генерирует соответствующее видео окружения.
Модель обучена на разнородных данных, записях AAA-игр, симуляторах и видео из интернета. Для сбора данных авторы создали систему WorldExplorer, которая с помощью агента собирает материал, ориентируясь на обратную связь от процесса обучения. Единый конвейер обработки применяет 14 детерминированных проверок качества, оценку с помощью VLM (модели, понимающей одновременно текст и изображение) и синхронную разметку действий и текстовых описаний.
Чтобы модель работала быстро, авторы применили дистилляцию: двунаправленную модель-учителя с учётом действий постепенно сжимают в каузальную (учитывающую только прошлое) модель-ученика через teacher forcing (обучение на эталонных, а не собственных предсказаниях) и дистилляцию методом ODE (обыкновенных дифференциальных уравнений). Отдельно предложен метод LongForcing, он выравнивает длинные самостоятельные прогоны модели-ученика с прогонами модели-учителя на расширенном горизонте, снижая накопление ошибки распределения и дрейф при авторегрессивной генерации (постепенное отклонение результата от реальности при пошаговой генерации кадров).
Управление идёт через сырые команды с клавиатуры, единый интерфейс для перемещения по сцене и взаимодействия с персонажем от третьего лица. Отдельный механизм памяти о внешности персонажа сохраняет визуальные признаки, чтобы облик персонажа не менялся при длительных прогонах от третьего лица.
Для развёртывания авторы спроектировали потоковый инференс-стек: облегчённый VAE-декодер (вариационный автокодировщик, сжимающий и восстанавливающий изображение), эффективный механизм внимания, планировщик с учётом памяти и низкобитный инференс DiT (диффузионного трансформера). В оптимизированных низкобитных конфигурациях ABot-World-0 стримит видео в разрешении 720p со скоростью до 16 кадров в секунду на одной настольной видеокарте NVIDIA RTX 5090, с задержкой от действия до первого кадра 1,2 секунды и пиковым потреблением видеопамяти около 19 ГиБ.
Эксперименты на бенчмарке WorldRoamBench и в расширенных интерактивных прогонах показывают конкурентоспособную управляемость и связную эволюцию виртуального мира на длинных горизонтах.
Ключевые факты
- ABot-World-0, управляемая действиями видео-модель мира для реального времени и длительного замкнутого взаимодействия с окружением.
- Обучена на данных из AAA-игр, симуляторов и интернет-видео; сбор ведёт агентная система WorldExplorer с 14 проверками качества и оценкой через VLM.
- Модель дистиллирована из двунаправленного учителя в каузального ученика через teacher forcing и ODE-дистилляцию; новый метод LongForcing снижает дрейф при длинных прогонах.
- На одной настольной GPU RTX 5090 модель стримит видео 720p до 16 кадров в секунду с задержкой 1,2 секунды и пиковой видеопамятью около 19 ГиБ.
- Управление, через клавиатуру; отдельная память о внешности персонажа сохраняет идентичность при виде от третьего лица.
Почему это важно
Интерактивные видео-модели мира обычно требуют дата-центровых GPU и работают с заметными задержками, что ограничивает их использование исследовательскими лабораториями. ABot-World-0 показывает, что за счёт дистилляции модели и низкобитного инференса управляемую генерацию видео 720p в реальном времени (до 16 кадров в секунду) можно запустить на одной настольной видеокарте RTX 5090 с задержкой отклика на действие всего 1,2 секунды. Это снижает порог входа для разработки интерактивных ИИ-сред и симуляций.
Кому это важно
Разработчикам игр и симуляторов, исследователям в области embodied AI (ИИ, взаимодействующего с физическим или виртуальным окружением) и обучения агентов, а также командам, создающим интерактивные видеогенераторы и виртуальные миры для тестирования роботов или игровых персонажей.
Как это применить
Источник описывает архитектуру и метод обучения, систему сбора данных WorldExplorer, дистилляцию учитель-ученик, метод LongForcing и потоковый инференс-стек с облегчённым VAE-декодером и низкобитным DiT, но не сообщает о публичном релизе кода, весов модели, цене или лицензии. Судить о доступности модели для практического использования по имеющемуся тексту нельзя.
Можно ли доверять
Работа опубликована как препринт на HuggingFace Papers и за 42 часа набрала 170 отметок и 5 комментариев, заметный, но не экстремальный интерес сообщества. Заявленные показатели (16 кадров в секунду, задержка 1,2 секунды, около 19 ГиБ видеопамяти) получены на бенчмарке WorldRoamBench и в расширенных интерактивных прогонах авторов; независимого воспроизведения результатов пока не было.
Риски и подводные камни
В источнике не раскрыты ограничения модели, устойчивость при очень долгих сессиях взаимодействия, качество генерации в сценах, сильно отличающихся от обучающих данных (AAA-игр, симуляторов, интернет-видео), а также возможные артефакты низкобитного инференса. Требование около 19 ГиБ видеопамяти всё ещё превышает возможности большинства потребительских GPU младшего и среднего класса.