AlayaWorld: модель на 15 млрд параметров генерирует интерактивные видео-миры

AlayaWorld: модель на 15 млрд параметров генерирует интерактивные видео-миры

Команда AlayaWorld опубликовала полный технический отчёт об одноимённой модели, интерактивном видео-мире с длинным горизонтом генерации (long-horizon video world model). В отличие от классической разработки игр, где ассеты, анимацию, физику и программный код собирают вручную трудоёмкими способами, такие модели строят исследуемые виртуальные миры прямо из пользовательского ввода, текста, изображения или видео, и позволяют менять их на лету. Авторы называют четыре взаимосвязанных требования к таким системам: интерактивность, устойчивая согласованность сцены во времени и пространстве, стабильная генерация на длинном горизонте и быстрый отклик.

AlayaWorld построена на диффузионном видео-трансформере с 15 миллиардами параметров и генерирует видео с частотой 24 кадра в секунду в разрешении 540p и 720p. Модель работает авторегрессивно: короткие фрагменты видео (латентные чанки) создаются один за другим с учётом траектории камеры и переключаемых по ходу генерации текстовых подсказок.

Чтобы сцена не «плыла» на длинных роликах, авторы дали модели ограниченный, но структурированный визуальный контекст: неизменный опорный кадр (sink frame), сжатую историю предыдущих кадров, геометрически выровненную пространственную память и данные о нескольких последних кадрах. Дополнительно модель дообучали на намеренно искажённых историях и остатках собственных прогнозов (roll-outs), чтобы снизить накопление ошибок, дрейф, при долгой генерации.

Для ускорения вывода авторы предложили дискретную схему авторегрессивной дистилляции, объединяющую три метода: distribution-matching distillation, self-forcing++ и consistency distillation. Это позволило сократить число шагов сэмплирования на один фрагмент видео примерно с 30 до четырёх.

На бенчмарке iWorld-Bench AlayaWorld показала лучший результат по генерации с длинным горизонтом. Авторы позиционируют проект как полностью открытый (open-source) и рассчитанный на долгий срок, как расширяемую платформу для дальнейших исследований интерактивных видео-миров, а не как разовый релиз.

Ключевые факты

  • AlayaWorld, диффузионный видео-трансформер на 15 млрд параметров, генерирует видео 24 кадра/с в разрешении 540p и 720p
  • Генерация авторегрессивная: короткие чанки видео строятся один за другим с учётом траектории камеры и переключаемых текстовых подсказок
  • Против дрейфа сцены на длинных роликах используется составной визуальный контекст: опорный кадр, сжатая история, пространственная память, последние кадры
  • Дистилляция (сочетание distribution-matching distillation, self-forcing++ и consistency distillation) сократила число шагов сэмплирования на чанк примерно с 30 до 4
  • На бенчмарке iWorld-Bench модель показала лучший результат по генерации с длинным горизонтом; проект заявлен как открытый (open-source)

Почему это важно

Работа закрывает известный разрыв в генеративных видео-моделях мира: большинство систем либо теряют согласованность сцены на длинных роликах (объекты и геометрия «плывут»), либо слишком медленные для интерактивного отклика. AlayaWorld одновременно нацелена на все четыре требования, интерактивность, пространственно-временную устойчивость, стабильность на длинном горизонте и скорость, и подкрепляет это архитектурными решениями (структурированная память) и ускорением вывода (дистилляция с 30 до 4 шагов на чанк), а не только увеличением размера модели.

Кому это важно

В первую очередь, исследователям генеративных видео- и world-моделей, а также командам, работающим над играми, симуляциями и обучением агентов (в том числе робототехнике), где нужна долгая и предсказуемая виртуальная среда без ручной сборки ассетов, анимации и физики. Полезно и разработчикам инструментов на базе диффузионных видео-моделей, как открытая база для экспериментов.

Как это применить

Авторы описывают AlayaWorld как full-stack и открытый (open-source) долгосрочный проект, расширяемую основу для дальнейших исследований интерактивных видео-моделей мира, а не готовый коммерческий продукт. В отчёте нет данных о цене, лицензии или ограничениях использования, поэтому судить о конкретных условиях доступа по нему нельзя.

Можно ли доверять

Заявления опираются на собственный технический отчёт команды и результаты на бенчмарке iWorld-Bench, где модель показала лучший результат по генерации с длинным горизонтом; архитектура и метод дистилляции описаны достаточно подробно. При этом это самостоятельная публикация авторов без независимого стороннего аудита, а сам бенчмарк iWorld-Bench в отчёте не охарактеризован развёрнуто.

Риски и подводные камни

Результаты, самоотчёт авторов на собственном или узкоспециализированном бенчмарке, что оставляет пространство для оптимистичной интерпретации. Отчёт не раскрывает вычислительную стоимость обучения и инференса 15-миллиардной модели, требования к железу, а также ограничения по типам сцен или длительности генерации, при которых устойчивость всё же может деградировать.

«Видео-модели мира генерируют интерактивные среды по пользовательскому вводу мгновенно.»

— из технического отчёта AlayaWorld