SolarWM: исследователи выпустили открытую платформу для видео-моделей мира

Junchao Huang с соавторами представили SolarWM, полностью открытую платформу для построения интерактивных видео-моделей мира (world model), охватывающую весь путь от подготовки данных до вывода на длинных горизонтах (long-horizon inference). Проблема, которую решает проект: обучение на разнородных источниках данных и разных видео-бэкбонах затруднено, потому что датасеты отличаются по временному масштабу, геометрии камеры, визуальному качеству, характеру движения и стилю подписей к кадрам, а разные видеогенераторы используют разные представления и архитектуры. Наивное смешивание данных и реализации под конкретную модель дают несогласованное обучение и делают результаты трудно воспроизводимыми и сравнимыми между собой.
SolarWM устраняет эту связанность двумя компонентами: перенастраиваемым движком данных из нескольких источников и фреймворком адаптации, «нативным» для бэкбона (backbone-native adaptation). Движок данных конвертирует 1,43 миллиона канонических клипов из 10 датасетов в единый, покадрово выровненный формат (контракт), который охватывает визуальные наблюдения, метрическую геометрию камеры, подписи к видео, метаданные качества, решения по отбору клипов и происхождение данных (provenance), при этом обработка исходных источников отделена от построения итоговой смеси данных.
Поверх общих интерфейсов для кондиционирования по камере, обучения и вывода авторы обучили четыре модели размером от 5 до 33 миллиардов параметров на основе трёх существующих видео-бэкбонов, Wan2.2, LTX-2.5 и MiniMax-H3, сохранив их «родные» представления и целевые функции. Обучение построено по единому трёхэтапному рецепту: двунаправленная адаптация (bidirectional adaptation), авторегрессивная инициализация с обучением по эталонным кадрам (teacher forcing) и дистилляция по согласованию распределений (distribution matching distillation).
Полученные каузальные модели способны к взаимодействию в реальном времени на прогонах (rollout) продолжительностью от минут до часов, при этом сами модели обучались лишь на 5-секундных последовательностях. Авторы публикуют данные, конвейер обработки, рецепты обучения, веса моделей и сам фреймворк, позиционируя SolarWM как воспроизводимую и расширяемую основу для дальнейших исследований в области видео-моделей мира. В самой аннотации не названы конкретные авторские институты, не приведены даты релиза, лицензия или место хранения материалов, а также нет бенчмарков и количественных сравнений с другими видео-моделями мира.
Ключевые факты
- SolarWM, открытая платформа для интерактивных видео-моделей мира: от подготовки данных до вывода на длинных горизонтах
- Движок данных объединяет 1,43 млн клипов из 10 датасетов в единый покадрово выровненный формат с геометрией камеры, подписями и метаданными качества
- На общих интерфейсах обучены четыре модели (5, 33 млрд параметров) на основе бэкбонов Wan2.2, LTX-2.5 и MiniMax-H3
- Трёхэтапный рецепт обучения: двунаправленная адаптация, авторегрессивная инициализация с teacher forcing и дистилляция по согласованию распределений
- Модели, обученные всего на 5-секундных последовательностях, работают в реальном времени на прогонах от минут до часов; данные, код, рецепты и веса выложены в открытый доступ
Почему это важно
Видео-модели мира сегодня обучают разрозненно: у каждой команды свой конвейер данных и своя реализация под конкретный бэкбон, из-за чего результаты трудно воспроизвести и сравнить между собой. SolarWM предлагает единый открытый контракт данных и общие интерфейсы обучения/вывода, которые работают поверх разных архитектур видеогенераторов, сохраняя их нативные представления. Это шаг к тому, чтобы исследования моделей мира стали воспроизводимыми, а не завязанными на закрытую инфраструктуру конкретной лаборатории.
Кому это важно
В первую очередь, исследовательским командам, которые работают над видео-генерацией и моделями мира и хотят сравнивать архитектуры на общих данных без переписывания конвейера под каждый бэкбон. Полезно и разработчикам интерактивных сред (симуляция, робототехника, игровые движки на генеративном видео), которым нужны модели, способные к устойчивому взаимодействию в реальном времени на длинных прогонах, а не только к генерации коротких клипов.
Как это применить
Публикация включает данные, конвейер их подготовки, рецепты обучения, веса моделей и сам фреймворк, то есть открыт весь стек, а не только чекпойнты. Это позволяет воспроизвести обучение любой из четырёх моделей (5, 33 млрд параметров, на основе Wan2.2, LTX-2.5 или MiniMax-H3) или адаптировать трёхэтапный рецепт (двунаправленная адаптация → авторегрессивная инициализация → дистилляция по согласованию распределений) под собственный бэкбон. В аннотации не указаны дата релиза, лицензия и место хранения материалов, поэтому условия использования нужно проверять непосредственно в репозитории проекта.
Можно ли доверять
Материал, аннотация исследовательской работы (arXiv), не пресс-релиз компании; авторство в самой аннотации не раскрыто, первым автором в метаданных значится Junchao Huang, но полный список авторов и институтов там не указан. Заявленные цифры, 1,43 млн клипов, 10 датасетов, четыре модели 5, 33 млрд параметров, обучение на 5-секундных последовательностях, взяты дословно из текста аннотации. При этом в самой аннотации нет ни бенчмарков, ни количественных сравнений с другими видео-моделями мира, поэтому оценить качество результатов по одному этому тексту нельзя, для этого нужно смотреть полную статью и веса после публикации.
Риски и подводные камни
Заявления об открытости и воспроизводимости пока не подкреплены в аннотации ни бенчмарками, ни сравнением с существующими видео-моделями мира, насколько SolarWM лучше или хуже альтернатив, из текста не следует. Не указаны дата релиза, лицензия и место размещения данных/весов, так что фактическая доступность и условия использования могут отличаться от заявленных на момент публикации аннотации. Также не раскрыто, что именно авторы понимают под «длинным горизонтом» помимо диапазона «от минут до часов», точных критериев или ограничений устойчивости на очень длинных прогонах текст не приводит.