OpenWAM: выложили стек для предобучения роботов по видео

Модели «мир-действие» (World-Action Model, WAM) объединяют знания о мире, унаследованные от генеративных видео-моделей, с исполняемыми командами управления для роботов. Yuran Wang с соавторами указывают на проблему всей области: существующие системы такого рода монолитны, базовая генеративная модель, визуальное представление, архитектура, поток информации, порядок вывода и обучающие данные жёстко связаны между собой, из-за чего неясно, какие архитектурные решения на самом деле работают и почему. В ответ они представили OpenWAM, открытый исследовательский стек, который превращает предобучение WAM-моделей в программу контролируемых экспериментов.
Стек состоит из двух частей. OpenWAM-Infra раскладывает пространство архитектурных решений WAM на независимые, компонуемые модули с единой системой обучения, вывода, развёртывания и оценки. На этой основе OpenWAM-Study через контролируемые эксперименты отвечает на три вопроса, что наследовать от генеративных приоров, как взаимодействуют обучение «мира» и обучение «действия» и как масштабируется их синергия, и по итогам авторы формулируют три принципа. Во-первых, знания генеративной модели переносятся дальше только через достаточно мощную базовую модель и компактное, информационно насыщенное латентное пространство. Во-вторых, синергия «мир-действие» требует отдельной вычислительной ёмкости под действия, явного потока информации от мира к действию и синхронного совместного шумоподавления. В-третьих, предобучение на «воплощённых» данных (embodied pretraining) в первую очередь улучшает обобщение за пределы тренировочного домена, а совместное обучение в один этап на эгоцентрических данных людей и роботов одновременно расширяет охват «мира» и точность привязки действий к нему.
На основе этих принципов авторы построили OpenWAM-α, открытую WAM-модель, предобученную примерно на 6400 часах эгоцентрических данных людей и роботов. Её проверили на восьми симуляционных бенчмарках и в экспериментах с реальными роботами, от манипуляции одной рукой и двумя руками до сложных многопальцевых кистей-манипуляторов (dexterous hands). По всем этим задачам OpenWAM-α стабильно показывает отличный результат, сохраняя лидирующие позиции и в симуляции, и в физическом мире.
Авторы выкладывают в открытый доступ весь стек: инфраструктуру OpenWAM-Infra, протоколы оценки, предобученные модели, включая OpenWAM-α, и рецепты подготовки обучающих данных, чтобы дальнейшие исследования WAM-моделей могли на это опираться.
Ключевые факты
- OpenWAM, открытый модульный стек; его часть OpenWAM-Infra раскладывает предобучение моделей «мир-действие» (WAM) на независимые компонуемые модули с единой системой обучения, вывода, развёртывания и оценки.
- OpenWAM-Study через контролируемые эксперименты отвечает на три вопроса, что наследовать от генеративных приоров, как взаимодействуют обучение «мира» и «действия», как масштабируется их синергия, и формулирует три принципа предобучения WAM-моделей.
- На основе этих принципов построена модель OpenWAM-α, она предобучена примерно на 6400 часах эгоцентрических данных людей и роботов.
- OpenWAM-α проверена на восьми симуляционных бенчмарках и в реальных экспериментах с роботами, от манипуляции одной рукой и двумя руками до сложных многопальцевых кистей, и везде стабильно держит результат на уровне лучших систем.
- Авторы открыли доступ ко всему стеку: инфраструктуре OpenWAM-Infra, протоколам оценки, предобученным моделям (включая OpenWAM-α) и рецептам подготовки данных.
Почему это важно
Модели, которые пытаются связать «знания о мире» из видео-генераторов с реальными действиями робота, одно из самых обсуждаемых направлений в ИИ для роботов, но большинство таких систем строят как монолит: заменить один компонент нельзя, не пересобирая всё остальное, и поэтому неясно, какое из архитектурных решений на самом деле даёт результат. OpenWAM отвечает именно на эту проблему, не просто выпускает ещё одну модель, а даёт всей области общую, воспроизводимую инфраструктуру для контролируемых экспериментов и подкрепляет её рабочей моделью (OpenWAM-α), которая на этой методологии подтверждает результат и в симуляции, и на реальных роботах.
Кому это важно
В первую очередь, исследовательским группам и лабораториям, которые занимаются воплощённым ИИ (embodied AI), моделями мира и обучением роботов манипуляции: им не нужно строить с нуля инфраструктуру для обучения, вывода и оценки, если они хотят проверить свою идею в этой области. Полезно и инженерам робототехники, которым нужна база для дообучения под конкретного робота, от одной руки до многопальцевой кисти. Для читателя, далёкого от ИИ-исследований и робототехники, ценность материала не прикладная и не немедленная: это инфраструктурный релиз для исследователей, а не готовый потребительский продукт.
Как это применить
Всё, что нужно для повторения или продолжения этой работы, авторы публикуют открыто: код инфраструктуры OpenWAM-Infra (обучение, вывод, развёртывание, оценка), протоколы тестов на восьми бенчмарках, веса предобученной OpenWAM-α и рецепты подготовки обучающих данных. Это позволяет либо дообучить OpenWAM-α под свою задачу и своего робота, одну руку, две руки или многопальцевую кисть, либо взять инфраструктуру и провести собственные контролируемые эксперименты, опираясь на три принципа, которые авторы уже проверили. Точную дату публикации стека в открытом доступе в тексте не называют.
Можно ли доверять
Это страница статьи в разделе Hugging Face Papers, по сути, препринт с arXiv, а не независимый обзор: все оценки качества модели «стабильно отличная», «на уровне лучших» дают сами авторы. Институциональная принадлежность и полный список соавторов в тексте не указаны, на странице значится только первый автор, Yuran Wang, с соавторами. При этом авторы публикуют не только текст статьи, но и код, веса OpenWAM-α и протоколы оценки, это открывает возможность независимой проверки заявленных результатов силами сообщества.
Риски и подводные камни
Главный риск для читателя, принять качественные превосходные оценки («стабильно отличный результат», «на уровне лучших») за подтверждённое числами превосходство: в тексте нет ни цифр точности или успешности, ни названий конкретных бенчмарков, так что масштаб преимущества по одной странице не проверить. Не названа и ни одна «монолитная» система-прототип, с которой авторы противопоставляют свой подход в начале статьи, критика существующих систем остаётся общей, без конкретного адресата. Дата открытой публикации кода, весов и данных в тексте не указана, поэтому момент, когда стек реально станет доступен, по этому материалу не определить.