Учёные представили DyPES-VLA, единую модель для управления разными роботами

Исследователи представили DyPES-VLA, модель класса vision-language-action (VLA, «зрение-язык-действие»), предназначенную для обучения единой универсальной политики управления роботами с разной физической конструкцией (cross-embodiment manipulation). До сих пор такие модели упирались в два ограничения: они плохо использовали общие для разных роботов закономерности динамики окружающей среды, из-за чего перенос навыков между конструкциями был затруднён, и требовали ручной предобработки, чтобы привести разнородные действия роботов к единому формату.
DyPES-VLA решает обе проблемы. Сначала модель обучает vision-language-компонент задаче предсказания будущего состояния сцены на данных сразу нескольких типов роботов, это заставляет общее представление запроса улавливать движение объектов, контакты и то, как взаимодействие меняет сцену. Затем специализированный для каждого типа робота модуль действий на основе смеси экспертов (Mixture-of-Experts, MoE) переводит эти общие представления динамики в конкретные исполняемые команды, прямо в «родном» пространстве действий каждого робота, без ручного согласования форматов. Общие слои внимания в этом модуле улавливают типовую временную структуру действий, а отдельные для каждой конструкции полносвязные экспертные подсети учитывают уникальные кинематические ограничения и особенности управления конкретным роботом.
В качестве универсальной (generalist) политики DyPES-VLA показала лучшие на момент публикации результаты (state-of-the-art) в симуляции и в реальных экспериментах: 98,0% успешных попыток на бенчмарке LIBERO, 59,25% на RoboCasa-GR1 и 89,02% на RoboTwin 2.0.
Ключевые факты
- DyPES-VLA, единая vision-language-action модель для управления роботами разных конструкций (cross-embodiment).
- Модель обучается общим закономерностям динамики через задачу предсказания будущего состояния сцены на данных нескольких типов роботов.
- Модуль действий на основе смеси экспертов (MoE) переводит общие представления динамики в команды под конкретного робота без ручной подгонки форматов.
- На бенчмарке LIBERO, 98,0% успешных попыток, на RoboCasa-GR1, 59,25%, на RoboTwin 2.0, 89,02%.
- Авторы заявляют лучшие на данный момент результаты (state-of-the-art) в симуляции и в реальных экспериментах.
Почему это важно
Обучить одну политику, которая одинаково хорошо работает на роботах с разной механикой и разным набором действий, одна из ключевых нерешённых задач embodied AI и робототехники. До сих пор перенос навыков между разными типами роботов страдал из-за того, что модели плохо использовали общие для всех конструкций закономерности физики и взаимодействия с объектами, а разработчикам приходилось вручную приводить действия разных роботов к общему формату. DyPES-VLA предлагает архитектурное решение сразу для обеих проблем и заявляет лучшие результаты (state-of-the-art) на нескольких бенчмарках манипуляций.
Кому это важно
Исследователям и инженерам, которые разрабатывают универсальные (generalist) политики управления для робототехники и работают над embodied AI, переносом навыков между роботами разной конструкции без ручной перенастройки под каждую платформу.
Как это применить
В тексте источника не упомянуты ни релиз кода, ни веса модели, ни чекпоинты, работа описана как исследовательская, и прямого пути применить её на практике прямо сейчас источник не даёт.
Можно ли доверять
Результаты, из препринта на HuggingFace Papers, представленного самими авторами; независимой проверки или рецензирования в тексте не указано. Источник не называет ни полный состав авторов и их организации, ни объём обучающих данных или вычислительных ресурсов, ни конкретные модели-бейзлайны, с которыми сравнивали DyPES-VLA, это ограничивает возможность независимо оценить заявленное превосходство.
Риски и подводные камни
Заявленные проценты успеха получены на стандартных бенчмарках манипуляций (LIBERO, RoboCasa-GR1, RoboTwin 2.0), где условия и объекты во многом контролируемые; источник не описывает, какое именно робототехническое оборудование использовалось в «реальных» экспериментах и насколько результаты на этих бенчмарках переносятся на произвольные задачи и роботов за пределами тестового набора.