Xiaomi представила VLA-модель Xiaomi-Robotics-1 для роботов

Xiaomi представила Xiaomi-Robotics-1, базовую (foundation) модель vision-language-action (VLA), которая по текстовым командам выполняет широкий круг задач мобильной манипуляции (перемещение и работа с объектами) в незнакомых окружениях без дополнительной настройки, а также быстро адаптируется к новым задачам при минимальном объёме дополнительных данных.
Модель обучали в два этапа. На этапе предобучения её насыщали общими навыками генерации действий на массиве из более чем 100 000 часов реальных траекторий манипуляций, собранных устройствами UMI. Отдельно команда разработала масштабируемый конвейер автоматической разметки: он описывает переходы состояний сцены естественным языком, что даёт точную и насыщенную привязку языковых описаний к конкретным действиям робота. На этапе дообучения возможности модели увязывают с конкретным физическим устройством робота и с прямыми командами, которыми люди обычно управляют роботами.
Эксперименты показали устойчивое масштабирование: качество Xiaomi-Robotics-1 растёт вместе с объёмом данных и размером модели на этапе предобучения, и этот эффект переносится на дообучение, более сильная предобученная модель даёт лучшую работу «из коробки» на реальном роботе в незнакомых условиях. Xiaomi-Robotics-1 также служит надёжной базовой политикой для робота: её можно эффективно дообучить на сложных задачах, требующих точной моторики (dexterous tasks), используя немного данных.
На нескольких симуляционных бенчмарках модель обошла прежние лучшие решения. На RoboCasa365 она показала 57,6% успешных попыток против прежнего рекорда в 46,6%. На RoboDojo средний балл составил 20,07 против 13,07 у прежнего лучшего результата. Xiaomi заявляет, что код и веса модели будут опубликованы; у проекта также есть отдельная страница на сайте robotics.xiaomi.com.
Ключевые факты
- Xiaomi-Robotics-1, VLA-модель (vision-language-action) для управления роботами, обучена на более чем 100 000 часов реальных траекторий манипуляций, собранных устройствами UMI.
- Двухэтапное обучение: предобучение на широком массиве данных + дообучение под конкретное физическое устройство робота и естественные команды человека.
- Конвейер автоматической разметки описывает смену состояний сцены на естественном языке, точно привязывая текст к действиям робота.
- Новый рекорд на бенчмарке RoboCasa365, 57,6% успешных попыток против прежних 46,6%; на RoboDojo, средний балл 20,07 против 13,07 у лучшего решения ранее.
- Модель эффективно дообучается на новых сложных задачах при малом объёме дополнительных данных; Xiaomi обещает опубликовать код и веса модели.
Почему это важно
VLA-модели (vision-language-action), это подход, который учит роботов выполнять физические действия по текстовым командам, объединяя понимание языка, изображения и управление движением. Главная проблема таких моделей, нехватка большого объёма реальных (не симулированных) данных о манипуляциях. Xiaomi-Robotics-1 обучена на более чем 100 000 часов реальных траекторий, это заметно больше типичных наборов данных в этой области, и авторы показывают устойчивое масштабирование: качество растёт вместе с объёмом данных и размером модели, причём этот эффект переносится с предобучения на реальную работу робота в незнакомых условиях.
Кому это важно
Новость касается разработчиков робототехники и воплощённого ИИ (embodied AI): компаний, создающих домашних и складских роботов, исследовательских групп, работающих над базовыми моделями для роботов, а также самой Xiaomi, которая развивает направление робототехники как часть своей аппаратной экосистемы.
Как это применить
Xiaomi-Robotics-1 задумана как базовая политика для робота: разработчики смогут дообучать её на новых сложных задачах, требующих точной моторики, используя относительно немного дополнительных данных, вместо обучения модели с нуля под каждую задачу. Xiaomi заявляет, что код и веса модели будут опубликованы, это позволит другим командам применять модель и проверять её на своих задачах.
Можно ли доверять
Материал, научная публикация (страница на Hugging Face Papers) с описанием методики и количественными результатами на бенчмарках RoboCasa365 и RoboDojo, где приведены конкретные цифры в сравнении с прежними лучшими решениями. При этом результаты пока самозаявленные: код и веса модели на момент публикации ещё не выпущены, поэтому независимая проверка и воспроизведение результатов сторонними командами пока невозможны.
Риски и подводные камни
Заявленные показатели получены преимущественно на собственных бенчмарках и в условиях, которые выбирала сама команда разработчиков; насколько устойчиво поведение модели в по-настоящему разнообразных реальных условиях за пределами тестовой выборки, независимо не подтверждено. Обещание опубликовать код и веса модели пока не выполнено, до релиза внешняя верификация результатов ограничена текстом публикации.