HiFi-UMI: точная система сбора данных заменила реальные демонстрации робота

HiFi-UMI: точная система сбора данных заменила реальные демонстрации робота

Обучение манипуляционных политик для роботов упирается в нехватку данных, которые одновременно точны и легко масштабируются. Телеуправление реальным роботом даёт точные данные, но дорого и медленно масштабируется; сбор данных вручную, без робота (подход UMI, Universal Manipulation Interface, «универсальный интерфейс манипуляции»), масштабируется легко, но обычно используется только для предобучения, а на финальном этапе дообучения всё равно добавляют небольшую порцию реальных демонстраций-«якорей» на настоящем роботе, чтобы политика действительно заработала на железе. Авторы задались вопросом: может ли повышение точности данных, снятых без робота, а не сокращение доли реальных данных, полностью убрать необходимость в этом якоре.

Для этого они разработали HiFi-UMI, портативную систему сбора данных, спроектированную специально ради точности траекторий, точного относительного положения двух захватов, синхронизации и широкого поля обзора. Система сочетает наголовный офлайн-модуль стерео-инерциальной SLAM (алгоритм одновременной локализации и построения карты) для отслеживания позиции оператора, нативное (а не восстановленное расчётами) измерение взаимного положения рук, общий GPIO-триггер с микросекундной точностью для синхронизации всех датчиков и по две широкоугольные камеры на каждую руку с полем обзора около 200 градусов. Без какой-либо внешней трекинг-инфраструктуры система достигает точности позиционирования рабочего органа (end-effector) 3 мм в пределах рабочей зоны.

На данных, собранных HiFi-UMI, команда продемонстрировала «дообучение без единого робота»: политика, дообученная исключительно на демонстрациях HiFi-UMI, без единой реальной демонстрации на этом этапе, при развёртывании на настоящем роботе сравнялась по результатам с политикой, дообученной на данных телеуправления. Это подтвердилось на трёх разных архитектурах моделей из семейств vision-language-action (VLA, модели «зрение-язык-действие») и world-action model (модели «мир-действие»): разница в проценте успешных попыток относительно базовой линии на телеуправлении составила -2,5 процентного пункта для StarVLA-QwenPI, +3,1 процентного пункта для OpenPI-pi_0.5 и -0,6 процентного пункта для LingBot-VA. Лучшая из трёх политик на задаче точной вставки детали (precision insertion) достигла 85% успешных попыток, притом что базовая линия на телеуправлении для сравнения собиралась прямо в тестовой сцене, а среди обучающих траекторий HiFi-UMI ни одной из этой сцены не было.

Предобучение на 4000 часах данных из того же (более крупного, чем опубликованная часть) корпуса снизило ошибку предсказания действий на десяти ранее не встречавшихся задачах на 41%, а для модели StarVLA-QwenPI дополнительно подняло долю успешных попыток на реальном роботе ещё на 18,1 процентного пункта.

Команда открыла публичный доступ к части корпуса, набору HiFi-UMI-2K объёмом 2000 часов демонстраций с синхронизацией до микросекунды и сверхширокоугольным обзором; каждая демонстрация автоматически реконструирована и проверена симуляционным воспроизведением. Набор выложен как ресурс для сообщества, занимающегося обучением роботов.

Ключевые факты

  • HiFi-UMI, портативная система сбора данных без робота: наголовная стерео-инерциальная SLAM, нативное измерение положения рук, микросекундная GPIO-синхронизация и по две широкоугольные (~200°) камеры на руку; точность позиционирования, 3 мм без внешней инфраструктуры слежения
  • Политики, дообученные ТОЛЬКО на данных HiFi-UMI без единой реальной демонстрации на роботе, сравнялись по результату с политиками на данных телеуправления на трёх разных архитектурах (StarVLA-QwenPI, OpenPI-pi_0.5, LingBot-VA); разница от -2,5 до +3,1 процентного пункта
  • Лучшая политика достигла 85% успеха на задаче точной вставки детали, хотя базовая линия телеуправления для сравнения собиралась прямо в тестовой сцене, а обучающих данных HiFi-UMI из этой сцены не было вовсе
  • Предобучение на 4000 часах данных снизило ошибку действий на 10 незнакомых задачах на 41% и подняло успех реального робота на StarVLA-QwenPI ещё на 18,1 процентного пункта
  • Команда открыла набор HiFi-UMI-2K, 2000 часов синхронизированных с точностью до микросекунды демонстраций, проверенных симуляционным воспроизведением

Почему это важно

Сбор данных для обучения роботов-манипуляторов упирался в развилку: точные данные телеуправления дороги и плохо масштабируются, а дешёвый сбор без робота (UMI) обычно годится только для предобучения, на финальном этапе всё равно нужен небольшой «якорь» из реальных демонстраций на роботе. Работа показывает, что если поднять точность данных без робота (до 3 мм), этот якорь можно убрать полностью: политика, обученная целиком на таких данных, на практике не уступает обученной на телеуправлении. Это меняет экономику сбора данных для робототехники, дорогое узкое место потенциально снимается.

Кому это важно

Исследовательским командам и компаниям, которые разрабатывают манипуляционные политики для роботов на архитектурах vision-language-action и world-action model и упираются в стоимость и масштабируемость сбора реальных демонстраций на роботе. Также разработчикам инструментов для сбора данных без робота, которым важен ориентир по достижимой точности.

Как это применить

Команда открыла публичный набор данных HiFi-UMI-2K, 2000 часов демонстраций с микросекундной синхронизацией и сверхшироким полем обзора, проверенных через воспроизведение в симуляции; его можно использовать для предобучения или дообучения собственных манипуляционных политик. Описанная конструкция системы (наголовная стерео-инерциальная SLAM, общий GPIO-триггер, широкоугольные камеры на обеих руках) задаёт ориентир для тех, кто хочет собрать собственную установку с сопоставимой точностью.

Можно ли доверять

Результаты получены на трёх конкретных архитектурах моделей и представлены в виде измеримых чисел (точность 3 мм, проценты успеха, снижение ошибки), что повышает проверяемость. При этом это препринт одной исследовательской команды без независимого воспроизведения; число протестированных задач ограничено (в основном одна задача точной вставки и десять «незнакомых» задач для предобучения), и по тексту не видно данных о peer review или независимой проверке.

Риски и подводные камни

Результаты получены на узком наборе задач и трёх конкретных моделях, не факт, что паритет с телеуправлением сохранится на других типах манипуляций или роботах. Сама система HiFi-UMI требует специализированного оборудования (наголовный стерео-инерциальный модуль, синхронизированные широкоугольные камеры), что усложняет воспроизведение результата другими командами без такого же железа. Это исследовательская публикация, а не готовый к промышленному использованию продукт.