Ego2Robot: видео от первого лица превратили в 18 561 час данных для обучения роботов

Ego2Robot: видео от первого лица превратили в 18 561 час данных для обучения роботов

Обучение роботов действиям, которые обобщаются на новые ситуации, требует больших и разнообразных наборов демонстраций. Видео манипуляций от первого лица (egocentric) дают богатое разнообразие сцен и задач, и более ранние работы уже показывали: если такое видео перевести (retarget) в формат данных робота и отрисовать заново, на малом масштабе получаются рабочие политики под конкретную задачу. Оставалось неясным, даёт ли этот подход пользу при предобучении моделей класса vision-language-action (VLA) на большом масштабе.

Исследователи представили Ego2Robot, масштабируемый конвейер, который превращает видео манипуляций от первого лица в тренировочные данные для роботов через три этапа: перенос действий (action retargeting) на робота, визуальный синтез руки-манипулятора и многоуровневую отбраковку качества (quality curation). Конвейер работает как с готовыми размеченными датасетами, так и с видео «из дикой природы» (in-the-wild). В результате получено 18 561 час тренировочных данных для 15 разных морфологий роботов, по заявлению авторов, это крупнейший датасет такого рода (ego-to-robot) на сегодняшний день.

Для проверки обобщающей способности исследователи расширили бенчмарк RoboTwin2.0 отдельными осями искажений: внешний вид сцены, расположение объектов, морфология тела робота и семантика задачи, каждая варьируется независимо от остальных. Эксперименты показали: совместное предобучение на синтезированных Ego2Robot данных вместе с обычными данными робота стабильно улучшает обобщение вне исходного распределения (out-of-distribution) по разным типам искажений, и эффект подтверждён на развёртывании на реальном роботе.

Ключевые факты

  • Ego2Robot, конвейер, который превращает видео манипуляций от первого лица в данные для обучения роботов через перенос действий, визуальный синтез руки-манипулятора и многоуровневую отбраковку качества
  • Итоговый датасет, 18 561 час данных, охватывающих 15 морфологий роботов; по заявлению авторов, это крупнейший ego-to-robot датасет на сегодня
  • Конвейер работает и с готовыми размеченными видео, и с видео «из дикой природы»
  • Для оценки обобщения авторы расширили бенчмарк RoboTwin2.0 осями искажений: внешний вид, расположение сцены, морфология робота, семантика задачи
  • Совместное предобучение на данных Ego2Robot вместе с реальными данными робота стабильно улучшает обобщение вне исходного распределения, эффект подтверждён на реальном роботе

Почему это важно

Обобщаемые политики манипуляции для роботов упираются в нехватку больших и разнообразных демонстраций. Видео от первого лица, снятые людьми, дешёвый и разнообразный по сценам и задачам источник, но раньше было известно только, что из него можно получить рабочие политики под одну конкретную задачу на малом масштабе. Оставалось открытым, даёт ли такой подход пользу именно при масштабном предобучении моделей vision-language-action. Ego2Robot закрывает этот пробел: конвейер производит датасет, который его авторы называют крупнейшим ego-to-robot датасетом на сегодня, и показывает пользу от предобучения на нём в экспериментах.

Кому это важно

Работа адресована исследователям в области обучения роботов и разработчикам моделей vision-language-action, которым нужны большие и разнообразные тренировочные данные для манипуляционных задач. Полезна она и командам, которые строят универсальных роботов сразу под несколько типов манипуляторов (в датасете охвачено 15 морфологий) и хотят проверять устойчивость политик к изменению сцены, внешнего вида или формулировки задачи.

Как это применить

Ego2Robot используется как источник данных для совместного предобучения: политика тренируется одновременно на синтезированных из видео данных и на обычных данных робота, что по экспериментам авторов улучшает обобщение на новые условия. Конвейер поддерживает как курируемые датасеты, так и произвольное видео «из дикой природы», то есть потенциально масштабируется на большой объём уже существующих записей. У проекта есть отдельная страница с дополнительными материалами (project page), ссылка на которую приведена в тексте работы.

Можно ли доверять

Материал, научная публикация (страница на Hugging Face Papers), доступен только текст аннотации, без имён авторов, аффилиаций и даты публикации. Заявление «крупнейший ego-to-robot датасет на сегодня» и оценка эффекта («стабильно улучшает обобщение») сделаны самими авторами по итогам собственных экспериментов; независимого подтверждения или рецензии в доступном тексте нет. При этом авторы прямо указывают, что улучшение проверено не только в симуляции, но и на реальном развёртывании робота, что повышает вес заявления.

Риски и подводные камни

В тексте не приведены количественные значения улучшения обобщения, только формулировка «стабильно улучшает», без цифр в процентных пунктах или иных единицах, что не позволяет оценить масштаб эффекта. Не раскрыто, что именно проверяет и отсеивает этап многоуровневой отбраковки качества и какие конкретно 15 морфологий роботов вошли в датасет. Заявление о лидерстве по размеру датасета, самооценка авторов, не подтверждённая сторонним сравнением в доступном тексте.