Учёные предложили «пирамиду данных» для обучения роботов физическим манипуляциям

Учёные предложили «пирамиду данных» для обучения роботов физическим манипуляциям

Мультимодальные модели (текст, картинки, речь) обучились видеть и говорить, «поглотив» весь доступный интернет, это дало им своего рода короткий путь к масштабу. У воплощённых ИИ-агентов (embodied agents), то есть роботов и систем, которые действуют в физическом мире, такого короткого пути нет: им нужны данные, которые связывают наблюдения (что видит сенсор) с физическим состоянием и действиями робота, а таких данных мало и собирать их дорого.

Авторы препринта (Yifan Ye с соавторами) предлагают навести порядок в этом «зоопарке» данных и организуют экосистему данных для воплощённого ИИ в виде «пирамиды» из пяти взаимодополняющих источников: данные с реальных роботов; данные в стиле UMI (universal manipulation interface, переносные устройства, которыми человек имитирует захват и манипуляции без самого робота); эгоцентрические и экзоцентрические видео (снятые от первого и от третьего лица действия человека); данные из симуляций; и общие данные «изображение-текст» (vision-language), не привязанные к конкретному роботу.

Пирамида построена вокруг компромисса между масштабируемостью источника (сколько данных реально можно собрать) и его «привязкой к роботу» (robot alignment), насколько точно данные отражают именно физику и возможности конкретного устройства. Каждый источник авторы оценивают по четырём осям: качество данных, разнообразие, пригодность для повторного использования и физическая достоверность (точность передачи реальной физики).

Далее авторы анализируют недавние воплощённые фундаментальные модели, «модели-мозг» для роботов, модели vision-language-action (VLA, связывающие зрение, язык и действие) и модели world-action (модели мира и действия), именно через призму их «рецептов данных»: какие источники они выбирают, как их выравнивают между собой и в какой пропорции смешивают при предобучении. Авторы соотносят состав данных со способностями моделей: восприятием, рассуждением, планированием, генерацией действий и предсказанием того, как изменится мир.

В конце работы перечислены шесть открытых проблем области: как собрать крупномасштабные датасеты тактильных данных (осязания); как собирать данные о неудачах и восстановлении после них (а не только об успешных попытках); как построить масштабируемые конвейеры сбора данных; как выровнять действия между разными типами тел роботов (embodiments); как использовать эгоцентрические видео человека для обучения точной ручной манипуляции; и как в принципе проектировать обоснованные «рецепты данных» для обучения роботов.

Ключевые факты

  • Мультимодальные модели обучались на всём интернете, а воплощённым ИИ-агентам (роботам) нужны данные, связывающие наблюдения с физическим состоянием и действиями, такого готового массива в интернете нет
  • Авторы делят данные для роботов на пять уровней «пирамиды»: реальные роботы, данные в стиле UMI, эгоцентрическое/экзоцентрическое видео человека, симуляции, общие данные изображение-текст
  • Каждый источник оценён по четырём критериям: качество, разнообразие, переиспользуемость, физическая достоверность, и по компромиссу «масштабируемость против привязки к роботу»
  • Разобраны рецепты данных современных embodied-моделей (embodied brain, vision-language-action, world-action) и то, как состав данных связан с их способностями к восприятию, планированию и предсказанию
  • Названы шесть открытых проблем: нехватка тактильных датасетов, данных о неудачах и восстановлении, масштабируемых конвейеров сбора, переноса действий между разными роботами, использования видео человека и принципов смешивания данных

Почему это важно

Текстовые и визуальные модели получили масштаб бесплатно, данных в интернете хватает с избытком. У роботов такого источника нет: нужны данные, которые одновременно фиксируют, что видит сенсор, в каком физическом состоянии находится робот и какое действие он совершает. Такие данные редки, дороги в сборе и сильно различаются по качеству в зависимости от способа получения. Работа не предлагает новый метод сбора данных или новую модель, это концептуальный каркас, который наводит порядок в уже существующих типах данных и объясняет, за счёт чего они выигрывают и проигрывают друг другу. Вклад скорее организационный и аналитический, чем прорывной.

Кому это важно

В первую очередь, исследователям и инженерам, которые строят фундаментальные модели для роботов: «модели-мозг», модели vision-language-action (VLA) и модели world-action. Полезно также командам, которые проектируют конвейеры сбора данных для робототехники и решают, куда вкладывать ресурсы, в реальных роботов, в переносные устройства сбора данных (UMI), в симуляции или в видео человека. Широкой аудитории, не занимающейся embodied AI напрямую, материал даёт скорее общий ориентир в теме, чем практический инструмент.

Как это применить

Пирамида даёт словарь для сравнения источников данных по четырём осям, качество, разнообразие, переиспользуемость, физическая достоверность, и по главному компромиссу: чем ближе данные к реальному роботу, тем они достовернее физически, но тем труднее и дороже их масштабировать; данные из симуляции и общие данные изображение-текст масштабируются легко, но хуже отражают конкретную физику устройства. Команда, проектирующая обучение embodied-модели, может использовать эту схему, чтобы осознанно смешивать источники под свою задачу, а не полагаться на один тип данных.

Можно ли доверять

Это препринт-обзор с анализом существующих моделей и источников данных, а не отчёт об эксперименте с новыми количественными результатами: в тексте нет собственных бенчмарков или измерений, подтверждающих превосходство предложенной классификации над альтернативными. Ценность работы, в систематизации уже известного и в перечне открытых проблем, а не в новом эмпирическом открытии, поэтому и её вклад стоит воспринимать как полезный, но инкрементальный шаг, а не прорыв.

Риски и подводные камни

Сама пирамида не решает проблему нехватки данных для роботов, она её описывает. Авторы прямо перечисляют шесть нерешённых задач: не хватает крупных датасетов тактильных данных, почти нет данных о неудачных попытках и восстановлении после них, конвейеры сбора данных плохо масштабируются, действия плохо переносятся между роботами разной конструкции, эгоцентрическое видео человека сложно использовать для точной ручной манипуляции, а принципы смешивания источников остаются скорее эмпирическими, чем обоснованными. То есть организационная схема полезна для ориентации в поле, но фундаментальный дефицит качественных данных для embodied AI ею не устраняется.