ACE-Data-0: датасет на 17 млн кадров для обучения роботов бытовым задачам

Модели воплощённого интеллекта упираются в нехватку данных: чтобы понять, как человек действует ради цели, нужно одновременно фиксировать взгляд от первого лица, движение всего тела, точную работу рук, состояние предметов, звук и осязание, но существующие датасеты дробят этот опыт по ракурсам, модальностям или масштабу, и полный цикл «восприятие → действие» никогда не виден целиком.
Yukang Cao с соавторами предложили Ambient Capture Engine (ACE), движок захвата данных, который превращает обычные жилые помещения в откалиброванные, синхронизированные по времени студии записи. ACE работает на двух масштабах: настольная конфигурация фиксирует манипуляции рук с предметами, а конфигурация уровня комнаты снимает движение всего тела, перемещение и взаимодействие человека с обстановкой по всей меблированной квартире. Система одновременно записывает эгоцентрическое видео (от лица участника) и видео с нескольких внешних (экзоцентрических) камер, движение всего тела и пальцев рук, геометрию предметов и их траектории с 6 степенями свободы, звук и тактильные сигналы, всё это как единый синхронизированный многосенсорный поток.
На основе ACE авторы собрали датасет ACE-Data-0: 150 часов записи и 17 млн видеокадров, охватывающих 200 категорий задач; в съёмках участвовали 50 человек в 2 обстановках, всего получилось 75 000 эпизодов взаимодействия. Датасет включает как отдельные манипуляции с предметами, так и длинные цепочки бытовых действий, а также взаимодействие человека с обстановкой; участникам давали инструкции на уровне цели, а не пошаговый сценарий, это сохраняет естественную вариативность поведения, а не заученное повторение.
К датасету прилагается иерархический бенчмарк, который проверяет модели по нарастающей: сначала на уровне отдельных сигналов, затем компонентов сцены, и наконец полноценных взаимодействий. Проверка современных (SOTA) методов на этом бенчмарке показала существенные провалы именно там, где данные ACE наиболее полны: при физическом контакте, окклюзиях (когда объект или рука перекрыты от камеры), собственном движении наблюдателя (egomotion) и на длинных временных горизонтах.
Авторы позиционируют ACE-Data-0 как масштабируемую основу для имитационного обучения, построения моделей мира, визуально-языково-моторных систем (VLA) и воплощённого ИИ в целом, за счёт того, что демонстрации людей синхронизированы и снабжены согласованной разметкой восприятия, кинематики и контакта.
Ключевые факты
- Ambient Capture Engine (ACE) превращает обычные дома в синхронизированные студии захвата данных на двух масштабах: настольном (манипуляции руками) и уровня комнаты (движение всего тела)
- Датасет ACE-Data-0: 150 часов, 17 млн видеокадров, 200 категорий задач, 50 участников, 2 обстановки, 75 000 эпизодов взаимодействия
- Одновременно записываются эгоцентрическое и многоракурсное экзоцентрическое видео, движение тела и рук, траектории предметов с 6 степенями свободы, звук и тактильные сигналы
- Иерархический бенчмарк выявил у современных SOTA-методов существенные провалы при контакте, окклюзиях, собственном движении наблюдателя и на длинных горизонтах
- Датасет заявлен как основа для имитационного обучения, моделей мира, визуально-языково-моторных систем (VLA) и воплощённого ИИ
Почему это важно
Текущие модели воплощённого ИИ учатся на данных, где взгляд, движение, манипуляция предметами, звук и осязание сняты порознь, разными датасетами, ракурсами или масштабами. Из-за этого ни одна модель не видит полный цикл «восприятие → действие» так, как его проживает человек. ACE закрывает именно этот пробел: один синхронизированный поток фиксирует всё сразу, в реальных домах, а не в лаборатории.
Кому это важно
Разработчикам и исследователям, которые обучают роботов и агентов воплощённого ИИ бытовым задачам: манипуляции предметами, перемещению по помещению, длинным цепочкам повседневных действий. В тексте прямо названы направления применения, имитационное обучение, модели мира и визуально-языково-моторные системы (VLA).
Как это применить
ACE-Data-0 и приложенный к нему иерархический бенчмарк можно использовать для обучения и проверки моделей: бенчмарк устроен по нарастающей, от отдельных сигналов к компонентам сцены и затем к полноценным взаимодействиям. Источник не сообщает условий доступа, лицензии или стоимости, эти детали в материале отсутствуют.
Можно ли доверять
Данные собраны не в теории, а на реальных участниках (50 человек) в двух реальных обстановках, с калиброванной синхронизацией по времени между сенсорами, это проверяемая методология, а не декларация. Авторы дополнительно протестировали существующие современные (SOTA) методы на своём бенчмарке и получили конкретные, а не декларативные результаты: провалы именно в сложных случаях (контакт, окклюзии, egomotion, долгий горизонт). Прямой цитаты авторов в источнике нет.
Риски и подводные камни
Датасет снят всего в двух обстановках и с 50 участниками, источник не уточняет, насколько это разнообразие людей, планировок и бытовых сценариев репрезентативно для реального мира. Сама работа фиксирует, что современные методы плохо справляются с контактом, окклюзиями, собственным движением наблюдателя и длинными горизонтами, то есть именно в тех условиях, ради которых датасет и собирался, задача остаётся нерешённой.