Open-AoE: исследователи выпустили открытый датасет из 2000 часов видео для обучения роботов

Видео манипуляций от первого лица (egocentric-видео, когда камера смотрит на мир глазами человека), удобный и масштабируемый источник обучающих данных для embodied-моделей: роботов и агентов, которые должны действовать в физическом мире. Проблема в том, что существующие наборы данных редко сочетают сразу три вещи: дешёвую массовую съёмку, структурированную разметку на уровне отдельных манипуляций и переиспользуемые инструменты для обучения моделей.
Zishuo Li с соавторами представили Open-AoE, открытый, ориентированный на сообщество датасет и инструментарий, который закрывает весь путь от съёмки на смартфон до обучения модели. Первый релиз включает около 2000 часов видео манипуляций, снятых в естественных условиях более чем 500 участниками с помощью свыше 400 смартфонов.
Датасет содержит текстовые аннотации, позы рук, восстановленные по модели MANO, траектории движения камеры и атомарные действия с точной временной разметкой (когда именно начинается и заканчивается каждое действие). Отдельный конвейер обработки превращает сырые записи в такие структурированные примеры: он делает временную сегментацию действий, семантическую разметку, реконструкцию положения рук и восстановление траектории камеры.
Помимо самого датасета авторы дают отдельный набор инструментов для работы с ним: визуализацию данных, перенос между разными типами роботов (cross-embodiment retargeting, адаптацию движений человека под конкретную конструкцию робота), конвертацию данных под форматы конкретных моделей и готовые рецепты обучения для VLA-политик (vision-language-action, моделей, которые по изображению и тексту предсказывают действие), WAM (world action models) и World Models (моделей, предсказывающих, как изменится мир в ответ на действие).
Цель проекта, по словам авторов, снизить барьер и для пополнения датасета новыми записями, и для его использования в исследованиях: дать открытую инфраструктуру для обучения embodied-моделей, переноса навыков от человека к роботу и построения world-моделей.
Ключевые факты
- Open-AoE, открытый датасет и инструментарий для обучения роботов на egocentric-видео (от первого лица) человеческих манипуляций
- Первый релиз: около 2000 часов видео, снятых в естественных условиях более чем 500 участниками на 400+ смартфонах
- Разметка включает текстовые аннотации, позы рук по модели MANO, траектории камеры и атомарные действия с временной локализацией
- Отдельный инструментарий даёт визуализацию, перенос движений между разными роботами, конвертацию данных под конкретные модели и готовые рецепты обучения VLA-политик, WAM и World Models
- Цель проекта, снизить барьер входа для сбора и переиспользования данных embodied-обучения
Почему это важно
Обучение embodied-моделей (роботов, агентов, действующих в физическом мире) требует больших объёмов размеченных данных о том, как человек манипулирует предметами. Телеуправляемая сборка данных на реальных роботах дорога и медленна, а видео от первого лица со смартфона, дёшево и масштабируемо. Проблема в том, что готовые датасеты такого рода редко сочетают дешёвый массовый сбор, детальную разметку манипуляций и рабочий инструментарий поверх данных, Open-AoE собирает всё это в одном открытом проекте.
Кому это важно
В первую очередь, исследовательским группам и лабораториям, которые обучают embodied-модели: VLA-политики для роботов-манипуляторов, world-модели, модели переноса навыков с человека на робота. Также инструмент полезен командам, которым нужны структурированные данные о позах рук и траекториях камеры без необходимости самим собирать и размечать видео с нуля, и добровольцам, которые хотят пополнять датасет собственными записями со смартфона по единому протоколу.
Как это применить
Путь такой: запись видео манипуляции на смартфон → обработка через конвейер проекта (сегментация действий, семантическая разметка, реконструкция рук и камеры) → готовые структурированные примеры. Дальше отдельный инструментарий позволяет визуализировать данные, переносить движения человека на конкретную конструкцию робота (cross-embodiment retargeting), конвертировать данные под формат нужной модели и обучать VLA-политики, WAM или World Models по готовым рецептам. В источнике не указаны условия лицензирования или коммерческого использования, поэтому эти детали лучше уточнять напрямую в репозитории проекта.
Можно ли доверять
Материал, описание проекта (paper) на Hugging Face с 53 отметками и 2 комментариями на момент публикации: интерес умеренный, независимой сторонней проверки заявленных объёмов и качества данных в тексте нет. Это свежий релиз исследовательской команды, а не давно апробированный промышленный продукт, поэтому заявленные цифры (2000 часов, 500+ участников, 400+ смартфонов) стоит воспринимать как данные авторов проекта, а не как подтверждённый независимыми аудиторами факт.
Риски и подводные камни
Качество краудсорсинговой съёмки на смартфоны от 500+ разных участников может сильно различаться по условиям освещения, ракурсам и аккуратности действий. Автоматическая разметка (реконструкция поз рук, сегментация действий, восстановление траектории камеры) может содержать ошибки, которые трудно выявить без ручной проверки. Перенос движений человека на конструкцию робота (cross-embodiment retargeting), сама по себе открытая исследовательская задача, а не решённая технология, так что готовые рецепты обучения не гарантируют, что модель, обученная на этих данных, сразу заработает на реальном роботе. Условия лицензирования и коммерческого использования датасета в тексте не раскрыты.