Zero-WAM: робота научили новым задачам по видео человека без дообучения

Исследователи представили Zero-WAM, каузальную видео-моторную модель для роботов-манипуляторов, которая выполняет задачи, никогда не встречавшиеся при обучении, если ей в качестве подсказки показать видео человека, выполняющего нужное действие. Идея заимствована у больших языковых моделей: там новую задачу можно поставить прямо в контексте запроса, без дообучения параметров модели (это называется обучением в контексте, in-context learning). Авторы переносят тот же принцип на роботов-манипуляторов и утверждают, что для физических действий естественной формой такой подсказки служит именно видео человека, а не текстовое описание задачи: видео несёт гораздо более богатые визуальные подсказки о том, как именно должно разворачиваться действие.
Чтобы обучить модель этому принципу, авторы столкнулись с нехваткой парных данных «человек делает, робот делает то же самое». Для решения они создали автоматический конвейер, который берёт траектории движений робота, сгруппированные по задачам, и превращает их в семантически подходящие видео с человеком. Так был собран датасет HumanGen: 74,2 тысячи пар «видео человека, действие робота» для обучения в контексте, охватывающих 8,6 тысячи разных задач. Отдельно авторы предложили специальную цель обучения, предсказание будущего фрагмента действия в контексте (IFP), которая не даёт модели "жульничать", опираясь на уже знакомые ей по обучению задачи, и заставляет её реально считывать информацию о задаче из видео-подсказки.
В симуляции RoboTwin 2.0 на семи задачах, которые модель не видела при обучении, Zero-WAM показала в среднем 47,0% успешных выполнений, это на 29,5 процентного пункта выше, чем у самой сильной из сравниваемых видео-моторных моделей-конкурентов (какая именно модель бралась за эталон, в тексте не уточняется). В экспериментах на реальных роботах модель также следовала видео-подсказкам человека и переносила знания на новые конфигурации задач, сцены с несколькими объектами, длинные многошаговые манипуляции и точную вставку мелких деталей; подробностей о числе задач, платформе робота или проценте успеха для этих реальных тестов авторы не приводят.
Ключевые факты
- Zero-WAM, модель для роботов-манипуляторов, которая выполняет незнакомые задачи, если показать ей видео человека, делающего то же самое, без дообучения на новых данных
- Принцип позаимствован у больших языковых моделей: там задачу можно задать прямо в контексте запроса вместо дообучения
- Собран датасет HumanGen, 74,2 тысячи пар «видео человека, действие робота» для 8,6 тысячи разных задач, полученных автоматическим конвейером
- На семи незнакомых задачах в симуляции RoboTwin 2.0 модель показала 47,0% успешных выполнений, на 29,5 п.п. выше лучшего конкурента среди видео-моторных моделей
- Модель также протестирована на реальных роботах: сцены с несколькими объектами, длинные многошаговые задачи, точная вставка деталей
Почему это важно
Главная проблема роботов-манипуляторов, они плохо переносят навыки на задачи, которых не было в обучающих данных: под каждую новую операцию обычно нужно собирать новый датасет и дообучать модель. Zero-WAM предлагает решить это так же, как решили аналогичную проблему для языковых моделей: не переобучать модель под новую задачу, а просто показать ей пример, только вместо текстового описания подсказкой служит видео, где нужное действие выполняет человек.
Кому это важно
Разработчикам робототехнических платформ и исследователям в области манипуляции объектами: подход снижает потребность в дорогих специализированных датасетах для каждой отдельной задачи. Также интересен командам, которые работают над переносом идей из области языковых моделей (обучение в контексте) в физические, воплощённые системы (embodied AI).
Как это применить
Ключевая практическая находка, автоматический конвейер, который превращает уже имеющиеся траектории движений робота в подходящие видео с человеком, что позволяет собирать такие обучающие пары без ручной разметки в промышленных масштабах. Датасет HumanGen (74,2 тысячи пар, 8,6 тысячи задач) и предложенная цель обучения IFP, ключевые компоненты предложенного авторами метода.
Можно ли доверять
Результаты представлены в виде конкретных цифр (47,0% успеха, прирост 29,5 п.п.) на признанном в индустрии симуляторе RoboTwin 2.0 и дополнены реальными экспериментами на физическом роботе, что повышает доверие. Однако в самой аннотации не названы ни авторы поимённо, ни организация, ни конкретная модель-конкурент, с которой сравнивали результат, ни детали постановки реальных экспериментов, эти данные можно найти только в полном тексте статьи.
Риски и подводные камни
47,0% успеха на семи задачах, это заметный прогресс относительно базовых моделей, но всё ещё означает, что более половины попыток заканчиваются неудачей: для практического применения в промышленности или быту этого пока недостаточно. Кроме того, качество работы напрямую зависит от того, насколько удачно синтетический конвейер HumanGen подбирает видео человека, семантически совпадающие с траекторией робота, ошибки на этом этапе могут ограничивать перенос навыков на реальные, более сложные сценарии.