H2R-Bench выявил: видеомодели мира часто не справляются с переносом манипуляций человека на роботов

Обучение роботов манипуляциям, хватанию, перекладыванию, использованию предметов, требует больших объёмов демонстрационных данных, а собирать такие демонстрации на реальных роботах дорого и трудно масштабировать. При этом в интернете уже накоплено огромное количество видео от первого лица, где манипуляции с предметами выполняет человек: это дешёвый и обильный источник данных о поведении. Проблема в переносе: рука человека устроена не так, как захват робота, поэтому напрямую использовать такие ролики для обучения робота нельзя. Модели мира, которые генерируют видео (видеомодели мира), то есть генеративные модели, предсказывающие, как будет развиваться сцена, в теории могли бы решать эту задачу, синтезируя из ролика с человеком аналогичный ролик с роботом. Но насколько они реально умеют переносить манипуляции между настолько разными телами, до сих пор всерьёз не проверялось.
Авторы предлагают для этого H2R-Bench, бенчмарк, который прицельно измеряет именно эту способность: перенести манипуляцию человека на робота заданной конструкции. Каждый пример в бенчмарке, это ролик с демонстрацией человека, описание целевого типа робота, для которого нужно сгенерировать видео, и разметка, привязанная к самому ролику: какая у задачи цель, из каких событий-действий она состоит, где происходит функциональный контакт (моменты содержательного соприкосновения руки или захвата с предметом) и как предметы реагируют на воздействие. Сгенерированное моделью видео оценивается по пяти отдельным параметрам: достигнуто ли целевое состояние задачи, воспроизведены ли все события-действия, правильно ли перенесён функциональный контакт с предметом, корректно ли показано тело робота и какого качества получилось видео в целом.
На бенчмарке H2R-Bench проверили одиннадцать современных видеомоделей мира, по шести категориям манипуляционных задач и двум типам роботов. Результат: перенос манипуляций с человека на робота остаётся нерешённой задачей даже для лучших моделей, они часто ошибаются сразу в трёх местах: неправильно изображают тело и захват робота, некорректно передают физическое взаимодействие с предметом и не доводят саму манипуляцию до завершения.
Авторы называют H2R-Bench системным диагностическим инструментом: он позволяет проверить, способны ли видеомодели мира преодолеть разрыв между телом человека и телом робота и превратить обычные видео с манипуляциями человека в пригодный для обучения роботов материал.
Ключевые факты
- Сбор демонстраций на реальных роботах дорог и плохо масштабируется, а видео манипуляций человека от первого лица, дешёвый, но трудно переносимый на роботов источник данных из-за разницы между рукой человека и захватом робота.
- H2R-Bench, бенчмарк, где видеомодели мира должны превратить ролик с манипуляцией человека в ролик с манипуляцией робота заданной конструкции; каждый пример размечен по цели задачи, событиям-действиям, функциональным контактам и реакциям предметов.
- Оценка идёт по пяти параметрам: достижение целевого состояния, завершённость событий-действий, перенос функционального контакта, корректность тела робота и общее качество видео.
- На бенчмарке протестировали одиннадцать современных видеомоделей мира по шести категориям манипуляционных задач и двум типам роботов.
- Даже лучшие модели часто ошибаются сразу по трём направлениям: неверно показывают тело робота, некорректно передают контакт с предметом и не доводят манипуляцию до конца, перенос человек-робот остаётся нерешённым.
Почему это важно
Масштабирование обучения роботов манипуляциям упирается в нехватку данных: реальные демонстрации собирать дорого, а огромный массив видео с манипуляциями человека, потенциально дешёвая замена, если научиться превращать его в видео с роботом. H2R-Bench впервые системно проверяет, действительно ли современные видеомодели мира умеют делать этот перенос, а не просто красиво генерировать видео. Ответ, который даёт бенчмарк, пока не вполне: разрыв между человеком и роботом остаётся серьёзным препятствием даже для лучших моделей.
Кому это важно
В первую очередь, исследователям и командам, которые разрабатывают видеомодели мира и генеративные подходы к синтезу данных для роботов: бенчмарк H2R-Bench даёт им измеримый способ проверить, работает ли перенос человек-робот, вместо того чтобы полагаться на общее качество видео. Полезен он и специалистам по обучению манипуляционных политик роботов, которые рассматривают синтетические ролики как источник тренировочных данных, а также всем, кто оценивает, насколько зрелым инструментом сейчас являются видеомодели мира для практических задач робототехники.
Как это применить
Бенчмарк раскладывает единую оценку качества видео на пять отдельных измерений, поэтому команда, которая разрабатывает свою видеомодель мира, может увидеть не просто общий балл, а конкретное слабое место: путает ли модель тело робота, неверно передаёт физический контакт с предметом или просто не доводит манипуляцию до конца. Это превращает бенчмарк H2R-Bench в инструмент точечной диагностики, а не просто в ещё один рейтинг моделей.
Можно ли доверять
Методика построена так, что каждый пример размечен по самому ролику с человеком, с привязкой к цели задачи, событиям-действиям, контактам и реакциям предметов, а оценка ведётся по пяти отдельным параметрам вместо одного общего числа: это осознанно системный подход, а не просто демонстрация ярких провалов. При этом источник не называет ни сами протестированные модели, ни их числовые оценки по каждому из пяти параметров, сказано только, что даже лучшие спотыкаются на согласованности тела робота, контакте и завершении задачи, а точные цифры и место каждой модели в сравнении по тексту не проверить. Не указано и то, публиковалась ли работа в рецензируемом издании.
Риски и подводные камни
Главный риск назван в самой статье: даже ведущие видеомодели мира сейчас часто ошибаются в теле робота, физическом контакте с предметом и завершении задачи, если такие синтетические ролики без проверки использовать как обучающие данные для реальных роботов, эти ошибки перенесутся и в поведение робота. H2R-Bench обнажает проблему, но сам её не решает: это инструмент диагностики, а не готовое исправление. Конкретные протестированные модели, категории манипуляций и типы роботов в тексте не названы, поэтому нельзя судить, насколько результаты обобщаются за пределы этих шести категорий и двух типов роботов.