RoboTok: сервис ищет видео с людьми, чтобы обучать роботов ловкости рук

RoboTok: сервис ищет видео с людьми, чтобы обучать роботов ловкости рук

Обучение роботов ловким действиям рук (манипуляциям) упирается в нехватку данных: собрать достаточно разнообразных демонстраций самим роботом дорого, а редкие, нетипичные задачи такой сбор почти не покрывает. Авторы предлагают решение, RoboTok, движок данных, который вместо того чтобы собирать новые записи с роботов, ищет уже существующие видео с людьми в интернете.

Принцип работы: пользователь задаёт видео-запрос, ролик, где человек выполняет нужное манипулятивное действие руками. RoboTok ищет по массиву интернет-видео ролики, где люди делают что-то похожее, и отдаёт их как демонстрации для обучения политики (алгоритма управления) робота.

Чтобы такой поиск работал, авторы обучили компактное скрытое (латентное) представление движения, «пространство движений», построенное на 3D-траекториях кистей рук, пересчитанных в систему координат, привязанную к самому человеку (актёро-центричную), а не к камере. Это позволяет сравнивать похожие действия даже если они сняты с разных ракурсов, в разных декорациях и при частичном перекрытии рук в кадре другими объектами. При этом представление достаточно компактное, чтобы эффективно искать и непрерывно индексировать по-настоящему огромные объёмы видео из интернета.

Авторы сравнили RoboTok с существующими подходами к подбору данных для роботов, как на тестах точности самого поиска, так и по итоговому качеству работы обученной на найденных демонстрациях политики робота. По их данным, RoboTok находит более релевантные демонстрации манипуляций и повышает успешность выполнения последующих задач роботом, чем сравниваемые методы; конкретные числовые показатели и названия использованных тестов (бенчмарков) в тексте источника не приведены. Вывод авторов: поиск, учитывающий траекторию кисти руки, превращает обычное видео из интернета в масштабируемый и постоянно растущий источник обучающих данных для робототехники.

Ключевые факты

  • RoboTok, движок данных, который ищет в интернет-видео демонстрации ловких действий рук человека, похожие на заданный видео-запрос
  • Задача, обойти дороговизну сбора данных силами самих роботов и нехватку покрытия редких, нетипичных задач
  • В основе, скрытое пространство движений, построенное на 3D-траекториях кистей рук в системе координат, привязанной к человеку, а не к камере
  • Такое представление устойчиво к смене ракурса камеры, декораций и частичному перекрытию рук в кадре, и достаточно компактно для поиска и индексации в масштабе всего интернета
  • По заявлению авторов, RoboTok превосходит существующие методы подбора демонстраций и повышает успешность обучаемой на них политики робота; конкретные цифры и названия тестов в источнике не указаны

Почему это важно

Обучение роботов ловким манипуляциям (взять, повернуть, вставить и подобные действия руками) обычно требует демонстраций, собранных именно на роботе, а это дорого и плохо масштабируется на длинный хвост редких задач. RoboTok предлагает обойти этот сбор данных, используя вместо него уже существующие видео с людьми из интернета, которых на порядки больше, чем любой набор, снятый роботами специально.

Кому это важно

В первую очередь, исследовательским командам и лабораториям, которые занимаются обучением политик для роботов-манипуляторов (например, роботизированных рук) и упираются в нехватку разнообразных демонстрационных данных. Также подход интересен тем, кто работает с поиском и индексацией видео по содержанию движения, а не только по картинке или тексту.

Как это применить

Практическая идея, использовать имеющееся видео с человеком, выполняющим нужное действие, как поисковый запрос, и получать на выходе релевантные ролики из интернета для обучения политики робота, вместо того чтобы записывать их вручную с самого робота. Метод описан как исследовательская работа; сведений о готовом продукте, доступности кода, цене или сроках выхода в источнике нет.

Можно ли доверять

Источник, материал с сайта, публикующего научные препринты (аннотация статьи), а не независимое издание или пресс-релиз компании; авторы статьи не названы прямо в тексте аннотации. Заявленное превосходство над существующими методами приведено самими авторами по итогам собственных экспериментов, без указания конкретных чисел, названий тестов (бенчмарков) или независимой проверки, типичная ситуация для препринта до рецензирования и публикации в независимом источнике.

Риски и подводные камни

В тексте отсутствуют количественные результаты, названия использованных тестов и данные о масштабе экспериментов, поэтому оценить, насколько велико реальное улучшение, по одной аннотации невозможно. Остаётся открытым и вопрос переноса: движения человеческой руки не тождественны движениям робота-манипулятора, и насколько хорошо найденные по видео демонстрации переносятся на конкретное железо, по тексту источника не ясно.