ZimaBlue поднял точность действий роботов с 36,1% до 77,8%, обучаясь на видео от первого лица

ZimaBlue поднял точность действий роботов с 36,1% до 77,8%, обучаясь на видео от первого лица

Обучение роботов манипуляциям с предметами упирается в нехватку данных: чтобы модель хорошо обобщалась на новые ситуации, ей нужен большой объём физического опыта, но траектории с размеченными действиями робота дорого собирать, и их разнообразие ограничено. Видео от первого лица (egocentric), гораздо более масштабируемый источник опыта: в нём фиксируются взаимодействия с объектами, физика контакта, использование инструментов и долгие последовательности действий в разных обстановках. Ключевая сложность, как превратить это огромное, но лишённое разметки действий видео в реальное управление роботом.

Для решения этой задачи предложен ZimaBlue, масштабируемый фреймворк для обучения обобщающих моделей World Action Models (WAM, «модели мира и действий») на больших массивах видео. Обучение идёт в три стадии. Сначала модель проходит каузальное предобучение на видео от первого лица, как человеческом, так и роботизированном. Затем изученная визуальная динамика «заземляется» на разнородных траекториях реальных роботов через промежуточное видео-действенное обучение с единым представлением действий. На последней стадии модель специализируется под конкретного целевого робота для развёртывания.

Чтобы генеративные WAM можно было использовать для управления в реальном времени, ZimaBlue построен по асинхронной двухсистемной архитектуре Slow-Fast: тяжёлая «медленная» (Slow) модель мира формирует обобщающие пространственно-временные представления, а лёгкая «быстрая» (Fast) ветвь предсказывает действия с частотой 30 Гц на видеокарте NVIDIA RTX 4090.

В экспериментах на реальных роботах с нулевым дообучением (zero-shot) масштабирование обучающих данных, от использования только данных целевого робота до более чем 120 000 часов видео с воплощённым опытом, подняло долю успешных выполнений задач с 36,1% до 77,8%. По утверждению авторов, ZimaBlue также показывает высокие результаты на нескольких бенчмарках, причём особенно заметный прирост, на задачах, не встречавшихся модели при обучении.

Ключевые факты

  • ZimaBlue, фреймворк для обучения обобщающих World Action Models на большом объёме видео от первого лица вместо дорогих размеченных траекторий робота
  • Три стадии обучения: предобучение на видео людей и роботов → дообучение на разнородных траекториях реальных роботов с единым представлением действий → специализация под целевого робота
  • Для управления в реальном времени используется асинхронная архитектура Slow-Fast: тяжёлая модель мира плюс лёгкая ветвь, предсказывающая действия с частотой 30 Гц на NVIDIA RTX 4090
  • Масштабирование обучающего видео до более чем 120 000 часов подняло успешность выполнения задач роботом в реальных zero-shot экспериментах с 36,1% до 77,8%
  • Авторы отмечают устойчивые результаты на нескольких бенчмарках, с особенно заметным приростом на задачах, не встречавшихся при обучении

Почему это важно

Обучение роботов манипуляциям с предметами долго упиралось в дефицит данных: реальные размеченные траектории робота дороги и малочисленны. ZimaBlue предлагает выход, учиться на дешёвом и обильном видео от первого лица без разметки действий, а затем связывать эти знания с ограниченным набором реальных действий робота. Рост успешности с 36,1% до 77,8% при масштабировании видеоданных до 120 000+ часов показывает, что такой путь работает: чем больше видео, тем лучше робот справляется с задачами, которых не видел при обучении.

Кому это важно

Прежде всего, исследователям и инженерам, которые занимаются обобщающими моделями робототехники (общецелевыми манипуляторами, гуманоидными роботами) и упираются в нехватку размеченных данных о действиях. Также подход интересен командам, разрабатывающим системы управления роботами в реальном времени: архитектура Slow-Fast показывает, как совместить тяжёлую генеративную модель мира с быстрым исполнением на доступном потребительском железе вроде RTX 4090.

Как это применить

Практический путь, который описывает ZimaBlue: (1) предобучить модель на большом массиве видео от первого лица, человеческого и роботизированного, без какой-либо разметки действий; (2) дообучить её на разнородных траекториях реальных роботов с единым представлением действий, чтобы связать визуальную динамику с конкретными командами; (3) специализировать итоговую модель под целевого робота перед развёртыванием. Для управления в реальном времени модель разделяется на медленную часть, которая держит общее понимание сцены, и лёгкую быструю ветвь, которая на её основе выдаёт действия с частотой 30 Гц, этого достаточно для отклика в реальном времени на потребительской видеокарте.

Можно ли доверять

Материал опубликован как препринт на HuggingFace Papers и на момент пересказа набрал 41 отметку и 2 комментария, заметный, но не экстремальный интерес сообщества. В доступном тексте не указаны ни авторы, ни организация, которая стоит за работой, ни конкретные названия бенчмарков, на которых проверялся ZimaBlue, ни целевая платформа робота для финальной стадии обучения, это ограничивает независимую проверку заявленных цифр до появления кода, весов модели или рецензируемой публикации. Сами цифры успешности (36,1% и 77,8%) приведены в тексте источника как результат экспериментов на реальных роботах, а не только в симуляции.

Риски и подводные камни

Главный риск, воспроизводимость и обобщаемость за пределами условий эксперимента: без названий бенчмарков и данных о целевой платформе робота трудно сравнить ZimaBlue с другими работами или понять, насколько результат зависит от конкретной аппаратной конфигурации. Подход также требует огромного объёма видео (120 000+ часов) для заметного эффекта, это высокий порог входа для команд с меньшими ресурсами. Наконец, заявление об «особенно заметном приросте на новых задачах» пока не подкреплено в тексте конкретными цифрами по каждому бенчмарку, так что масштаб этого эффекта стоит воспринимать как предварительный.