Редактирование изображений вместо видео для управления роботами

ImageWAM переоценивает архитектуру моделей действия роботов. Вместо того чтобы генерировать полные видеопредставления будущего (энергозатратный подход), система использует предобученные модели редактирования изображений как основу. Ключевая идея: манипуляция роботом это «языковая трансформация визуальной сцены», точно как редактирование по инструкции.
Результаты показывают 93% успеха на RoboTwin 2.0, 98% на LIBERO и 84.5% на реальных манипуляторах. При этом потребление процессорных операций упало в 6 раз, а задержка в 4 раза. Система обходится без полного предсказания будущих кадров на этапе вывода, извлекая только промежуточные представления из процесса редактирования.
Ключевые факты
- ImageWAM использует кэши из моделей редактирования вместо полного видеопредсказания для управления роботами
- Производительность: 93% успеха на синтетических задачах и 84.5% на реальных манипуляторах
- Потребление ресурсов снизилось в 6 раз по FLOPs и в 4 раза по задержке против видеомоделей
- Подход работает потому, что редактирование по инструкции и манипуляция объектом семантически близки
Почему это важно
Текущие системы управления роботами часто полагаются на видеопредсказание: машина представляет себе все кадры будущего, что требует огромных вычислений. Эта работа показывает, что такой полнота неправильный инструмент для задачи. Редактирование изображения (стирание, добавление, преобразование объектов) ближе к тому, что на самом деле нужно роботу. Это сдвиг в том, как мы архитектурируем системы восприятия для управления.
Кому это важно
Робототехники и исследователи в области управления манипуляторами получают более быстрый и дешевый инструмент. Компании, использующие роботов на производстве или в логистике, могут применить этот подход для снижения затрат на вычисления на краях сети. Разработчики ИИ-систем для видения получают новый паттерн переиспользования готовых моделей редактирования.
Как это применить
Если вы строите систему управления роботом, попробуйте использовать любую готовую модель редактирования изображений (например, Stable Diffusion или другие диффузионные модели) вместо видеогенератора. ImageWAM показывает, что достаточно извлечь промежуточные представления из процесса редактирования без полного декодирования изображения. Для готовой внедрения посмотрите на архитектуру: редактирующая модель работает как кодировщик особенностей, которые питают предсказатель действия.
Можно ли доверять
Результаты кажутся убедительными: три разные тестовой среды (симуляция, синтетика, реальность) и сопоставление с видеобазовыми подходами. Авторы честно указывают успехи и пределы. Однако 84.5% на реальных роботах это не 100%, и масштабируемость на более сложные задачи остаётся открытым вопросом.
Риски и подводные камни
Система зависит от качества предобученной модели редактирования. Если редактирующая модель предвзята или натренирована на узком наборе объектов, это ограничит и робота. Кроме того, подход сильнее на «маленьких» манипуляциях (перемещение, ориентация) и может проиграть полносценному видеопредсказанию на сложной динамике с много объектов.
«We propose ImageWAM, which repurposes image editing models to replace video generation for robot action prediction»
— ImageWAM paper