Grounded Action Model: новый ИИ-фундамент для роботов с 3D-восприятием объектов

Grounded Action Model: новый ИИ-фундамент для роботов с 3D-восприятием объектов

Роботизированные модели манипуляции должны знать, какие объекты важны и где именно они находятся. Однако предобученные основы (backbones), на которых строятся современные фундаментальные модели роботов, языковые модели в архитектурах «видение-язык-действие» (VLA) и видео-генеративные модели в архитектурах «мир-действие» (WAM), не требуют этого напрямую: точное трёхмерное положение объекта модель осваивает лишь косвенно, по демонстрациям робота. Гэхао Чжан с соавторами предлагают Grounded Action Models (GAM), новый тип фундаментальных моделей робота, построенный на явном 3D-восприятии (grounding) объектов.

GAM принимает подсказку в одном из трёх видов, текстовое описание, точку на изображении или ограничивающую рамку, и превращает выбранные объекты в единое объектно-центричное представление, которое содержит визуальные признаки цели и её метрическую геометрию. Это представление смешивается с историей состояния робота через многопоточный (multi-stream) трансформер, который предсказывает порции (chunks) действий. GAM может работать автономно, а может выступать низкоуровневым исполнителем, которым управляет внешний высокоуровневый планировщик через разные модальности ввода, это открывает дорогу к длинным, растянутым во времени задачам, требующим памяти о предыдущих шагах.

В симуляции RoboTwin 2.0 GAM показал среднюю долю успеха 55,3% на 50 задачах, против 52,0% у модели Spatial Forcing; при случайной перестановке сцены результат GAM, 47,6% против 30,4% у Abot-M0, причём политика действий GAM обучалась только на демонстрациях без рандомизации сцены. На бенчмарке LIBERO-PRO GAM достиг лучшего среди сравниваемых моделей результата, 61% средней доли успеха на 16 вариантах помех, против 53% у модели π₀.₅; наибольший отрыв GAM показал там, где целевой объект в ходе задачи перемещали или заново обозначали.

На реальном оборудовании GAM сохранил 17 успехов из 20 попыток при визуальных изменениях сцены на двуруком роботе YAM, против 4 из 20 у π₀.₅. В связке с внешним планировщиком Molmo2 на роборуке Franka GAM завершил 64,7% шагов на длинных, зависящих от памяти задачах того же типа, что видел при обучении, и 49,8% шагов, на условиях, не встречавшихся в обучении.

Ключевые факты

  • GAM превращает языковую, точечную или рамочную подсказку в единое объектно-центричное представление с визуальными признаками цели и метрической геометрией, которое смешивается с историей состояния робота через многопоточный трансформер
  • На RoboTwin 2.0: средняя доля успеха 55,3% на 50 задачах против 52,0% у Spatial Forcing; при случайной перестановке сцены, 47,6% против 30,4% у Abot-M0, при обучении только на «чистых» сценах
  • На LIBERO-PRO: лучший результат среди сравниваемых моделей, 61% против 53% у π₀.₅ на 16 вариантах помех, с наибольшим отрывом при перемещении или переобозначении цели
  • На реальных роботах: 17 из 20 успехов при визуальных изменениях сцены на двуруком YAM против 4 из 20 у π₀.₅; в связке с планировщиком Molmo2 на роборуке Franka, 64,7% завершённых шагов в знакомых условиях и 49,8% в новых
  • GAM работает и как самостоятельный агент, и как низкоуровневый исполнитель под управлением внешнего высокоуровневого планировщика, это позволяет решать длинные задачи, требующие памяти о предыдущих шагах

Почему это важно

Современные фундаментальные модели роботов учатся понимать, где находится нужный объект, лишь косвенно, через тысячи демонстраций, опираясь на язык (VLA) или на видео-генерацию (WAM). Ни один из этих подходов не требует точного трёхмерного положения объекта как отдельного, явного входа, этому позволяют научиться самой модели, по опыту. GAM меняет постановку задачи: метрическая геометрия и положение объекта задаются явно, ещё до того, как модель начинает предсказывать действия.

Кому это важно

Разработчикам роботизированных манипуляторов и создателям фундаментальных моделей для роботов, GAM предлагает альтернативный способ подавать модели информацию об объектах: языком, точкой на изображении или рамкой, вместо того чтобы полагаться только на язык или видео. Важно и тем, кто строит связки «высокоуровневый планировщик + низкоуровневый исполнитель»: GAM способен работать в обеих ролях.

Как это применить

GAM принимает подсказку одного из трёх видов и переводит выбранные объекты в единое объектно-центричное представление с визуальными признаками цели и её метрической геометрией. Оно смешивается с историей состояния робота, после чего модель предсказывает порцию действий сразу. Для длинных, растянутых во времени задач, требующих памяти о предыдущих шагах, GAM можно подключить как низкоуровневый исполнитель к внешнему высокоуровневому планировщику (в экспериментах, Molmo2), который управляет им через разные модальности ввода.

Можно ли доверять

Результаты опираются на прямое сравнение с несколькими конкретными моделями на стандартных бенчмарках, а не только на собственные метрики авторов: на RoboTwin 2.0 и LIBERO-PRO GAM превосходит и Spatial Forcing/Abot-M0, и π₀.₅ по единым числовым показателям, а на реальном оборудовании превосходство подтверждено и на двух разных роботах (YAM и Franka). При этом текст не называет ни институт авторов, ни место публикации, ни то, будут ли открыты код, модели или данные.

Риски и подводные камни

Все цифры получены на конкретных бенчмарках (RoboTwin 2.0, LIBERO-PRO) и в сравнении с конкретными базовыми моделями, перенос преимущества на другие задачи, других роботов и условия вне лаборатории не гарантирован. Наибольший выигрыш GAM показывает именно там, где объект перемещают или заново обозначают в ходе задачи, то есть речь скорее о гибкости к изменению цели, чем об универсальном превосходстве по всем метрикам сразу.

«Модели манипуляции должны знать, какие объекты важны и где они находятся.»

— из аннотации к работе