World Action Agent: новый ИИ-harness учит VLM управлять роботами через репетицию действий

World Action Agent: новый ИИ-harness учит VLM управлять роботами через репетицию действий

Визуально-языковые модели (VLM) обладают широкими знаниями и пространственным мышлением, но, по словам авторов работы, существующие системы управления роботами используют их лишь косвенно, либо для предсказания ограничений и написания программ, либо просто показывая модели сцену, а не давая ей мир, в котором можно действовать. Чтобы решить эту проблему, исследователи представили World Action Agent (WAA), мультиагентный harness (программную оболочку), через которую VLM управляет роботом с помощью базовых инструментов, принимая каждое решение внутри так называемого визуального рабочего пространства действий.

Это пространство устроено на трёх принципах. Во-первых, «контактные виды», ракурсы сцены, которые система автоматически выбирает исходя из геометрии сцены вокруг текущей точки взаимодействия. Во-вторых, «репетиция действия»: каждое действие превращается в редактируемое предложение, которое агент, самостоятельно или с помощью отдельного Imagination Agent, предварительно просматривает и правит с учётом обратной связи от планирования, прежде чем выполнить его на роботе. В-третьих, «коррекция в поле зрения», замыкание цикла между наблюдением, репетицией и низкоуровневым выполнением, позволяющее агенту убирать остаточные смещения прямо в том виде, где он их замечает.

Через это же рабочее пространство WAA накапливает процедурные знания двумя способами: система «выращивает» мультимодальные навыки из видео экспертов и обучения человеком под контролем на основе проверки результатов, обращаясь к ним через отдельного Skill Agent, а также использует собранные следы взаимодействия для дообучения VLM меньшего размера, которые затем сами способны управлять тем же harness.

На бенчмарке LIBERO-Pro версия WAA, чьи навыки развились только на данных LIBERO-90, достигла рекордного среднего показателя успеха 75,6%, обойдя сквозные (end-to-end) VLA-модели, агентов типа «код как политика» (code-as-policy) и базовый визуальный harness с тем же backbone-моделью. При этом те же навыки остались эффективными и на симуляторе robosuite без дополнительного обучения. Отдельно авторы показали, что дообучение модели Qwen3.5-9B на трассах, собранных через harness, подняло её успех на задачах вне исходного домена с 1,7% до 43,3%.

Ключевые факты

  • World Action Agent (WAA), мультиагентная система, где VLM управляет роботом через 'визуальное рабочее пространство действий', а не просто наблюдает за сценой.
  • Три принципа пространства: автоматически подбираемые 'контактные виды' сцены, 'репетиция действия' (проверка и правка перед выполнением, в том числе через Imagination Agent) и 'коррекция в поле зрения' для устранения остаточных смещений.
  • Навыки WAA формируются из видео экспертов и обучения человеком под контролем и доступны через Skill Agent; собранные следы взаимодействия также используются для дообучения меньших VLM.
  • На бенчмарке LIBERO-Pro WAA с навыками, развитыми только на LIBERO-90, достигла рекордных 75,6% среднего успеха, обойдя end-to-end VLA-модели, code-as-policy агентов и визуальный harness-baseline с тем же backbone.
  • Дообучение модели Qwen3.5-9B на трассах harness подняло её успех вне исходного домена с 1,7% до 43,3%.

Почему это важно

Авторы указывают на разрыв в существующих подходах: VLM либо применяют косвенно, для предсказания ограничений или написания программ управления, либо дают им лишь визуальный обзор сцены без возможности реально действовать в ней. WAA предлагает другой принцип: модель принимает решения внутри рабочего пространства, где каждое действие можно 'отрепетировать', проверить и поправить до реального выполнения на роботе, что, по заявленным результатам, повышает надёжность манипуляций.

Кому это важно

Материал адресован исследователям в области робототехники и мультимодальных моделей, инженерам, работающим над манипуляционными задачами роботов, и разработчикам VLM, которые ищут способы перехода от пассивного восприятия сцены к активному управлению физическим агентом.

Как это применить

В тексте не указано, планируют ли авторы публиковать код или обученные модели, а также на каком именно оборудовании или роботах проводились эксперименты, источник этого не раскрывает. Судя по описанию, подход применим там, где нужно расширить возможности VLM с простого 'видения' сцены до итеративного планирования и коррекции действий манипулятора.

Можно ли доверять

Материал представляет собой описание научной работы, размещённой на странице препринтов Hugging Face; в доступном тексте не указаны имена авторов, их институциональная принадлежность и дата публикации. Приведённые числовые результаты (75,6%, рост с 1,7% до 43,3%) взяты дословно из текста работы, но независимая проверка или рецензирование в самом источнике не описаны.

Риски и подводные камни

Результаты получены на симуляционных бенчмарках (LIBERO-Pro, robosuite); источник не сообщает, тестировалась ли система на реальных роботах и оборудовании, поэтому перенос на физические манипуляторы остаётся открытым вопросом. Также неясно, насколько устойчиво дообучение меньших VLM (как в случае Qwen3.5-9B) масштабируется на другие модели и задачи за пределами описанных экспериментов.

«Существующие системы либо используют VLM косвенно, для предсказания ограничений или написания программ, либо дают им лишь взгляд на сцену, а не мир, в котором можно действовать.»

— из текста работы