Метод VLAct повысил точность VLA-моделей роботов при меньшем объёме данных

Метод VLAct повысил точность VLA-моделей роботов при меньшем объёме данных

Собрать много данных с реальных роботов гораздо дороже, чем собрать веб-тексты и изображения: каждая траектория робота требует физического эксперимента, а не скачивания страницы. Поэтому авторы работы утверждают, что при ограниченном бюджете данных о роботах узким местом становится не количество траекторий, а качество представлений: продолженное предобучение должно превращать немногочисленные траектории в переносимое зрительно-двигательное знание, а не просто подгонять модель под конкретные действия.

Авторы предлагают метод VLAct, VLA-ориентированный бэкбон на основе VLM (модели «зрение-язык»), который проходит продолженное предобучение на широких, разнородных данных от роботов с разным телесным воплощением (multi-embodiment), прежде чем дообучаться под конкретную задачу. Метод сохраняет исходные «широкие» знания VLM-модели и старается закрепить общую семантику действий между разными воплощениями роботов за счёт трёх приёмов: сохранения VLM-прайора, совместного обучения с несколькими головами на непрерывных действиях (multi-head continuous action co-supervision) и частично унифицированной разметки действий между воплощениями (partially unified cross-embodiment action layout). При этом на этапе дообучения под задачу у модели остаются task-specific головы предсказания действий.

Проверка проведена в симуляции, на реальных роботах и на переносе на невиданное ранее воплощение. На бенчмарках LIBERO-Plus и RoboTwin 2.0 VLAct обходит промышленные VLA-системы ABot-M0 и LingBot-VLA, достигая доли успешных попыток 82,6% и 92,5% соответственно (сами цифры конкурентов авторы не приводят, указано лишь, что VLAct их превосходит). На бенчмарке RoboDojo VLAct занимает шестое место среди всех проверенных политик по доле успеха и опережает по обоим показателям все системы, явно отнесённые к классу world-action-моделей (WAM, модели «мир-действие»). Самый заметный результат, на RoboCasa-GR1, невиданном ранее воплощении гуманоидного робота: используя всего 20% траекторий для дообучения под задачу, VLAct превосходит базовую модель GR00T-N1.6, обученную на полном наборе данных. Все результаты получены на полностью открытых данных и на установке всего из 16 GPU, что, по утверждению авторов, показывает: предобучение с упором на качество представлений может давать конкурентоспособный результат при скромном бюджете вычислений и представляет собой самостоятельную ось прогресса VLA-моделей, отдельную от простого наращивания объёма данных.

Ключевые факты

  • VLAct, метод продолженного предобучения VLA-моделей роботов, который делает упор на качество представлений, а не на объём данных о роботах
  • На LIBERO-Plus и RoboTwin 2.0 VLAct обходит промышленные системы ABot-M0 и LingBot-VLA с долей успеха 82,6% и 92,5% соответственно
  • На RoboDojo VLAct занимает шестое место среди всех политик и опережает по обоим метрикам все world-action-модели (WAM)
  • На невиданном ранее гуманоидном воплощении RoboCasa-GR1 VLAct, используя всего 20% данных для дообучения, превосходит модель GR00T-N1.6, обученную на полном наборе
  • Все результаты получены на открытых данных и на установке из 16 GPU, без крупного вычислительного бюджета

Почему это важно

Данные о роботах масштабировать намного труднее, чем веб-данные: каждая траектория требует реального физического эксперимента. Работа предлагает альтернативу простому наращиванию объёма, улучшать качество представлений внутри модели ещё на этапе предобучения. Авторы формулируют это как отдельную, независимую ось прогресса VLA-моделей, а не замену масштабированию данных.

Кому это важно

Разработчикам VLA-моделей и лабораториям робототехники, которые упираются в дороговизну сбора данных с реальных роботов; командам, работающим с гуманоидными и разнотипными платформами (multi-embodiment), где нужен перенос знаний между разными телесными конструкциями; а также исследователям с ограниченным вычислительным бюджетом, метод показал результат на установке всего из 16 GPU.

Как это применить

VLAct, это VLM-бэкбон, который сначала проходит продолженное предобучение на широких разнородных данных от роботов с разным воплощением, а затем дообучается под конкретную задачу со своей специализированной головой предсказания действий. Три технических элемента: сохранение исходных знаний VLM (VLM-prior preservation), совместное обучение нескольких голов на непрерывных действиях и частично унифицированная разметка действий между разными воплощениями роботов. Всё построено на открытых данных, что делает подход воспроизводимым без доступа к закрытым датасетам.

Можно ли доверять

Источник, карточка препринта на Hugging Face Papers с полным текстом аннотации; проверка результатов проведена сразу на нескольких независимых бенчмарках (LIBERO-Plus, RoboTwin 2.0, RoboDojo, RoboCasa-GR1), включая симуляцию, реальных роботов и перенос на невиданное воплощение, это добавляет веса заявленным цифрам. При этом в тексте не раскрыты числовые показатели самих систем-конкурентов (ABot-M0, LingBot-VLA, GR00T-N1.6), только то, что VLAct их превосходит, а также не указаны авторы, организации и размер (число параметров) самой модели.

Риски и подводные камни

Оценка достижений опирается на цифры, представленные самими авторами метода, без раскрытия точных показателей конкурирующих систем, сравнить масштаб превосходства напрямую невозможно. На бенчмарке RoboDojo VLAct занимает лишь шестое место среди всех политик, заметный, но не лидирующий результат. Не раскрыт полный список остальных пяти политик, обошедших VLAct на RoboDojo, и не уточнено, какие именно системы считаются «промышленными VLA» помимо двух названных.