RoboDawn: визуально-языковая модель управляет роботом без обучения под конкретную задачу

Группа исследователей (первый автор, Мэн-Хао Го) представила RoboDawn, интерфейс, который даёт агентной визуально-языковой модели (VLM) прямое управление роботом через компактный набор дискретных команд: перемещение, поворот и управление схватом. VLM работает в замкнутом цикле: наблюдает текущее визуальное состояние, рассуждает о следующем действии, выполняет его и подстраивает дальнейшие решения под полученный результат. Авторы также предложили схему обучения в контексте (in-context learning, ICL): несколько демонстраций учат VLM пользоваться интерфейсом и решать конкретную задачу без изменения весов модели.
На бенчмарке RoboTwin 2.0 C2R доля успешных попыток RoboDawn выросла с 53,2% в режиме без обучения на задачу (zero-shot) до 73,6% после добавления одной демонстрации (one-shot), это превзошло результат базовой политики π0.5 (46,0%), специально обученной на данных бенчмарка. На бенчмарке RoboDojo показатель вырос с 35,67% (zero-shot) до 47,17% (one-shot). По утверждению авторов, уже в режиме zero-shot RoboDawn превосходит несколько сильных политик, обученных на данных конкретного бенчмарка, а добавление одной демонстрации даёт существенный прирост и устанавливает новые лучшие результаты (SOTA).
Ту же схему перенесли на реального робота, манипулятор Franka, где RoboDawn справился с задачами перекладывания кубика в корзину и складывания кубиков в стопку. Численный показатель успешности для этих реальных экспериментов в источнике не приведён, только то, что перенос состоялся.
Ключевые факты
- RoboDawn, интерфейс, дающий агентной VLM прямое управление роботом через дискретные команды перемещения, поворота и схвата, без обучения модели на данных конкретной задачи.
- На RoboTwin 2.0 C2R успешность выросла с 53,2% (zero-shot) до 73,6% после одной демонстрации (one-shot), обогнав обученную базовую политику π0.5 (46,0%).
- На RoboDojo успешность выросла с 35,67% (zero-shot) до 47,17% (one-shot).
- Одна демонстрация задачи через обучение в контексте (ICL) даёт заметный прирост качества без дообучения весов модели.
- Метод перенесён на реального робота Franka: он выполнил задачи перекладывания кубика в корзину и складывания кубиков, численный показатель успешности для этого в источнике не указан.
Почему это важно
VLM обычно обучают работать с текстом и изображениями, а не с движениями робота. RoboDawn показывает, что рассуждающая VLM способна напрямую управлять роботом через компактный набор дискретных команд без обучения на данных конкретной задачи или бенчмарка, это ставит под вопрос необходимость обучать отдельную политику под каждую новую задачу робота с нуля.
Кому это важно
Разработчикам робототехнических систем и специалистам по машинному обучению, которые сейчас тратят ресурсы на сбор данных и обучение отдельной модели-политики под каждую задачу робота, а также исследователям VLM и агентных систем, изучающим перенос интеллекта из цифровой среды в физическую.
Как это применить
Интерфейс RoboDawn переводит наблюдения робота в визуальное состояние, понятное VLM, и даёт модели решать задачу в замкнутом цикле, наблюдать, рассуждать о следующем действии, выполнять его и корректировать план по результату. Добавление всего одной демонстрации задачи через обучение в контексте даёт существенный прирост качества без дообучения весов модели, что подходит для быстрого прототипирования новых задач для роботов.
Можно ли доверять
Результаты подкреплены числами на двух бенчмарках (RoboTwin 2.0 C2R и RoboDojo) и переносом на реального робота Franka, а не только на симуляции. При этом в источнике не названы ни организация авторов, ни конкретная VLM-модель, лежащая в основе RoboDawn, ни даты проведения экспериментов, что мешает независимо оценить воспроизводимость.
Риски и подводные камни
Для задач переноса кубика в корзину и складывания кубиков на реальном роботе Franka в источнике не приведён численный показатель успешности, известно лишь, что перенос состоялся, без цифр. Авторы также не раскрывают, какая именно VLM использовалась в качестве основы, что затрудняет оценку того, насколько результат зависит от конкретной модели.