Anchor-Align повышает успешность ИИ-роботов после дообучения

Anchor-Align повышает успешность ИИ-роботов после дообучения

VLA-модели (от vision-language-action, «зрение, язык, действие»), это системы, которые получают на входе изображение и текстовую команду, а на выходе выдают движения робота-манипулятора. Стандартный способ их создавать, дообучить предобученную модель, понимающую изображения и текст (VLM), на демонстрациях робота методом поведенческого клонирования (BC): модель просто учится повторять движения из примеров. Проблема в том, что такое дообучение постепенно «стирает» предобученные представления VLM, которые отвечали за визуальное и смысловое обобщение, то есть способность узнавать объекты и сцены, которых не было в обучающих демонстрациях. Распространённое лекарство, совместное обучение на веб-данных из пар «изображение, текст» вместе с данными робота, проблему не решает: оно применяет функцию потерь для языка и функцию потерь для действий к разным наблюдениям, из-за чего у VLA-моделей возникает рассогласование между языком и действием, а стандартные тесты манипуляции роботом этого не выявляют.

Двип Далал (Dwip Dalal) с соавторами предложили метод Anchor-Align, который добавляет к поведенческому клонированию две дополнительные задачи обучения. Первая, привязка зрения и языка (Vision-Language Anchoring): во время дообучения представления модели по слоям сверяются с представлениями замороженной копии исходной, ещё не дообученной VLM, эта копия работает как «якорь», не позволяя представлениям уплыть от исходных и потерять способность к обобщению. Вторая, согласование языка и действия (Language-Action Alignment): каждое целевое действие робота переводится в дискретную метку направления движения, а предсказание языка и предсказание действия обучаются совместно на одном и том же наблюдении робота, а не на разных, как раньше.

На физическом манипуляторе xArm7 и на двух широко используемых архитектурах VLA-моделей Anchor-Align поднял успешность выполнения задач с 28% до 54% на одной архитектуре и с 37% до 60%, на другой. В экспериментах на симуляции метод стабильно улучшал результаты на трёх бенчмарках: LIBERO-PRO (устойчивость к условиям, которых не было при обучении), LIBERO-Plus (устойчивость к изменениям восприятия) и CALVIN (управление в длинных многошаговых сценариях). Авторы делают вывод, что сохранение предобученных представлений и эффективное обучение действиям не противоречат друг другу, оба качества можно получить одновременно. Страница проекта, anchoralignvla.github.io.

Ключевые факты

  • Дообучение VLA-моделей поведенческим клонированием (BC) постепенно стирает предобученные представления модели VLM, из-за чего робот хуже обобщает на новые объекты и сцены.
  • Совместное обучение на веб-данных «изображение, текст» проблему не решает: оно применяет языковую функцию потерь и функцию потерь действий к разным наблюдениям и порождает рассогласование языка и действия, которое стандартные тесты манипуляции не ловят.
  • Метод Anchor-Align добавляет две задачи: привязку представлений к замороженной копии исходной VLM (Vision-Language Anchoring) и совместное обучение языка и дискретных меток направления движения на одном наблюдении (Language-Action Alignment).
  • На физическом манипуляторе xArm7 метод поднял успешность выполнения задач с 28% до 54% на одной VLA-архитектуре и с 37% до 60%, на другой.
  • В симуляции Anchor-Align стабильно улучшил результаты на бенчмарках LIBERO-PRO (устойчивость к новым условиям), LIBERO-Plus (устойчивость к визуальным помехам) и CALVIN (долгие многошаговые сценарии).

Почему это важно

Дообучение, практически единственный способ научить модель, понимающую зрение и язык, реально управлять роботом-манипулятором, но именно оно портит те качества модели, ради которых её вообще брали, способность узнавать новые объекты и ситуации. Anchor-Align показывает, что эту потерю можно устранить не за счёт сбора новых данных, а за счёт того, как организовано само обучение, двумя дополнительными функциями потерь поверх привычного поведенческого клонирования. Значительный рост успешности проверен не только в симуляции, а на физическом манипуляторе xArm7, для embodied AI (ИИ, управляющего физическими роботами) это более весомое подтверждение, чем результаты одних лишь бенчмарков.

Кому это важно

В первую очередь, исследователям и инженерам, которые дообучают VLA-модели для роботов-манипуляторов: складских роботов, промышленных манипуляторов, гуманоидных роботов. Метод можно встроить прямо в существующий процесс поведенческого клонирования, не собирая дополнительных данных. Полезно и командам, которые оценивают такие модели: работа показывает, что стандартные бенчмарки манипуляции не ловят рассогласование языка и действия, а значит, нужны дополнительные проверки. Косвенно это касается всех, кто следит за прогрессом embodied AI, разрыв между результатами в симуляции и на реальном роботе остаётся одной из главных проблем области.

Как это применить

Технически метод, это две дополнительные функции потерь поверх обычного поведенческого клонирования. Нужно держать замороженную копию исходной, ещё не дообученной VLM и на каждом шаге дообучения сверять с ней представления модели по слоям (Vision-Language Anchoring); и нужно перевести непрерывные действия робота в дискретные метки направления движения, обучая предсказание языка и предсказание действия на одном и том же наблюдении, а не порознь (Language-Action Alignment). Новых демонстраций или другого оборудования для этого не требуется, меняется только процедура обучения; авторы проверили подход на двух разных архитектурах VLA, то есть метод не привязан к одной конкретной модели. Сведений о цене, лицензии или сроках публикации кода в источнике нет, указана только страница проекта anchoralignvla.github.io.

Можно ли доверять

Материал взят со страницы Hugging Face Papers, это витрина препринта, судя по всему, ещё не прошедшего рецензирование в журнале или на конференции, а не независимо проверенное исследование; кроме имени первого автора, других имён или ссылки на полный текст в доступном тексте нет. В пользу доверия, авторы проверяли метод не только в симуляции, но и на физическом манипуляторе xArm7, причём сразу на двух независимых архитектурах VLA, а не подгоняли цифры под один частный случай. На момент пересказа у публикации 10 голосов и 2 комментария на Hugging Face, независимого обсуждения пока почти не было, поэтому цифры стоит воспринимать как заявленные авторами, а не как подтверждённый третьей стороной факт.

Риски и подводные камни

Метод требует держать в памяти ещё одну, замороженную копию исходной VLM ради дистилляции представлений, это дополнительные вычисления при обучении, во сколько именно раз дороже, в тексте не сказано. Перевод действий робота в дискретные метки направления движения, упрощение: для задач с точной непрерывной моторикой, а не просто «двигай в эту сторону», такое огрубление в принципе способно снижать точность, хотя на проверенных задачах оно, наоборот, помогло. Все количественные результаты получены на конкретных бенчмарках (LIBERO-PRO, LIBERO-Plus, CALVIN) и одном типе манипулятора (xArm7), насколько метод переносится на других роботов, другие сенсоры или принципиально другие задачи, из текста не следует. Данных о публикации кода, лицензии или независимой воспроизводимости эксперимента в источнике нет.