Метод LIT учит роботов не полагаться на случайные визуальные подсказки

Фундаментные модели роботов, те, что по картинке с камеры, текстовой инструкции и состоянию робота предсказывают, как двигать его рабочим органом, хорошо справляются с задачами, похожими на обучающие данные, но резко теряют точность, когда меняются визуальные условия: ракурс камеры, освещение, посторонние предметы в кадре. Авторы работы объясняют это тем, что при обучении такие модели могут цепляться за случайные визуальные детали, которые в тренировочных демонстрациях просто совпадали с правильным действием, хотя сами по себе к задаче не относятся, это явление они называют «визуальной лазейкой» (в оригинале, vision-action shortcut). Пока случайная корреляция сохраняется, модель работает хорошо; как только условия съёмки меняются и корреляция рвётся, обучение «на лазейке» оборачивается ошибками. Просто урезать модели доступ к изображению нельзя, вместе со случайными деталями пропадёт и пространственная информация, которая роботу действительно нужна для движения; поэтому задача, которую ставят авторы, ограничить то, как визуальная информация используется для генерации действий, сохранив ту её часть, что относится к делу.
Предложенный метод, Latent Interface Training (LIT), двухэтапный и не привязан к конкретной архитектуре модели. На первом этапе модуль генерации действий обучают выдавать блоки действий, опираясь только на текстовую инструкцию, текущее состояние робота и целевую позу рабочего органа в конце каждого демонстрационного блока (положение и ориентацию в пространстве, в терминах статьи, позу в группе SE(3)), вообще без изображений. Так модель учится строить движение к цели независимо от зрения. На втором этапе поверх уже обученного модуля добавляют «латентный интерфейс», блок, который объединяет визуальные и смысловые признаки и становится единственным каналом, по которому модуль генерации действий получает визуальную информацию. Этот интерфейс обучают восстанавливать ровно ту целевую позу, на которой строился первый этап: такое обучение поощряет интерфейс сохранять нужную для цели пространственную информацию, а то, что он служит единственным каналом визуальной информации для модуля действий, ограничивает использование зрения при генерации действий и тем самым ослабляет лазейку.
Метод проверили на четырёх разных архитектурах, Pi0.5, MolmoAct2, FAST-WAM и ImageWAM, которые относятся к моделям «зрение-язык-действие» (vision-language-action) и «мир-действие» (world-action). На бенчмарке LIBERO-Plus, который проверяет устойчивость к смене визуальных условий, LIT поднял общую успешность на 3,87, 10,70 процентного пункта в зависимости от архитектуры; на обычном LIBERO, без искусственно изменённых условий, результат в среднем не ухудшился, а по части архитектур улучшился. В экспериментах с настоящими роботами, на трёх задачах, которые проверяли при незнакомых модели ракурсах камеры, изменённом освещении и посторонних предметах в кадре, успешность выросла на 13,30, 16,70 процентного пункта.
Ключевые факты
- Фундаментные модели роботов могут «жульничать»: вместо пространственной логики они запоминают случайные визуальные детали, которые в обучающих демонстрациях совпадали с нужным действием, авторы называют это «визуальной лазейкой» (vision-action shortcut).
- Метод Latent Interface Training (LIT) двухэтапный и не привязан к архитектуре: сначала модуль генерации действий учат работать по инструкции, состоянию робота и целевой позе рабочего органа, вообще без изображений.
- На втором этапе добавляют «латентный интерфейс», единственный канал визуальной информации, который обучают восстанавливать ту же целевую позу, что поощряет его сохранять нужную для цели информацию и ослабляет лазейку.
- Проверка на четырёх архитектурах (Pi0.5, MolmoAct2, FAST-WAM, ImageWAM) дала рост успешности на 3,87, 10,70 п.п. на бенчмарке LIBERO-Plus; на обычном LIBERO результат в среднем не ухудшился.
- В экспериментах с настоящими роботами на трёх задачах, при смене камеры, освещения и появлении посторонних предметов, успешность выросла на 13,30, 16,70 п.п.
Почему это важно
Роботы, которых обучают в контролируемых условиях, в реальном мире сталкиваются с ракурсами камеры, освещением и обстановкой, каких не было в обучающих демонстрациях, и именно здесь чаще всего проваливаются фундаментные модели роботов. Причина глубже, чем просто нехватка данных: модель может научиться пользоваться случайными визуальными приметами, которые в обучении совпадали с правильным действием, но сами по себе к задаче не относятся, такая «визуальная лазейка» работает, пока условия съёмки не изменились, и ломается, как только они меняются. LIT не заменяет базовую архитектуру и не требует новых датчиков, но добавляет отдельный обучаемый блок и меняет порядок обучения, и делает это так, что рецепт можно надстроить над уже существующими моделями: метод проверен сразу на четырёх разных архитектурах, а не подогнан под одну.
Кому это важно
В первую очередь, исследователям и инженерам, которые обучают модели «зрение-язык-действие» и «мир-действие» для роботов-манипуляторов: LIT, это готовый двухэтапный рецепт обучения, а не разовый трюк под одну задачу. Во вторую, тем, кто разворачивает роботов там, где камеру, свет и окружение нельзя раз и навсегда подогнать под обучающие данные (например, склад или дом), то есть именно там, где сегодняшние модели чаще всего теряют точность. Шире работа интересна всем, кто занимается проблемой обучения через случайные корреляции вместо сути задачи (shortcut learning): авторы предлагают конкретный рецепт борьбы с ней, а не только описывают проблему.
Как это применить
LIT, это порядок обучения, а не новая модель взамен существующей: сначала модуль генерации действий учат строить движение к цели по инструкции, состоянию робота и целевой позе рабочего органа без единого изображения, затем поверх него достраивают «латентный интерфейс», обучаемый восстанавливать ту же целевую позу по картинке, и делают его единственным каналом визуальной информации для уже обученного модуля. Поскольку метод проверен на четырёх разных существующих архитектурах, а не встроен намертво в одну, в принципе его можно добавить как дополнительный этап обучения к уже имеющемуся конвейеру, не переписывая модель с нуля.
Можно ли доверять
Это препринт, опубликованный на Hugging Face Papers, агрегаторе научных препринтов, а не в рецензируемом издании. В пользу метода, то, что его проверили не на одной модели, а сразу на четырёх разных архитектурах, и не только в симуляции (LIBERO-Plus), но и на настоящих роботах: это шире, чем типичная проверка на одном бенчмарке.
Риски и подводные камни
Проверка на настоящих роботах ограничена тремя задачами, узкая выборка, и сами авторы называют оценку в большем реальном масштабе открытым вопросом. На обычном LIBERO, без искусственно изменённых условий, эффект слабее и не гарантирован: в тексте сказано лишь, что результат «сохраняется или улучшается», а не что он растёт всегда, в отличие от более заметного и стабильного прироста на LIBERO-Plus и в реальных экспериментах.