MemBodied увеличила успех роботов в задачах на память в 7,81 раза

Большинство моделей класса Vision-Language-Action (VLA), управляющих роботами-манипуляторами, не сохраняют информацию об эпизоде за пределами текущего наблюдения. Авторы работы указывают, что это существенно ограничивает решение задач, зависящих от истории: успех таких задач определяется информацией, доступной только в прошлых наблюдениях. Держать эти наблюдения прямо в контексте модели можно, но это приводит к постоянно растущему и раздутому контексту и увеличивает задержку вывода.
Чтобы решить эту проблему, авторы предлагают MemBodied, эпизодическую память фиксированного размера с двумя компонентами: ассоциативным состоянием, которое фиксирует взаимодействия между вызовами политики (policy calls), и якорем эпизода, компактным представлением исходной сцены, которое служит опорной точкой. При каждом вызове политика формирует действие, опираясь не на сырые прошлые кадры, а на текущий вход и эти два компонента памяти.
На пяти задачах бенчмарка RMBench, требующих памяти, MemBodied показала среднюю успешность в 7,81 раза выше, чем у политики без памяти (stateless), и в 2,98 раза выше, чем у обычной рекуррентной памяти. По сравнению с самым сильным из существующих подходов с памятью MemBodied показала результат лучше в 1,3 раза, используя при этом в 10 раз меньше добавленных параметров. На полностью наблюдаемом наборе задач LIBERO-Long, где вся нужная информация видна в текущем кадре, MemBodied достигла успешности 90,6%, на 5,4% больше, чем у базовой политики π_0 без памяти.
Авторы делают вывод, что MemBodied, практичная альтернатива расширению контекста политики для задач манипуляции, зависящих от истории.
Ключевые факты
- Большинство VLA-моделей для роботов не сохраняют информацию об эпизоде за пределами текущего кадра, что мешает решать задачи, зависящие от прошлых наблюдений; хранение истории прямо в контексте раздувает его и увеличивает задержку.
- MemBodied, эпизодическая память фиксированного размера из двух частей: ассоциативное состояние (фиксирует взаимодействия между вызовами политики) и якорь эпизода (компактное представление исходной сцены).
- На пяти памятезависимых задачах RMBench MemBodied дала среднюю успешность в 7,81 раза выше stateless-политики и в 2,98 раза выше обычной рекуррентной памяти.
- MemBodied превзошла сильнейший существующий подход с памятью в 1,3 раза, добавив при этом в 10 раз меньше параметров.
- На полностью наблюдаемом наборе LIBERO-Long MemBodied достигла 90,6% успеха, на 5,4% больше базовой политики π_0.
Почему это важно
Роботы-манипуляторы часто должны выполнять действия, смысл которых зависит от того, что происходило раньше в эпизоде, а не только от текущей картинки. Большинство современных VLA-моделей эту информацию попросту теряют, а единственная прежняя альтернатива, держать все прошлые наблюдения в контексте, делает модель медленнее и тяжелее по мере роста эпизода. MemBodied предлагает компактный способ сохранить нужную историю без этого разрастания.
Кому это важно
Работа адресована исследователям и инженерам, разрабатывающим модели управления роботами (VLA), а также командам, которые строят манипуляторы для задач, требующих понимания истории действий, например, сборку по шагам или работу с частично скрытыми объектами.
Как это применить
Архитектурно MemBodied встраивается между наблюдением и генерацией действия: вместо сырых прошлых кадров политика на каждом вызове использует два компактных сигнала, ассоциативное состояние, копящее взаимодействия, и якорь эпизода с исходной сценой. Это позволяет заменить растущий по объёму контекст фиксированным по размеру блоком памяти, что особенно полезно там, где важны скорость вывода и предсказуемое потребление ресурсов.
Можно ли доверять
В тексте источника не указаны имена авторов, их институциональная принадлежность, дата публикации, место (конференция) или статус рецензирования, это работа с открытой публикацией без подробных метаданных. Все приведённые цифры, результат собственных экспериментов авторов на бенчмарках RMBench и LIBERO-Long; независимой проверки или сравнения с чужими воспроизведениями в тексте нет, названия конкретных моделей-baseline также не раскрыты.
Риски и подводные камни
Результаты получены на узком наборе бенчмарков для робототехники (пять задач RMBench и набор LIBERO-Long), и неясно, насколько они переносятся на другие манипуляционные задачи или реальных роботов вне тестовой среды. В тексте не раскрыты архитектурные детали сверх общего описания (ассоциативное состояние плюс якорь эпизода) и не названы конкретные модели, с которыми сравнивалась MemBodied, что затрудняет независимую оценку заявленного превосходства.