RoboFollow: новый бенчмарк показал, что роботы хуже следуют командам, чем кажется по отчётам

Современные воплощённые агенты (embodied agents), роботы, управляемые моделями vision-language-action (VLA) и world-action model (WAM), демонстрируют высокие показатели успешного выполнения задач. Но авторы новой работы утверждают, что реальная способность этих систем следовать текстовым инструкциям намного слабее, чем говорят цифры в отчётах. Причину они называют «низкой энтропией сцены»: если визуальная сцена допускает только один разумный вариант действия, языковая инструкция становится избыточной, робот может показывать высокий результат, почти не используя саму команду и ориентируясь только на то, что видит.
Чтобы вскрыть эту проблему, авторы предложили бенчмарк RoboFollow, построенный на трёх принципах. Во-первых, «высокая энтропия сцены»: каждая обучающая сцена поддерживает несколько кинематически различных вариантов задачи, из-за чего одного зрения агенту недостаточно и он вынужден опираться на язык. Во-вторых, иерархический диагностический протокол из четырёх уровней (L0, L3), который постепенно усложняет визуальную раскладку и семантику сцены, проверяя, дают ли одинаковые по смыслу инструкции устойчивое поведение, а разные, различимое, по таким параметрам, как пространственные отношения, атрибуты объектов, ограничения траектории и логика задачи. В-третьих, «диагностика с контролем побочных факторов»: объекты взаимодействия упрощены, набор доступных действий ограничен тем, чему агент обучен, а результат фиксируется отдельно по двум показателям, понимание намерения (Intent) и исполнение движения (Execution), чтобы отделить понимание команды от механики движения.
На бенчмарке проверили девять политик классов VLA и WAM. Оказалось, что даже там, где агент показывал сильный результат на базовом уровне L0, это не гарантирует устойчивого переноса на усложнённые уровни L1, L3 при использованной авторами схеме дообучения. Попытки закрыть этот разрыв с помощью типовых приёмов, более сильных базовых VLM-моделей, совместного обучения с вопросами-ответами (QA co-training), метода LangForce и Classifier-Free Guidance, не сработали ни в одном случае. Авторы делают вывод, что подлинное следование инструкциям остаётся критическим, но недооценённым узким местом в разработке воплощённых агентов. Код и датасет бенчмарка выложены в открытом доступе на GitHub и Hugging Face.
Ключевые факты
- Бенчмарк RoboFollow показывает, что реальное понимание словесных команд у роботов слабее, чем показывают их высокие оценки успеха
- Причина, «низкая энтропия сцены»: если сцена допускает лишь один разумный вариант действия, языковая инструкция становится не нужна агенту
- Бенчмарк построен на трёх принципах: сцены с несколькими вариантами задач, четырёхуровневый протокол L0, L3 и раздельные оценки понимания намерения и исполнения
- Проверены девять политик классов VLA и WAM: сильный результат на базовом уровне L0 не переносится надёжно на усложнённые уровни L1, L3
- Ни один из опробованных методов улучшения (более сильные VLM, QA co-training, LangForce, Classifier-Free Guidance) не закрыл этот разрыв; код и датасет открыты
Почему это важно
Работа ставит под сомнение то, как обычно измеряют качество роботов, управляемых языковыми командами: высокий процент успешных попыток может маскировать то, что агент фактически игнорирует инструкцию и просто угадывает единственно возможное действие в сцене. Это методологическая проблема, влияющая на то, как индустрия оценивает прогресс воплощённого ИИ.
Кому это важно
Исследователям и инженерам, разрабатывающим модели vision-language-action и world-action model для роботов, а также командам, которые формируют бенчмарки и метрики для оценки таких систем.
Как это применить
Код бенчмарка и датасет выложены в открытом доступе на GitHub (AutoLab-SAI-SJTU/RoboFollow) и Hugging Face (AutoLab-SJTU/robofollow-data), их можно использовать для проверки собственных моделей на устойчивость к более сложным и разнообразным формулировкам инструкций, а не только на сценах с единственным очевидным решением.
Можно ли доверять
Материал, научная публикация с описанной методологией, конкретным числом протестированных моделей (девять) и открытыми кодом и датасетом для воспроизведения результатов. В доступном тексте не указаны авторы, их институциональная принадлежность и дата публикации, а также не приведены конкретные числовые показатели разрыва между уровнями L0 и L1, L3, только сам факт, что разрыв не был устранён.
Риски и подводные камни
Авторы проверили лишь ограниченный набор из четырёх приёмов устранения проблемы и девяти моделей, неясно, обобщается ли вывод на другие архитектуры и методы обучения. Само определение «низкой энтропии сцены» и уровни сложности L0, L3, авторская методология, и результаты зависят от того, насколько она отражает реальные условия работы роботов вне лаборатории.
«Когда визуальная сцена допускает лишь один верный вариант задачи, язык становится избыточным, и модель может показывать высокий результат, почти не используя его»
— авторы исследования