RoboSPA: новый бенчмарк показал слабости VLA-моделей в пространственном мышлении и планировании

RoboSPA: новый бенчмарк показал слабости VLA-моделей в пространственном мышлении и планировании

Чжэньсюань Фань (Zhenxuan Fan) с соавторами представили RoboSPA (Robot Spatial-Procedural Assessment), большой датасет и бенчмарк для диагностики того, как рассуждают VLA-модели (vision-language-action, «зрение, язык, действие»): системы, которые по картинке и текстовой инструкции управляют роботом-манипулятором. Авторы отмечают, что существующие датасеты и бенчмарки в основном проверяют, выполнена ли задача целиком, в заранее заданных условиях, и почти не показывают, как модель рассуждает при усложнении пространственных и процедурных условий.

RoboSPA устроен вокруг двух измерений: точного пространственного мышления (Fine-Grained Spatial Reasoning) и процедурного планирования на длинном горизонте (Long-Horizon Procedural Planning). Бенчмарк охватывает 10 категорий задач и 56 базовых задач; каждая задача дана в пяти уровнях сложности, что в сумме даёт 280 вариантов с нарастающей пространственной неоднозначностью и процедурной сложностью. Для датасета собрано 527 тысяч траекторий на разных роботических платформах и в разных сценах.

Помимо бинарного показателя «выполнено / не выполнено», RoboSPA вводит собственные диагностические метрики для более детальной оценки. В экспериментах на нескольких характерных VLA-моделях (какие именно, в тексте не названы) авторы показали, что современные системы всё ещё плохо справляются со сложными пространственными отношениями, точным низкоуровневым исполнением действий и планированием, которое требует удерживать в памяти длинную последовательность шагов. Конкретные числовые результаты по каждой модели (например, проценты успешности) в тексте не приводятся, только этот качественный вывод.

По итогам авторы позиционируют RoboSPA как сложный диагностический бенчмарк для разработки более способных, надёжных и лучше обобщающихся воплощённых агентов (embodied agents). Данные и код бенчмарка выложены в открытом доступе на GitHub (fanzhenxuan/RoboSPA).

Ключевые факты

  • RoboSPA, датасет и бенчмарк для роботов-манипуляторов на VLA-моделях, который проверяет точное пространственное мышление и планирование на длинном горизонте, а не только итоговый успех задачи.
  • Бенчмарк охватывает 10 категорий и 56 базовых задач; каждая дана в 5 уровнях сложности, итого 280 вариантов с растущей пространственной и процедурной сложностью.
  • Датасет собран из 527 тысяч траекторий на разных роботических платформах и в разных сценах.
  • Помимо доли успешных попыток RoboSPA даёт диагностические метрики, показывающие, в чём именно ошибается модель, в пространстве или в процедуре.
  • В экспериментах современные VLA-модели плохо справлялись со сложными пространственными отношениями, точным низкоуровневым исполнением и удержанием в памяти длинных последовательностей шагов; данные и код бенчмарка открыты на GitHub.

Почему это важно

Большинство существующих бенчмарков для VLA-моделей меряют одно: выполнена задача целиком или нет, причём в простых заранее заданных условиях. Это не показывает, где именно модель начинает ошибаться при усложнении сцены или самой процедуры действий. RoboSPA закрывает этот пробел: он специально устроен так, чтобы разделять два разных источника трудности, точное понимание пространства (где что находится и как до этого дотянуться) и способность удерживать в памяти длинную последовательность шагов, и даёт диагностические метрики, а не только долю успеха. Для области, которая быстро продвигает VLA-модели как способ управления реальными роботами, такой более подробный измеритель прогресса важен: он показывает не «работает или нет», а где именно и почему модель ломается.

Кому это важно

В первую очередь, исследовательским командам и лабораториям, которые разрабатывают и обучают VLA-модели для роботов-манипуляторов: RoboSPA даёт им стандартизированный набор из 280 вариантов задач нарастающей сложности, на котором можно сравнивать модели между собой. Полезен он и инженерным командам, которые оценивают, готова ли конкретная модель к реальному применению на роботе: диагностические метрики показывают не просто, что модель ошиблась, а в каком именно измерении, пространственном или процедурном. Данные и код выложены в открытом доступе, так что ими может воспользоваться любая группа, работающая с воплощёнными (embodied) агентами.

Как это применить

Авторы выложили данные и код в открытом доступе на GitHub (fanzhenxuan/RoboSPA). Практическое применение, оценка уже обученных VLA-моделей: лаборатория прогоняет свою модель через 280 вариантов задач RoboSPA (10 категорий, пять уровней сложности) и получает не только итоговую долю успешных попыток, но и разбивку по диагностическим метрикам, отдельно по пространственным ошибкам и по ошибкам процедурного планирования.

Можно ли доверять

RoboSPA описан в препринте, который появился в ленте статей Hugging Face; в тексте не указаны ни площадка публикации, ни то, прошла ли работа рецензирование. Имена конкретных VLA-моделей, которые тестировали авторы, и точные числовые результаты по каждой из них в тексте не приведены, есть только общий качественный вывод, что современные системы «всё ещё плохо справляются». Оценка проведена авторами на их собственном бенчмарке: и набор задач, и выбор моделей для сравнения, их решения, независимой проверки результатов на момент публикации нет. Это не повод отбрасывать выводы, но воспринимать их стоит как предварительные, до публикации с полными числами и рецензирования.

Риски и подводные камни

Главный риск для читателя, судить о состоянии VLA-моделей в целом по тексту, где нет ни одной цифры успешности и ни одного названия модели: неясно, насколько сильно и на каких именно системах проявляется описанная слабость. Бенчмарк только что опубликован, независимых повторных прогонов другими лабораториями пока нет, как и любой новый тест, со временем он может оказаться недостаточно сложным, если модели начнут дообучать конкретно под его задачи, либо, наоборот, выявлять проблемы, специфичные для набора роботических платформ и сцен, которые выбрали авторы, а не для VLA-подхода как такового.