GST-Bench: новый бенчмарк показал, что нейросети сильно уступают людям в пространственном мышлении на видео

GST-Bench: новый бенчмарк показал, что нейросети сильно уступают людям в пространственном мышлении на видео

Исследователи представили бенчмарк GST-Bench, тест визуального вопрос-ответа (VQA), который проверяет не локальное, а глобальное пространственное восприятие нейросетей в видео. Существующие тесты пространственного интеллекта оценивают понимание сцены по одному-двум статичным ракурсам, а GST-Bench устроен иначе: модель должна следить за длинным непрерывным видеопотоком, отвечать на вопросы с точки зрения ракурса, которого в самом видео не было, и переносить наблюдения от первого лица на общую карту сцены сверху.

Вопросы бенчмарка проверены людьми и построены на основе 6790 минут синтетически сгенерированного видео. Авторы протестировали на GST-Bench 22 современные визуально-языковые модели (VLM) и обнаружили большой разрыв с человеком: лучшая модель в режиме zero-shot (без дообучения под задачу) набрала лишь 42,68 балла, заметно ниже результата человека в 79,08 балла.

Чтобы понять причину разрыва, авторы дополнительно собрали облегчённую версию теста, GST-Bench-Local, которая проверяет только локальное пространственное восприятие в той же постановке задачи. На ней модели показали уверенный результат: само по себе восприятие пространства у них работает. Проблема в другом, модели не умеют собирать наблюдения, сделанные за долгий промежуток времени, в единую и согласованную картину сцены целиком.

Вместе с бенчмарком авторы выпустили GST-Train, отдельный датасет для обучения именно глобальному пространственному мышлению, задуманный как ресурс для дальнейших исследований в этой области.

Ключевые факты

  • Бенчмарк GST-Bench проверяет глобальное, а не локальное восприятие пространства нейросетями по длинному видео
  • Вопросы теста проверены людьми и построены на 6790 минутах синтетически сгенерированного видео
  • Лучшая из 22 протестированных VLM набрала 42,68 балла против 79,08 у человека
  • Дополнительный тест GST-Bench-Local показал: модели хорошо понимают пространство локально, но теряют целостную картину сцены на длинных видео
  • Вместе с бенчмарком выпущен датасет GST-Train для обучения моделей глобальному пространственному мышлению

Почему это важно

Пространственный интеллект, база для воплощённых ИИ-агентов вроде роботов: чтобы действовать в реальном мире, система должна не просто узнавать объекты на кадре, а удерживать в голове общую карту пространства по мере движения. GST-Bench впервые системно проверяет именно эту способность на длинных видео, а не на одном-двух статичных кадрах, и результат показывает: даже сильнейшие современные модели пока справляются с этим намного хуже человека, 42,68 балла против 79,08.

Кому это важно

В первую очередь, исследователям и командам, которые разрабатывают визуально-языковые модели (VLM) и системы для роботов и других воплощённых агентов: GST-Bench даёт им конкретную метрику, где именно проседает пространственное мышление их моделей. Полезен он и тем, кто оценивает готовность мультимодальных моделей к задачам навигации и взаимодействия с реальным миром.

Как это применить

Авторы выложили не только сам бенчмарк GST-Bench для оценки моделей, но и облегчённую версию GST-Bench-Local для диагностики локального восприятия, а также датасет GST-Train, его можно использовать для дообучения моделей на задаче глобального пространственного мышления. Это готовые инструменты: их можно прогнать через собственную VLM, чтобы увидеть, где именно она теряет целостную картину сцены.

Можно ли доверять

Материал, препринт с HuggingFace Papers (arXiv), вопросы бенчмарка проверены людьми, а не сгенерированы без контроля. При этом в источнике не названы ни авторы, ни организация, стоящая за работой, это стоит учитывать при оценке.

Риски и подводные камни

Видео для вопросов сгенерировано синтетически, а не снято в реальном мире, поэтому неясно, насколько результаты на GST-Bench переносятся на настоящие сцены и настоящих роботов. В источнике также не указано, какие именно модели вошли в число 22 протестированных и какая из них набрала 42,68 балла, это ограничивает возможность независимо проверить и повторить результат.