Представлен бенчмарк SpaceCast-Bench: лучшая из 21 модели набрала 58,0% против 87,2% у людей

Представлен бенчмарк SpaceCast-Bench: лучшая из 21 модели набрала 58,0% против 87,2% у людей

Авторы работы отмечают, что существующие тесты пространственного мышления в основном проверяют пространственное восприятие: умение считать отношения, которые уже видны во входных данных. Реальный пространственный интеллект, по их словам, требует предсказательного пространственного мышления: построить сцену по наблюдениям, предугадать, как её изменит вмешательство, и рассуждать о ненаблюдаемом исходе.

Для проверки этого умения они представляют SpaceCast-Bench и называют его первым бенчмарком, который оценивает эту способность напрямую и диагностически. Бенчмарк построен вокруг схемы «наблюдение, преобразование, вывод» (observe-transform-infer). В нём 3 862 вопроса по 182 реальным сценам, они охватывают 16 типов задач на трёх уровнях: статическое восприятие, локальное предсказание и глобальное предсказание. Уровни последовательно требуют понимания сцены, обновления пространственного состояния и реляционного вывода о ненаблюдаемых исходах.

Оценка 21 модели показала резкий разрыв: сильнейшая модель набирает лишь 58,0% при 87,2% у людей, а специализированные по пространству модели остаются около случайного уровня. Контролируемые анализы, по утверждению авторов, показывают, что «мостовые» виды (bridge views) критичны для объединения разрозненных наблюдений, а явные 3D-данные помогают моделям надёжнее, чем сгенерированные изображения или видео исхода.

Наконец, дообучение на программно сгенерированных авторами данных поднимает Qwen3-VL-4B с 34,0% до 65,7%; при этом сообщается о макроусреднённом приросте на шести внешних (вне предметной области) бенчмарках.

Ключевые факты

  • SpaceCast-Bench: 3 862 вопроса по 182 реальным сценам, 16 типов задач на трёх уровнях (статическое восприятие, локальное и глобальное предсказание).
  • Проверяется не только восприятие, но и предсказание: как изменится сцена после вмешательства и каков ненаблюдаемый исход.
  • Из 21 оценённой модели сильнейшая набрала 58,0% против 87,2% у людей; пространственно специализированные модели остаются около случайного уровня.
  • По выводам авторов, «мостовые» виды важны для объединения наблюдений, а явные 3D-данные помогают надёжнее, чем сгенерированные изображения или видео исхода.
  • Дообучение Qwen3-VL-4B на программно сгенерированных данных подняло результат с 34,0% до 65,7%.

Почему это важно

Большинство тестов пространственного мышления, по оценке авторов, проверяют лишь чтение уже видимых отношений между объектами. SpaceCast-Bench смещает акцент на предсказание: что произойдёт со сценой, если в неё вмешаться. Разрыв в 58,0% у сильнейшей модели против 87,2% у людей показывает, что в этой способности модели пока заметно отстают.

Кому это важно

Исследователям визуально-языковых моделей и пространственного мышления: новый набор из 3 862 вопросов даёт диагностику по уровням и типам задач. Также тем, кто выбирает модели для задач, где нужно предвидеть последствия действий в сцене, например в робототехнике: результаты показывают, что специализированные пространственные модели остаются около случайного уровня. Это вывод по тексту работы; применение к конкретным областям в источнике не обсуждается.

Как это применить

Бенчмарк можно использовать как диагностику: три уровня позволяют увидеть, на каком шаге модель ломается, при понимании сцены, обновлении пространственного состояния или выводе о ненаблюдаемом исходе. Авторы также показывают, что дообучение на программно сгенерированных ими данных поднимает Qwen3-VL-4B с 34,0% до 65,7%. Из контролируемых анализов следует практический ориентир: явные 3D-данные помогают моделям надёжнее, чем сгенерированные изображения или видео исхода.

Можно ли доверять

Это описание новой работы, основанное на её аннотации; выводы о «первом» бенчмарке и о причинах результатов принадлежат самим авторам и независимо не проверены. В тексте не названы сами 21 модель (в том числе сильнейшая), не указана метрика за процентами и не раскрыты детали оценки людьми, поэтому сравнивать цифры с другими тестами нужно осторожно.

Риски и подводные камни

Цифры 58,0%, 87,2%, 34,0% и 65,7% приведены без названия метрики, и непонятно, как именно считали результат людей. Для шести внешних бенчмарков указан лишь факт макроусреднённого прироста, без названий и величины. Прирост Qwen3-VL-4B получен на данных, сгенерированных авторами для этого же бенчмарка, поэтому его не стоит автоматически переносить на другие задачи.