360CityArena: в новом бенчмарке городской навигации Gemini 2.5 Flash сильно отстаёт от человека

360CityArena: в новом бенчмарке городской навигации Gemini 2.5 Flash сильно отстаёт от человека

Кента Ватанабэ с соавторами представили 360CityArena, бенчмарк для оценки способности воплощённых ИИ-агентов (embodied agents) ориентироваться в городской среде. По словам авторов, существующие уличные бенчмарки либо недостаточно фотореалистичны, либо недостаточно сложны, из-за чего сильно отрываются от реальных городских условий. 360CityArena построен на реалистичной реконструкции района Акихабара в Токио: она собрана из 602 сегментов 360-градусного видео и охватывает 85 улиц. Бенчмарк включает 175 тщательно составленных вручную заданий трёх типов, понимание окружения, планирование маршрута и пространственное рассуждение, которые проверяют локализацию, поиск ориентиров, построение пути и понимание относительного расположения объектов.

Авторы протестировали на бенчмарке ИИ-агентов на основе крупных мультимодальных моделей (LMM). Лучший результат среди них показала модель Gemini 2.5 Flash, 17,1%, тогда как результат человека на тех же заданиях составил 77,3%. Авторы называют это существенным разрывом и заключают, что задачи городской навигации и пространственного рассуждения в масштабе целого района остаются для ИИ-агентов серьёзной нерешённой проблемой.

Ключевые факты

  • 360CityArena, бенчмарк для оценки навигации ИИ-агентов в фотореалистичной 3D-реконструкции района Акихабара (Токио), собранной из 602 сегментов 360-градусного видео и охватывающей 85 улиц
  • 175 заданий вручную разбиты на три категории: понимание окружения, планирование маршрута, пространственное рассуждение
  • Лучшая из протестированных моделей, Gemini 2.5 Flash, набрала 17,1%, человек на тех же заданиях набирает 77,3%
  • Авторы указывают, что существующие уличные бенчмарки не дотягивают до реальных городов по фотореализму или сложности
  • Разрыв между моделью и человеком авторы называют признаком серьёзных нерешённых проблем городской навигации ИИ-агентов

Почему это важно

Воплощённые ИИ-агенты (роботы, автономные ассистенты, системы дополненной реальности) должны уверенно ориентироваться в реальных городских кварталах, а не в упрощённых симуляциях. 360CityArena закрывает пробел, о котором пишут сами авторы: прежним уличным бенчмаркам не хватало либо фотореализма, либо сложности заданий, из-за чего результаты на них плохо предсказывали поведение агента в настоящем городе. Новый бенчмарк построен на реальной 360-градусной видеосъёмке целого токийского района, а не на синтетической графике, и полученный разрыв (17,1% против 77,3% у человека), прямое свидетельство, что городская навигация остаётся нерешённой задачей даже для сильных моделей.

Кому это важно

Исследователям и инженерам, разрабатывающим воплощённых ИИ-агентов и робототехнику для реальных городских сред: разработчикам навигационных ассистентов, командам, создающим мультимодальные модели с пространственным рассуждением, и всем, кто оценивает готовность LMM-агентов к задачам вне лабораторных симуляций.

Как это применить

360CityArena предлагается как тестовый стенд (testbed) для оценки агентов: 175 заданий трёх типов позволяют отдельно измерить, справляется ли агент с пониманием окружения, планированием маршрута или пространственным рассуждением. В тексте источника не указаны условия доступа, лицензия или стоимость использования бенчмарка.

Можно ли доверять

Материал, научная публикация (страница на Hugging Face Papers) с полным текстом аннотации, включая методологию сборки датасета и конкретные числовые результаты. При этом в доступном тексте не названы имена всех авторов и организации-разработчики, не указаны дата публикации, площадка или конференция, а также не раскрыта методология измерения результата человека (сколько людей тестировалось и как). Среди протестированных моделей по имени назван только лидер, Gemini 2.5 Flash, какие ещё модели участвовали в сравнении, в тексте не сказано.

Риски и подводные камни

Бенчмарк построен на одном районе одного города (Акихабара, Токио), поэтому не факт, что результаты обобщаются на другие городские среды и культуры. Оценивались только LMM-агенты, как поведут себя специализированные робото-навигационные системы, неизвестно. Само по себе очень низкое качество ИИ-агентов на реалистичных городских задачах (17,1% против 77,3% у человека), сигнал, что решения, опирающиеся на подобную городскую навигацию, пока рано считать надёжными.