ARC-Bench показал: JEPA-модели мира не умеют ранжировать действия
Планировщики на основе моделей мира без явного сигнала вознаграждения выбирают действие, оценивая варианты по расстоянию в замороженном латентном пространстве: чем ближе предсказанный результат действия к эмбеддингу цели, тем лучше действие. Это молчаливо предполагает, что близость в латентном пространстве соответствует реальному качеству действия, то есть что порядок вариантов по расстоянию совпадает с порядком по их истинным затратам. Эту предпосылку раньше напрямую не проверяли.
Авторы работы представляют ARC-Bench, протокол без утечки данных о решении и с фиксированным набором вариантов действий, и применяют его к официально опубликованным моделям мира на архитектуре JEPA (JEPA-WM), тестируя их и на навигации, и на манипуляции объектами. Результат: предпосылка нарушается серьёзно и системно. В официальных тестах на манипуляцию действие с лучшей оценкой почти всегда оказывается не лучшим по факту; та же инверсия ранжирования проявляется и в лабиринтных сценариях (maze). Дефект сохраняется и при замене визуального бэкбона DINOv2 на энкодеры V-JEPA 1 и V-JEPA 2, предобученные на видео, масштаба ViT-L и ViT-G. Проверки происхождения данных, недообученности, контроль с одинаковым бюджетом вычислений для бэкбона и контроль на цикличность метрики исключают тривиальные объяснения находки.
Авторы объясняют, почему дефект оставался незамеченным: его маскирует перепланирование в закрытом контуре (closed-loop). Когда частоту перепланирования снижают, успешность резко падает и в навигационном, и в манипуляционном сценарии, а эпизоды, которые удаётся «спасти» именно за счёт частого перепланирования, это преимущественно те, где по диагностике первого плана в PointMaze исходное ранжирование действий было ошибочным особенно сильно. Отсюда вывод: показатели успешности в закрытом контуре систематически завышают реальную способность замороженных латентных представлений корректно ранжировать действия.
Ключевые факты
- ARC-Bench, новый протокол без утечки данных о решении и с фиксированным набором вариантов действий для проверки, умеют ли JEPA-модели мира верно ранжировать действия по расстоянию в латентном пространстве.
- На официально опубликованных чекпойнтах JEPA-моделей мира предпосылка о ранжируемости латентного расстояния нарушается серьёзно и системно: в манипуляционных тестах действие с лучшей оценкой почти всегда не лучшее на деле, та же инверсия, в лабиринтных сценариях.
- Дефект не связан с конкретным визуальным бэкбоном: он сохраняется при замене DINOv2 на видео-предобученные V-JEPA 1 и V-JEPA 2 масштаба ViT-L/ViT-G, а дополнительные контроли исключают тривиальные объяснения (недообученность, происхождение данных, разный бюджет вычислений, цикличность метрики).
- Причина, по которой дефект долго оставался незамеченным, перепланирование в закрытом контуре: при его снижении успешность резко падает и в навигации, и в манипуляции.
- Эпизоды, «спасённые» частым перепланированием, как раз те, где первый план строился на сильно ошибочном ранжировании (диагностика PointMaze), поэтому обычные метрики успеха в закрытом контуре завышают реальную ранжируемость латентных представлений.
Почему это важно
Многие современные планировщики на моделях мира (в том числе на архитектуре JEPA) молчаливо полагаются на то, что расстояние в латентном пространстве говорит о качестве действия. ARC-Bench впервые проверяет это предположение напрямую и показывает, что оно ложно, причём не в частном случае, а системно, на официально опубликованных моделях и в разных доменах (навигация и манипуляция).
Кому это важно
Исследователям и инженерам, которые строят или используют планировщики на замороженных латентных представлениях (JEPA-стиль, V-JEPA 1/2 и подобные модели мира) для навигации и робо-манипуляции, а также тем, кто оценивает такие системы только по итоговой успешности в закрытом контуре, метрика может скрывать реальный дефект планирования.
Как это применить
Авторы предлагают ARC-Bench как инструмент диагностики: протокол без утечки данных и с фиксированным набором вариантов действий позволяет проверить ранжируемость действий у конкретной модели мира до того, как её встроят в систему с частым перепланированием, которое способно маскировать проблему. Отдельная диагностика первого плана (на примере PointMaze) позволяет отличить настоящую способность модели ранжировать действия от эффекта частых исправлений плана на лету.
Можно ли доверять
Источник, препринт на arXiv с изложением метода, экспериментов и контролей (происхождение данных, недообученность, одинаковый бюджет вычислений для бэкбона, цикличность метрики), которые авторы приводят, чтобы исключить тривиальные объяснения находки. В доступном тексте нет имён авторов, организаций, точных численных показателей ошибки ранжирования, даты публикации или площадки и сведений о выпуске кода или датасета ARC-Bench, это ограничивает независимую проверку и указывает на предварительный характер материала.
Риски и подводные камни
Если успешность планировщика меряют только по конечному результату в закрытом контуре с частым перепланированием, системный дефект ранжирования действий у модели мира может годами оставаться незамеченным, пока не изменятся условия, например, снизится частота перепланирования или вычислительный бюджет на исправление плана. Это особенно рискованно для приложений, где перепланирование ограничено по стоимости или времени.