PlayWorld: бенчмарк с ИИ-агентами выявил слабые места видеомоделей мира

PlayWorld: бенчмарк с ИИ-агентами выявил слабые места видеомоделей мира

Видеомодели мира, системы, которые по текущей картинке и действиям пользователя достраивают, что произойдёт дальше, кадр за кадром. Последние такие модели неплохо держат связность видео и точно реагируют на команды на длинных последовательностях, но сравнивать их между собой оказалось сложно. Обычно модель мира проверяет человек, добиваясь через взаимодействие конкретной долгосрочной цели, например, поворачивается на 360 градусов, чтобы увидеть, не исказилось ли пространство, или заходит в воду и смотрит, появляются ли на ней реалистичные круги. Но путь к одной и той же цели у разных моделей может сильно отличаться по числу и типу действий, поэтому сравнение по одному жёстко заданному сценарию действий для этого не годится.

Чтобы решить эту проблему, авторы предложили использовать вместо человека многомодальных ИИ-агентов (в тексте статьи, «Agent Players», агентов-игроков), которые сами добиваются заданной долгосрочной цели во взаимодействии с моделью мира. На этой идее построен PlayWorld, бенчмарк из 171 сценария, в каждом из которых задана своя цель. Модели оценивают по четырём параметрам: согласованность геометрии сцены, точность отклика на действия, поведение мира за пределами кадра и то, как оно меняется при возвращении в поле зрения, плюс базовые метрики качества видео и управляемости.

Эксперименты на девяти современных видеомоделях мира показали, что все они остаются ненадёжными в задачах с долгим горизонтом взаимодействия, особенно в том, чтобы удерживать пространственную согласованность сцены и стабильно сохранять состояние среды со временем. Код и данные бенчмарка PlayWorld выложены в открытом доступе на GitHub (kxding/PlayWorld).

Ключевые факты

  • PlayWorld, бенчмарк для видеомоделей мира из 171 сценария, в каждом задана своя долгосрочная цель: например, обойти сцену на 360 градусов и проверить, что пространство не «поехало», или зайти в воду и увидеть реалистичные круги на поверхности.
  • Вместо фиксированного сценария действий модели тестируют многомодальные ИИ-агенты («агенты-игроки»), они сами подбирают шаги для достижения цели, поэтому сравнение остаётся честным, даже если разные модели решают задачу разными путями.
  • Оценка идёт по четырём параметрам, согласованность геометрии сцены, точность отклика на действия, поведение мира за пределами кадра и то, как оно меняется при возвращении в поле зрения, плюс базовые метрики качества видео и управляемости.
  • Эксперименты на девяти современных видеомоделях мира показали: все они ненадёжны в задачах с долгим горизонтом взаимодействия, особенно в удержании пространственной согласованности и устойчивого состояния среды со временем.
  • Код и данные бенчмарка выложены в открытом доступе на GitHub (kxding/PlayWorld).

Почему это важно

До сих пор не было единого способа честно сравнить видеомодели мира между собой: путь к одной и той же цели у разных моделей может сильно отличаться, а тестирование по одному фиксированному сценарию действий для такого сравнения не годится. PlayWorld закрывает этот пробел, вместо жёсткого сценария он использует ИИ-агентов, которые сами преследуют заданную цель, и проверяет не «повторила ли модель одни и те же действия», а остаётся ли смоделированный мир связным и предсказуемым на длинной дистанции взаимодействия. Результат показателен: даже девять современных моделей не справились именно с этим базовым требованием, держать пространство согласованным и помнить своё состояние со временем.

Кому это важно

В первую очередь, командам, которые разрабатывают сами видеомодели мира: PlayWorld даёт им объективный способ проверить, где модель на самом деле ломается на длинных сценариях, а не просто сравнить качество отдельного кадра. Полезен бенчмарк и тем, кто использует такие модели дальше по цепочке, для симуляции окружений в играх, обучения роботов или тестирования ИИ-агентов, которым нужен предсказуемый и связный виртуальный мир: результаты PlayWorld показывают, что полагаться на долгосрочную устойчивость нынешних моделей мира пока рискованно.

Как это применить

Бенчмарк, код и данные PlayWorld выложены в открытом доступе на GitHub (репозиторий kxding/PlayWorld). Команды, которые разрабатывают свои видеомодели мира, могут прогнать их через все 171 сценарий и получить оценку по тем же четырём параметрам, что использовали авторы, вместо того чтобы полагаться на ручную проверку человеком. По сути это готовый регрессионный тест: прежде чем заявлять о долгосрочной согласованности новой модели, её можно сначала прогнать через PlayWorld и сравнить с результатами уже протестированных девяти моделей.

Можно ли доверять

Текст источника, аннотация препринта на Hugging Face Papers, не называет ни имён исследователей, ни организации, которая стоит за работой: это особенность жанра препринта, а не пробел пересказа. В плюс идёт то, что код и данные бенчмарка открыты на GitHub, результаты можно перепроверить самостоятельно, прогнав любую модель через тот же набор из 171 сценария. В минус, в тексте нет точных числовых оценок того, как именно каждая из девяти моделей выступила по каждому параметру: доступен только общий вывод «все девять моделей ненадёжны», сравнить конкретные модели между собой по этому материалу нельзя. На Hugging Face материал набрал 24 отметки при 1 комментарии, свежая, пока не обсуждённая широко публикация.

Риски и подводные камни

Как и любой новый бенчмарк, PlayWorld задаёт правила игры сам: набор из 171 сценария, четыре параметра оценки и то, что считается «правильным» поведением мира, выбрали авторы, и это может не совпадать с тем, что важно именно для конкретной задачи. Также не описано, какие модели или системы стоят за самими ИИ-агентами, выполняющими тестовые действия, а от их «умения играть» напрямую зависит, насколько справедливо бенчмарк оценивает разные модели мира. Наконец, в тексте не названы ни сами девять протестированных моделей, ни точные числа по каждой из них, статья описывает только общий вывод, детальных результатов для сравнения конкретных моделей друг с другом в материале нет.