Blender-VideoBench: бенчмарк ловит ИИ-агентов на непонимании видео

Исследователи предложили новый способ проверять, насколько ИИ-агенты по-настоящему понимают видео, а не просто отвечают на вопросы о нём. Бенчмарк называется BVB, Blender-VideoBench: агенту дают реальное видео и просят программно воссоздать его как анимированную 3D-сцену в редакторе Blender, если агент действительно понял, что происходит в ролике (какие объекты, как они движутся, где расположены в пространстве и времени), он сможет закодировать это в сцену.
Чтобы сравнение агентов было честным, все они работают через единый лёгкий харнесс (программную обвязку) Mini-BVB, в одинаковой песочнице и с одинаковым лимитом на вычислительные затраты. Готовую реконструкцию рендерят с той же анимированной камеры, что и в оригинальном видео, и оценивают по двум осям. Dual VQA считает, сколько пространственно-временных фактов из исходного видео сохранилось в реконструкции, это проверяют вопросами и ответами по картинке. Latent Similarity измеряет, насколько реконструкция похожа на исходное видео перцептивно, то есть визуально, на взгляд. Итоговый балл, среднее квадратного корня (square-root mean) из этих двух метрик; такая формула сознательно не даёт набрать высокий счёт за счёт одной только оси, требуя баланса.
Авторы прогнали через бенчмарк 51 конфигурацию из 10 семейств моделей. Лучшая модель набрала 88.6 по Latent Similarity, картинка получается очень похожей на оригинал, но сохранила лишь 53.7% пространственно-временных фактов, правильных в исходном видео, по Dual VQA: то есть примерно половину деталей о том, что и как происходило в ролике, модель теряет или искажает. Увеличение объёма рассуждений (reasoning) у моделей улучшает визуальное сходство реконструкции, но не закрывает этот разрыв в фактической точности.
Отдельно авторы провели слепое исследование с 15 асессорами (людьми-оценщиками) на пяти конфигурациях моделей: оказалось, что оценка по Latent Similarity сильно коррелирует с тем, что реально предпочитают люди. Вывод авторов: программная реконструкция, рабочий способ тестировать понимание видео ИИ-агентами, а главная нерешённая проблема, именно сохранение смысла (семантики) происходящего, а не визуальное правдоподобие картинки.
Ключевые факты
- Бенчмарк BVB (Blender-VideoBench) заставляет ИИ-агента программно пересобрать реальное видео как анимированную сцену в Blender, а не просто отвечать на вопросы о нём.
- Единый харнесс Mini-BVB и общий лимит вычислительных затрат делают сравнение разных агентов честным.
- Оценка идёт по двум осям: Dual VQA, сохранение пространственно-временных фактов, Latent Similarity, перцептивное сходство реконструкции с оригиналом; итоговый балл, их среднее квадратного корня.
- Из 51 протестированной конфигурации (10 семейств моделей) лучшая даёт 88.6 по Latent Similarity, но сохраняет лишь 53.7% фактов по Dual VQA.
- Дополнительные рассуждения модели улучшают визуальное сходство, но не устраняют потерю фактов; связь Latent Similarity с оценками людей подтверждена слепым тестом на 15 асессорах.
Почему это важно
Большинство бенчмарков для понимания видео проверяют модель вопросами и ответами, это легко подделать поверхностными паттернами, не понимая сцену на самом деле. BVB меняет постановку задачи: агент должен не ответить, а воссоздать видео программно, как анимированную 3D-сцену. Это заставляет модель явно проявить, что она поняла об объектах, их движении и расположении в пространстве и времени, а не подобрать правдоподобный ответ.
Кому это важно
Разработчикам и исследователям мультимодальных ИИ-агентов, которые работают с видео, генерацией 3D-контента и кодогенерацией по визуальным данным, а также всем, кто оценивает агентные модели и ищет более строгие тесты понимания, чем классический вопрос-ответ.
Как это применить
Бенчмарк и харнесс Mini-BVB можно использовать как готовый тест для собственных агентных моделей, работающих с видео и Blender-подобными средами. Разрыв между высоким Latent Similarity и низким Dual VQA, удобный индикатор: если он большой, модель визуально правдоподобна, но фактически ошибается в деталях происходящего, и это стоит проверять отдельно, а не полагаться на «похожесть» картинки.
Можно ли доверять
Охват заметный: 51 конфигурация из 10 семейств моделей, плюс отдельная проверка метрики Latent Similarity слепым исследованием на 15 живых асессорах, это независимое подтверждение, что метрика отражает человеческое восприятие, а не только внутреннюю логику авторов. При этом в доступном тексте не названы ни авторы, ни организация, ни даты, ни конкретные модели за пределами агрегированных цифр, оценить репутацию авторов или воспроизводимость по самому источнику нельзя. Обсуждение на площадке публикации минимальное (18 очков, 2 комментария), независимой проверки результатов на момент пересказа не было.
Риски и подводные камни
Главный риск, ровно тот, что и демонстрирует сам бенчмарк: система может визуально правдоподобно реконструировать видео, «выглядя» так, будто поняла его, но при этом терять или искажать половину значимых фактов о происходящем. Если при оценке агентных систем полагаться только на визуальное сходство (аналог Latent Similarity) без проверки фактической точности (аналог Dual VQA), можно систематически переоценивать реальный уровень понимания видео такими агентами.