VGI-Bench: новый бенчмарк показал, что лучшая модель генерации видео набрала лишь 51% по критериям бенчмарка на визуальное мышление

Сюань Хэ с соавторами представили VGI-Bench, бенчмарк для проверки того, насколько модели генерации видео способны к визуальному мышлению через сгенерированные кадры. Отправная точка работы: недавние исследования показывают, что видеомодели могут проявлять некоторые формы zero-shot визуального мышления (рассуждения без специального обучения под задачу), но надёжно это измерить было нечем, существующие тесты плохо учитывали визуальные особенности современных видеомоделей, не требовали проверки самого процесса рассуждения (а не только правдоподобного финального кадра) и были либо слишком лёгкими, либо слишком сложными.
VGI-Bench построен как двухуровневая таксономия: 27 задач и 810 примеров, распределённых по доменам задач и навыковым тегам, что позволяет оценивать способности моделей детально, а не одной общей цифрой. Авторы прогнали через бенчмарк современные генеративные системы и обнаружили, что те способны решать часть задач на визуальное мышление, но остаются далеко от надёжного результата: даже лучшая из проверенных моделей, Seedance 2.0, набрала лишь 51,0% по критериям оценки VGI-Bench. Данные по результатам других моделей в тексте не приводятся, как и точное определение того, что именно измеряет эта цифра (доля правильных решений, точность по конкретному критерию или что-то иное), в источнике это не раскрыто.
Отдельно авторы разобрали причины провалов: типичные режимы сбоя, чувствительность моделей к входным условиям, границы переноса качества при дообучении на синтетических данных, а также то, что происходит внутри процесса шумоподавления (denoising), которым видеомодели генерируют кадры. Здесь обнаружился ключевой вывод: модели демонстрируют ограниченную способность к самокоррекции, поздние шаги генерации в основном уточняют ранее выбранную гипотезу, а не исправляют ошибки рассуждения, допущенные на более ранних шагах. Авторы рассчитывают, что VGI-Bench подтолкнёт разработку следующего поколения моделей генерации видео; страница проекта опубликована на отдельном сайте.
Ключевые факты
- VGI-Bench, новый бенчмарк для визуального мышления видеогенеративных моделей: 27 задач, 810 примеров, двухуровневая таксономия доменов и навыков
- Лучшая проверенная модель, Seedance 2.0, набрала только 51,0% по критериям бенчмарка, данные по другим моделям не приводятся
- Модели способны решать часть задач на визуальное мышление, но авторы называют результат далёким от надёжного
- Анализ шумоподавления показал ограниченную самокоррекцию: поздние шаги генерации уточняют раннюю гипотезу, а не исправляют ошибки рассуждения
- Авторы также изучили типичные режимы сбоя, чувствительность к входным условиям и границы переноса при дообучении на синтетике
Почему это важно
Идея, что модели генерации видео способны не только рисовать правдоподобные кадры, но и «рассуждать» через них, то есть выполнять визуальное мышление без специального дообучения под задачу, активно обсуждается в исследовательском сообществе. До VGI-Bench не было бенчмарка, который бы одновременно учитывал визуальные особенности современных видеомоделей, требовал проверки корректности самого процесса рассуждения, а не только правдоподобного финального кадра, и был откалиброван по сложности так, чтобы задачи оставались решаемыми хотя бы частично. VGI-Bench закрывает этот пробел и сразу показывает, что даже лучшая из проверенных моделей далека от надёжного результата.
Кому это важно
В первую очередь, командам, разрабатывающим модели генерации видео (в тексте прямо упомянута Seedance 2.0 как лучшая из проверенных), а также исследователям, которые строят бенчмарки для мультимодальных и генеративных моделей. Полезно и тем, кто рассматривает видеогенерацию как инструмент для задач, требующих рассуждения, планирования, симуляции физических процессов, пошагового решения визуальных головоломок, поскольку результаты показывают, насколько эти возможности пока ограничены.
Как это применить
VGI-Bench опубликован с отдельной страницей проекта, что позволяет исследователям прогонять через него собственные модели и сравнивать результаты по единой методике вместо разрозненных самодельных тестов. Двухуровневая таксономия задач и навыков даёт возможность не просто получить общий балл, а понять, в каких именно типах визуального мышления модель слаба. Разбор режимов сбоя и наблюдение об ограниченной самокоррекции в процессе шумоподавления, прямая подсказка разработчикам, где искать причины ошибок: не только в исходных данных, но и в том, как модель уточняет уже выбранную гипотезу вместо того, чтобы пересматривать её.
Можно ли доверять
Источник, страница статьи на Hugging Face с полным текстом аннотации, поэтому базовые числа (27 задач, 810 примеров, результат Seedance 2.0 в 51,0%) взяты напрямую из авторского описания работы. При этом в самом тексте не приведены имена всех соавторов и институциональная принадлежность, не названа площадка выхода работы, не приведены баллы других моделей для сравнения и не уточнена природа метрики, стоящей за цифрой 51,0%. Это ограничивает возможность независимо сверить результат до появления сравнительных данных или рецензии.
Риски и подводные камни
Главный риск, переоценка возможностей видеомоделей на основании отдельных успешных примеров: авторы прямо говорят, что модели решают лишь часть задач и остаются далеко от надёжности. Второй риск, принять кажущуюся «правильность» финального кадра за корректное рассуждение: анализ шумоподавления показывает, что поздние шаги генерации преимущественно уточняют уже выбранную гипотезу, а не исправляют ошибки логики, допущенные раньше. Наконец, отсутствие в тексте баллов других моделей и подробностей методики оценки означает, что 51,0% пока нельзя однозначно поместить в контекст, это создаёт риск неверных выводов о том, насколько именно Seedance 2.0 опережает или уступает другим системам.