Бенчмарк Principia показал: видеомодели проваливают физику Ньютона

Бенчмарк Principia показал: видеомодели проваливают физику Ньютона

Оценивать физическую достоверность сгенерированного видео сложно: абсолютные величины движения, скорость, расстояние, зависят от частоты кадров, масштаба объектов и калибровки камеры, а в сгенерированном видео эти параметры часто неизвестны или неоднозначны. Авторы предлагают другой подход: если два объекта в одной сцене подчиняются одному и тому же физическому закону, их движения обязаны находиться в предсказуемом соотношении друг с другом, и это соотношение не зависит от калибровки. На этой идее построен бенчмарк Principia, который проверяет соблюдение законов Ньютона через согласованность движения пары объектов, а не абсолютные измерения.

Бенчмарк охватывает восемь физических явлений, гравитацию, упругость (restitution, поведение тел при столкновении), трение, вращательную инерцию, движение снаряда, импульс, маятник и пружинные колебания, и четыре типа динамики: поступательную, вращательную, столкновительную и колебательную. Сцены сняты в реальности по контролируемому протоколу, а не сгенерированы. Дополнительно авторы предложили независимую от калибровки метрику согласованности, которая измеряет нарушение физических законов прямо в пространстве изображения.

На тысячах сгенерированных роликов от шести современных видеогенераторов ни одна модель не превысила оценку 0,42 по Principia, при том что все шесть на стандартном бенчмарке VBench получали около 0,8. Отдельно проверили способность визуально-языковых моделей замечать нарушения физики на видео: лучшая из них показала точность лишь 67%, а большинство работали на уровне, близком к случайному угадыванию.

Ключевые факты

  • Бенчмарк Principia проверяет физическую достоверность видео через согласованность движения пары объектов в кадре, а не через абсолютные измерения скорости или расстояния, это позволяет обойтись без калибровки камеры
  • Охватывает восемь явлений: гравитацию, упругость при столкновении, трение, вращательную инерцию, движение снаряда, импульс, маятник и пружинные колебания
  • Ни одна из шести протестированных современных видеомоделей не превысила оценку 0,42 по Principia, хотя все они получали около 0,8 на стандартном бенчмарке VBench
  • Визуально-языковые модели, которых просили находить нарушения физики на видео, справлялись плохо: лучшая показала точность 67%, у большинства результат близок к случайному угадыванию
  • Авторы также предложили независимую от калибровки метрику согласованности, измеряющую нарушение физики напрямую в пространстве изображения

Почему это важно

Стандартные бенчмарки вроде VBench оценивают визуальное качество и эстетику видео, но не проверяют, соблюдает ли ролик законы физики. Показательный разрыв: все шесть проверенных моделей получали около 0,8 на VBench, но не выше 0,42 на Principia, то есть картинка выглядит убедительно, а движение внутри неё физически неправдоподобно. Прямое измерение физики раньше упиралось в то, что абсолютные величины движения зависят от частоты кадров, масштаба и калибровки камеры, которые в генерируемом видео обычно неизвестны. Principia обходит это, сравнивая движение двух объектов внутри одной сцены между собой, а не с внешней меркой.

Кому это важно

Разработчикам и исследователям, которые создают или оценивают видеогенеративные модели, бенчмарк даёт им способ измерить именно физическую достоверность, а не только визуальное качество. Полезен и тем, кто строит системы автоматической проверки контента на базе визуально-языковых моделей: результаты показывают, что такие модели пока плохо замечают нарушения физики сами. Значим и для тех, кто рассматривает ИИ-видео как источник данных для симуляций или обучения роботов, там физическая точность движения критична.

Как это применить

Principia можно использовать как дополнительную проверку качества видеомодели поверх стандартных бенчмарков вроде VBench: восемь типов физических явлений и предложенная независимая от калибровки метрика согласованности позволяют оценить, насколько ролики модели соблюдают законы Ньютона, без необходимости откалибровать камеру или знать частоту кадров генерации.

Можно ли доверять

Источник, аннотация статьи на странице Hugging Face Papers; в тексте нет имён авторов, институтов, названия площадки публикации и точного числа сгенерированных роликов (указано лишь «тысячи»). Также не названы конкретные шесть протестированных видеогенераторов и оценённые визуально-языковые модели, поэтому судить о том, какие именно продукты имеются в виду, по этому тексту нельзя. Сама методология, сравнение относительного движения пары объектов вместо абсолютных величин, описана последовательно и логично обоснована.

Риски и подводные камни

Без списка конкретных протестированных моделей нельзя судить, насколько результат обобщается на всю индустрию видеогенерации, а не только на выбранную авторами шестёрку. Как и с любым новым бенчмарком, есть риск, что после публикации разработчики начнут оптимизировать модели именно под тест Principia, а не под физическую реальность в целом. Низкая оценка также не означает, что видео этих моделей непригодны для творческих задач, речь именно о точности физики, а не об общем качестве или полезности ролика.