VeriPhy: новая система проверяет, где видео нарушает законы физики

Визуальная гладкость сгенерированного видео ещё не значит, что оно физически достоверно: ролик может выглядеть чисто, но нарушать законы движения, счёт объектов или другие физические правила, а единственная числовая оценка качества не говорит, какое именно правило нарушено и в какой момент. Авторы работы предложили VeriPhy, аудируемую систему проверки физической достоверности видео.
Система работает в два этапа. Сначала текстовый планировщик по промпту составляет список типизированных физических обязательств (правил, которым должен следовать ролик) и статически проверенный план выполнения, ещё до просмотра ни одного кадра. Затем при выполнении плана наблюдения активируют только заранее объявленные вызовы к отдельным «замороженным» низкоуровневым экспертным модулям: сегментации и трекингу объектов, подсчёту, одиннадцати типизированным физическим измерениям по полученным трекам, оценке глубины, распознаванию текста (OCR) и детекции звуковых событий. Каждое такое действие возвращает запись-доказательство с указанием происхождения (provenance): её содержимое, это либо типизированное измерение, либо явно помеченное предсказание модели. Типизированные резолверы и фиксированная схема сведения показаний сводят пригодные записи к одному из трёх вердиктов, подтверждено, опровергнуто или неизвестно (на выходе, «правдоподобно», «неправдоподобно» или «воздержаться»), и каждый вердикт прослеживается до конкретной доказательной записи.
Авторы проверили систему на корпусе из 1500 клипов с человеческой разметкой реальных ошибок генерации, с привязкой к тому, какому требованию промпта, какой области кадра и какому моменту времени соответствует каждая ошибка. На ядре из 149 клипов с 304 такими размеченными ошибками VeriPhy правильно определила 228 из них, против 164 у опубликованного ранее оценщика, построенного на разложении вопросов (question decomposition), при тех же клипах и тех же утверждениях. При этом одна лишь полнота охвата (recall) не отличает VeriPhy от простого монолитного промпта той же базовой модели, который достигает 222: разница в том, что каждое решение VeriPhy сохраняет доказательную запись и происхождение, а значит цепочку рассуждений можно проверить по каждому отдельному вердикту, и использовать её как интерфейс, через который вердикт критика можно было бы вписать обратно в процесс генерации видео.
Ключевые факты
- VeriPhy сначала превращает текстовый промпт в список типизированных физических требований и статически проверенный план проверки, и только затем анализирует кадры видео.
- Проверка кадров идёт через отдельные «замороженные» модули: сегментация и трекинг объектов, подсчёт, одиннадцать типов физических измерений, оценка глубины, OCR и детекция звуковых событий.
- Каждый вердикт, «подтверждено», «опровергнуто» или «неизвестно», сопровождается доказательной записью с указанием происхождения, поэтому решение можно проверить по шагам.
- На ядре из 149 клипов с 304 размеченными ошибками VeriPhy нашла 228 нарушений, больше, чем опубликованный ранее оценщик на основе разложения вопросов (164) и монолитный промпт той же модели по полноте охвата (222).
- Оценка построена на корпусе из 1500 клипов с ручной разметкой реальных ошибок генерации видео, привязанных к конкретному требованию, области кадра и моменту времени.
Почему это важно
Сегодняшняя оценка качества видео от нейросетей чаще всего сводится к одной общей числовой оценке, которая не объясняет, что именно пошло не так и в какой момент. VeriPhy предлагает другой принцип: физическую достоверность ролика раскладывают на конкретные типизированные обязательства, каждое из которых проверяется отдельным модулем и получает вердикт с полной доказательной цепочкой. Это делает саму процедуру оценки прозрачной и проверяемой, а не «чёрным ящиком» с одним числом на выходе.
Кому это важно
В первую очередь, исследователям, которые строят и оценивают модели генерации видео и так называемые world models (модели мира), а также тем, кто разрабатывает бенчмарки физической правдоподобности для таких моделей. Авторы прямо указывают, что доказательные записи VeriPhy можно использовать как интерфейс для обратной связи: через них вердикт критика потенциально можно вписывать обратно в процесс генерации видео, что важно для команд, которые строят циклы автоматического улучшения генеративных моделей.
Как это применить
В тексте источника VeriPhy описана как исследовательская архитектура оценки, проверенная на собственном корпусе из 1500 клипов и ядре из 149 клипов с 304 размеченными ошибками. В источнике не сказано, планируется ли публикация кода, весов моделей или самого корпуса разметки, поэтому пока речь идёт о результатах эксперимента и предложенной методологии, а не о готовом к использованию инструменте.
Можно ли доверять
В доступном тексте не названы ни авторы, ни организация, ни место и дата публикации работы, судить о репутации команды или о том, прошла ли работа рецензирование, по нему нельзя. Приведённые цифры (228 против 164 и 222), это сравнение, сделанное самими авторами на их собственном тестовом наборе; независимого подтверждения результатов в источнике нет, а имя и устройство «опубликованного оценщика на основе разложения вопросов», с которым сравнивают VeriPhy, в тексте не раскрыты.
Риски и подводные камни
Ключевой риск, непрозрачность точки сравнения: без названия и описания альтернативного оценщика сложно независимо проверить, насколько корректно и честно поставлено сравнение. Результаты получены на одном созданном авторами корпусе и ядре из 149 клипов, неясно, насколько метод обобщается на другие наборы видео и типы физических нарушений. Наконец, поскольку в источнике ничего не сказано об открытии кода, весов или корпуса, оценить и повторить эксперимент независимо пока невозможно.
«Визуальная гладкость сгенерированного видео не означает его физическую достоверность, а одна лишь скалярная оценка качества не способна показать, какое обязательство нарушает ролик и в какой момент происходит сбой.»
— авторы исследования VeriPhy