Apple-PI: бенчмарк проверил, понимают ли видео-нейросети законы физики

Apple-PI: бенчмарк проверил, понимают ли видео-нейросети законы физики

Видео-модели всё чаще называют «моделями мира» (world models), которые якобы усвоили законы физики. Но существующие бенчмарки проверяют только то, выглядит ли итоговое видео физически правдоподобным, и не проверяют, пришла ли модель к этому результату через добросовестное рассуждение, основанное на реальных физических законах. Авторы работы представили Apple-PI, первый бенчмарк, который явно привязывает оценку видео-моделей к законам физики, а не только к визуальному впечатлению.

Apple-PI состоит из трёх частей. Первая, датасет Orchard: 400 видео, охватывающих десять эталонных задач классической механики. Задачи разделены на два типа: «однозаконные», для чистой диагностики без посторонних факторов, и «многозаконные», для проверки способности модели обобщать несколько законов физики одновременно. Вторая часть, протокол оценки из трёх стадий, построенный по логике научного рассуждения: Восприятие, Формулировка и Дедукция (вывод). Модели дают «подсказку по цепочке кадров» (chain-of-frames) на первых кадрах, размеченных инфографикой, а сгенерированное видео рассматривается как видимый след рассуждения модели. Третья часть, гибридный набор для оценки, который сочетает субъективную оценку с помощью мультимодальных больших языковых моделей (MLLM) и объективные показатели, привязанные напрямую к законам физики. Такой гибрид позволяет диагностировать не только сам факт провала модели, но и на какой именно стадии рассуждения она сломалась.

Авторы протестировали 11 видео-моделей. Результат: современные видео-модели далеки от надёжных «симуляторов мира», основанных на реальных законах физики, лучшая модель набрала всего 0,473 балла. Детальный анализ по стадиям, по типам физических принципов и по источникам данных выявил три системные проблемы: узкое место на переходе от Восприятия к Формулировке и далее к Дедукции; слабый перенос состояния между несколькими законами физики в многозаконных задачах; устойчивый разрыв между симулированным и реальным поведением объектов (Sim-to-Real gap). По оценке авторов, Apple-PI задаёт диагностическую основу для того, чтобы вести будущие видео-модели к настоящим моделям мира с физическим интеллектом, основанным на законах природы.

Ключевые факты

  • Apple-PI, первый бенчмарк, который проверяет не «выглядит ли видео физически правдоподобным», а следует ли видео-модель реальным законам физики в процессе рассуждения
  • Датасет Orchard: 400 видео, десять эталонных задач классической механики, разделённых на «однозаконные» (чистая диагностика) и «многозаконные» (проверка обобщения)
  • Трёхстадийный протокол оценки, Восприятие, Формулировка, Дедукция, с «подсказкой по цепочке кадров» на первых кадрах, размеченных инфографикой
  • Гибридная оценка сочетает субъективные баллы от мультимодальных языковых моделей (MLLM) и объективные физические метрики, что позволяет находить точную стадию сбоя
  • Из 11 протестированных видео-моделей лучшая набрала лишь 0,473 балла; выявлены узкое место Восприятие→Формулировка→Дедукция, слабый перенос между законами физики и устойчивый разрыв между симуляцией и реальностью

Почему это важно

Видео-модели всё чаще позиционируют как «модели мира», понимающие устройство физической реальности, на этом строятся ожидания вокруг их применения в робототехнике и симуляции. Но прежние бенчмарки оценивали только визуальную правдоподобность результата, а не то, пришла ли модель к нему через рассуждение, действительно опирающееся на законы физики. Apple-PI закрывает этот пробел, он проверяет сам процесс рассуждения модели, а не только картинку на выходе.

Кому это важно

Материал важен исследователям и разработчикам видео-генеративных моделей, командам, которые претендуют на статус «модели мира» для своих систем, а также специалистам по робототехнике и симуляции, которым нужна физически достоверная генерация видео, а не просто красивая картинка.

Как это применить

Apple-PI можно использовать как диагностический инструмент при разработке видео-моделей: датасет Orchard даёт стандартный набор задач классической механики, а трёхстадийный протокол (Восприятие → Формулировка → Дедукция) с гибридной оценкой (MLLM-баллы плюс физические метрики) позволяет точно локализовать, на какой стадии рассуждения модель теряет соответствие законам физики, а не просто получить общий балл.

Можно ли доверять

Методика опирается на конкретный количественный результат, тестирование 11 реальных видео-моделей с итоговым баллом лучшей модели 0,473, и на детализированный анализ по стадиям, физическим принципам и источникам данных, а не на общие впечатления. Это делает выводы проверяемыми и воспроизводимыми, хотя работа остаётся препринтом без независимого рецензирования.

Риски и подводные камни

Результат бенчмарка неутешительный: даже лучшая из 11 протестированных моделей набрала лишь 0,473 балла, то есть современные видео-модели далеки от надёжных физически достоверных симуляторов. Авторы фиксируют три системные слабости, узкое место на переходе от восприятия к формулировке и дедукции, слабый перенос между несколькими законами физики в комплексных задачах и устойчивый разрыв между симуляцией и реальным поведением объектов (Sim-to-Real gap), а значит, доверять видео-моделям как «моделям мира» в задачах, критичных к точной физике, пока преждевременно.