Исследователи представили WROP, датасет для обучения видео-моделей постоянству объектов

Постоянство объектов и их твёрдость (solidity), базовые когнитивные представления человека о мире: мы знаем, что предмет не исчезает, если его закрыли от взгляда, и что твёрдые тела не проходят друг сквозь друга. Исследователи задались вопросом, возникает ли такое понимание само по себе у видео-генеративных моделей (их относят к классу так называемых world models, моделей мира), и можно ли специально обучить его через датасет, вдохновлённый экспериментами когнитивной науки о развитии мышления у детей (core cognition).
Для этого авторы создали WROP (World Reasoning with Object Permanence), инфраструктуру данных из 150 вручную спроектированных задач, разделённых на шесть когнитивных категорий. Задачи генерируются процедурно в Blender: генераторы случайно меняют скорость движения, освещение, угол камеры и другие несущественные параметры, сохраняя при этом когнитивную суть каждой задачи, так получается более 10 000 образцов на задачу. В открытый доступ выложены обучающий корпус на 1,5 миллиона примеров и экзамен из 300 вопросов.
На этом экзамене авторы протестировали 14 видео-моделей: 3 модели класса reference-to-video, 7 моделей для редактирования видео и 4 модели продолжения видео (continuation), включая собственную модель авторов PWM-WROP на 16 миллиардов параметров. В слепом попарном сравнении по системе Эло PWM-WROP заняла первое место среди моделей-«продолжателей» и третье место в общем зачёте, уступив только паре reference-to-video моделей, которые статистически показали равный результат между собой.
Авторы выложили в открытый доступ сам датасет, экзамен, ответы моделей, оценки, веса PWM-WROP, а также PWM, собственный обучающий стек на чистом PyTorch, работающий на аппаратном обеспечении AWS Trainium2.
Ключевые факты
- WROP, датасет и экзамен для проверки понимания видео-моделями постоянства объектов и твёрдости тел
- 150 задач вручную спроектированы по мотивам когнитивной науки, разбиты на 6 категорий; Blender-генераторы дают более 10 000 образцов на задачу
- Выпущены обучающий корпус на 1,5 млн примеров и экзамен из 300 вопросов
- На экзамене проверили 14 видео-моделей (3 reference-to-video, 7 edit, 4 continuation)
- Собственная модель авторов PWM-WROP (16 млрд параметров) заняла 1-е место среди continuation-моделей и 3-е место в общем рейтинге по Эло
Почему это важно
Видео-генеративные модели всё чаще рассматривают как кандидатов на роль «моделей мира», систем, которые должны понимать физику происходящего, а не просто рисовать правдоподобные кадры. Работа проверяет один из базовых признаков такого понимания, постоянство объектов, и показывает, что это можно системно измерять и целенаправленно тренировать, а не просто надеяться, что способность возникнет сама по себе при масштабировании.
Кому это важно
Разработчикам видео- и world-моделей, которые хотят улучшить физическую достоверность генераций; исследователям в области машинного обучения и когнитивных наук, изучающим перенос идей о развитии мышления человека на нейросети; инженерам, оценивающим и сравнивающим видео-модели между собой.
Как это применить
Авторы открыли весь набор материалов: обучающий корпус на 1,5 млн примеров, экзамен из 300 вопросов, ответы и оценки протестированных моделей, веса модели PWM-WROP и обучающий стек PWM на чистом PyTorch (работающий на AWS Trainium2). Это позволяет другим командам как обучать собственные модели на этих данных, так и использовать экзамен для сравнения любых видео-моделей по способности к пониманию постоянства объектов.
Можно ли доверять
Это исследовательская публикация с открытым релизом данных, кода, экзамена, весов модели и полных результатов сравнения, методология и материалы доступны для независимой проверки. В источнике не указаны имена авторов и организаций, а также дата публикации; детали того, что именно проверяют шесть когнитивных категорий помимо общей темы постоянства объектов и твёрдости, в тексте не раскрыты.
Риски и подводные камни
Оценка по системе Эло проводилась силами самих авторов, а собственная модель PWM-WROP обучалась именно на данных WROP, это создаёт риск, что тест лучше «настроен» под архитектуру и обучающий процесс авторов, чем под остальные 13 протестированных моделей. Не раскрыто, насколько успех на искусственно сгенерированных в Blender сценах переносится на реальные видео и произвольные бытовые ситуации.