WorldReward: ИИ-судья для видео моделей мира обогнал GPT-5.5

WorldReward: ИИ-судья для видео моделей мира обогнал GPT-5.5

Модели мира с управлением по камере (camera-conditioned world models) генерируют интерактивное видео: заданное действие должно вызывать ожидаемое изменение сцены, а внешний вид, геометрия и динамика во времени при этом должны оставаться согласованными. Существующие способы оценки такого видео разделены: геометрические метрики вознаграждения проверяют, правильно ли выполнена траектория действия, но не могут судить о визуальном качестве самого движения; метрики на основе изображения измеряют качество отдельных кадров, но не улавливают ни исполнение действия, ни динамику во времени.

Авторы исходят из того, что визуально-языковая модель (VLM) даёт общее пространство рассуждения, в котором можно связать действие с его визуальным результатом. Проблема в том, что оценивать целиком длинное видео против целой последовательности действий, значит работать с длинным зашумлённым контекстом, где короткие локальные признаки выполнения действия теряются или размываются. Чтобы решить это, авторы предлагают WorldReward, модель вознаграждения на основе VLM, которая сравнивает видео парами (попарные предпочтения) и объединяет проверку согласованности действия и визуального качества в одном механизме. WorldReward разбивает пару видео на фрагменты, привязанные к конкретному действию, превращает каждый фрагмент в структурированное визуальное свидетельство и агрегирует решения по фрагментам голосованием, отдельно в предпочтение по действию и отдельно в предпочтение по визуальному качеству на уровне всего видео.

Для обучения модели авторы собрали большой датасет предпочтений с добавленными рассуждениями: структурированные суждения сгенерировала передовая (топовая) VLM, после чего их проверили инструментальным агентом-аудитором и точечно вычитали люди. Отдельно авторы представили WorldReward-Bench, размеченный людьми бенчмарк, который измеряет, насколько оценки модели вознаграждения совпадают с предпочтениями людей по трём осям: согласованность действия, качество внешнего вида и качество движения.

По всем трём измерениям WorldReward показала наибольшее совпадение с человеческими оценками среди сравниваемых подходов, обойдя GPT-5.5 на 3,42, 1,45 и 3,56 процентного пункта соответственно (конкретно, по согласованности действия, качеству внешнего вида и качеству движения). Абсолютных значений совпадения ни для WorldReward, ни для GPT-5.5 в статье не приведено, только эта разница в процентных пунктах, и GPT-5.5, единственный названный ориентир для сравнения. Когда WorldReward применили как сигнал вознаграждения для дообучения с подкреплением (RL) модели HY-WorldPlay 1.5, это стабильно улучшило и исполнение действий, и визуальное качество, как на коротких, так и на длинных горизонтах генерации.

Ключевые факты

  • WorldReward, модель вознаграждения на основе VLM, которая сравнивает пары видео от моделей мира с управлением камерой и одновременно проверяет и согласованность действия, и визуальное качество
  • Видео разбивается на фрагменты, привязанные к конкретному действию; каждый фрагмент превращается в структурированное визуальное свидетельство, а решения по фрагментам агрегируются голосованием в два отдельных предпочтения, по действию и по качеству
  • Модель обучена на большом датасете предпочтений с рассуждениями, собранном передовой VLM и проверенном агентом-аудитором и людьми
  • На бенчмарке WorldReward-Bench WorldReward обходит GPT-5.5 на 3,42 / 1,45 / 3,56 процентного пункта по согласованности действия, качеству внешнего вида и качеству движения соответственно
  • В роли сигнала для RL-дообучения модели HY-WorldPlay 1.5 WorldReward стабильно улучшает и исполнение действий, и визуальное качество на коротких и длинных горизонтах

Почему это важно

До сих пор оценка видео от моделей мира была расколота надвое: одни метрики следят за тем, правильно ли выполнено заданное действие, но слепы к качеству картинки; другие следят за качеством кадра, но не видят ни действия, ни динамики во времени. WorldReward, попытка свести обе проверки в одну модель, построенную на визуально-языковой модели, которая способна рассуждать сразу о действии и о его визуальном воплощении. Отдельная сложность, которую решают авторы, целиком длинное видео против целой последовательности действий даёт настолько длинный и зашумлённый контекст, что короткие, но решающие признаки выполнения действия в нём тонут; разбиение на фрагменты, привязанные к действию, это ответ именно на эту проблему.

Кому это важно

В первую очередь, командам, которые обучают и дообучают модели мира с управлением по камере: генерацию интерактивного видео для симуляции роботов, игровых движков, автономного вождения и других сценариев, где модель должна предсказывать, как сцена изменится в ответ на действие. Полезно и всем, кто занимается дообучением видео-генераторов с подкреплением (RL post-training) методом человеческой обратной связи (RLHF) или её автоматизированных аналогов: WorldReward предлагается как замена ручной разметки предпочтений.

Как это применить

В статье WorldReward используется как сигнал вознаграждения в цикле RL-дообучения: модели показывают пары видео с одинаковым заданным действием, WorldReward разбивает их на фрагменты, оценивает каждый и выдаёт два отдельных предпочтения, по согласованности действия и по визуальному качеству, которые дальше идут в обучение модели мира (в статье, HY-WorldPlay 1.5). Практический вывод: там, где раньше требовалась разметка людьми или разрозненные метрики, теперь можно поставить один автоматический VLM-судья.

Можно ли доверять

В самом тексте статьи не указаны ни авторы, ни их организации (это первая работа Yibin Wang по данным карточки на Hugging Face, но в тексте статьи имена не приводятся), ни дата публикации, ни площадка публикации. Не раскрыт размер датасета предпочтений и бенчмарка WorldReward-Bench, сколько видео, сколько было разметчиков. Не сказано, выложены ли код или веса модели. Результат подан только как разница в процентных пунктах относительно GPT-5.5, единственного упомянутого ориентира для сравнения; абсолютные показатели совпадения с человеческими оценками ни для WorldReward, ни для GPT-5.5 не приведены, что затрудняет независимую проверку масштаба улучшения.

Риски и подводные камни

Без абсолютных цифр совпадения с человеческими оценками сложно понять, насколько высок сам уровень согласия, прирост в 1,45, 3,56 процентного пункта может означать как заметный, так и незначительный скачок в зависимости от базового уровня, который в статье не назван. Сравнение проведено только с GPT-5.5; как WorldReward соотносится с другими VLM или специализированными метриками, неизвестно. Демонстрация пользы для RL-дообучения ограничена одной моделью, HY-WorldPlay 1.5, поэтому неясно, насколько подход обобщается на другие архитектуры моделей мира.