WanPE: модель на 397 млрд параметров улучшает промпты для генерации видео

WanPE: модель на 397 млрд параметров улучшает промпты для генерации видео

Современные системы генерации видео из текста уже умеют создавать ролики длиной до 30 секунд и точно следовать сложным условиям, но именно текстовый промпт определяет, как в кадре будут разворачиваться действия, движение камеры, свет и звук на протяжении нескольких планов. Авторы представили WanPE, модель улучшения промптов на 397 миллиардов параметров, обученную на 1,05 миллиона реальных видео, чтобы она формировала «режиссёрские» планы съёмки на уровне отдельных планов (кадров-сцен). Модель строит такие планы через метод обратного конструирования на основе видео (video-grounded reverse construction) и использует специально разработанный метод обучения Semantic-Consistency GRPO (SC-GRPO), который сохраняет исходные требования пользователя согласованными между планами и во времени. Для проверки качества исследователи собрали тестовый набор WanPEval, набор роликов длиной от 5 до 30 секунд с разной степенью детализации исходного замысла, оценённых людьми через около 11 тысяч слепых попарных сравнений. Когда WanPE-397B применяли вместе с генератором видео Wan3.0, предпочтение людей по сравнению с исходными пользовательскими промптами выросло на 10,66, 18,84 балла для роликов длиной 5, 15 секунд и на впечатляющие 50,86 балла для 30-секундных роликов. Отдельные эксперименты (абляции) показали, что метод обратного конструирования явно превосходит прямое переписывание промпта, а SC-GRPO устойчиво сохраняет смысловую точность независимо от масштаба модели. В итоге WanPE опережает все протестированные коммерческие аналоги на роликах длиной 5, 15 секунд и остаётся конкурентоспособным по сравнению с Seedance 2.5 на 30-секундных роликах.

Ключевые факты

  • WanPE, модель улучшения промптов на 397 млрд параметров, обученная на 1,05 млн реальных видео
  • Модель строит покадровые «режиссёрские» планы через обратное конструирование и обучается методом SC-GRPO для сохранения смысла между планами
  • Тестовый набор WanPEval включает ролики 5, 30 секунд и около 11 тысяч слепых попарных оценок людьми
  • С генератором Wan3.0 WanPE повышает предпочтение людей на 10,66, 18,84 балла (5, 15 сек) и на 50,86 балла (30 сек) по сравнению с исходными промптами
  • WanPE опережает коммерческие аналоги на коротких роликах и конкурентоспособен с Seedance 2.5 на 30-секундных

Почему это важно

Качество видео, сгенерированного нейросетью, сильно зависит от того, насколько хорошо текстовый промпт описывает не только сюжет, но и то, как этот сюжет должен разворачиваться в кадре, движение камеры, свет, звук, смену планов. WanPE решает именно эту задачу: превращает простой пользовательский запрос в детальный «сценарий», понятный видеогенератору, и делает это особенно эффективно для длинных, многоплановых роликов до 30 секунд, где выигрыш по оценкам людей оказался наибольшим.

Кому это важно

Разработчикам систем генерации видео из текста и исследователям, работающим над качеством длинных многоплановых роликов; компаниям, создающим коммерческие видеогенераторы и конкурирующим с решениями вроде Seedance 2.5; а также авторам, которые пользуются такими инструментами и заинтересованы в более точном следовании их замыслу без ручной доработки промптов.

Как это применить

В источнике WanPE описана как модель улучшения промптов, применённая вместе с генератором видео Wan3.0, то есть работает как промежуточный слой, который дорабатывает пользовательский запрос перед подачей в видеогенератор. Сведений о публичном доступе, цене или лицензии модели в источнике нет, поэтому судить о готовности к практическому использованию пока рано.

Можно ли доверять

Материал, это описание научной работы с указанием конкретных методов (video-grounded reverse construction, SC-GRPO) и количественных результатов, включая отдельный человеческий тестовый набор WanPEval с почти 11 тысячами оценок. В доступном тексте не указаны авторы, институции и дата публикации, что не позволяет проверить репутационный контекст работы напрямую по источнику.

Риски и подводные камни

Указанные цифры прироста качества основаны на оценках людей в рамках собственного тестового набора авторов (WanPEval), что не исключает методологической предвзятости при отборе оценщиков и сравниваемых систем. Также в источнике не раскрыт внутренний механизм SC-GRPO, что именно означает и как работает эта модификация GRPO, остаётся неясным.