VideoGen-Agent поднял качество генерации видео с 56.5 до 75.6 балла

VideoGen-Agent поднял качество генерации видео с 56.5 до 75.6 балла

Современные модели генерации видео дают качественную, временно согласованную картинку, но плохо справляются с запросами, которые требуют специальных знаний, точного сохранения личности персонажа, физической достоверности или строгого порядка событий. Авторы предлагают VideoGen-Agent, мультимодального агента, обученного через многозадачное агентное обучение с подкреплением вызывать внешние инструменты для генерации видео: инструменты доработки (аугментации), собственно генерации и проверки результата. Агент координирует их в несколько ходов диалога, опираясь на исходный запрос и промежуточные наблюдения при выборе следующего шага.

Обучение проходит в два этапа. Сначала на эталонных траекториях, сгенерированных моделью-учителем, агента дообучают с учителем (supervised fine-tuning), это закладывает базовое поведение по использованию инструментов. Затем поведение уточняется обучением с подкреплением: гибридная награда, зависящая от категории задачи, оценивает корректность вызова инструмента, уместность выбранного инструмента для конкретной задачи и качество итогового видео. Общая политика обучена на сбалансированном по категориям датасете, охватывающем шесть типов задач.

Для проверки авторы представили отдельный бенчмарк VABench, 600 запросов, охватывающих процедурные знания, сохранение личности одного или нескольких персонажей, физическую достоверность, композицию сцены и многокадровую временную структуру. На VABench VideoGen-Agent улучшает результат базовой модели генерации видео по тексту на 19,1 балла, с 56,5 до 75,6. Если дополнительно заменить (апгрейдить) сами инструменты генерации, не переобучая агента заново, оценка растёт ещё выше, до 86,1. В прямом сравнении с самым сильным автономным (не агентным) базовым решением люди-оценщики предпочли обновлённую конфигурацию в 84,3% сопоставлений.

Ключевые факты

  • VideoGen-Agent, мультимодальный агент, обученный агентным обучением с подкреплением координировать инструменты аугментации, генерации и проверки видео.
  • Обучение двухэтапное: сначала дообучение с учителем на эталонных траекториях, затем уточнение обучением с подкреплением с гибридной наградой по категориям задач.
  • На новом бенчмарке VABench (600 запросов, шесть типов задач) агент поднимает результат базовой модели генерации видео по тексту с 56,5 до 75,6 балла, рост на 19,1 балла.
  • Замена (апгрейд) самих инструментов генерации без дообучения агента поднимает результат ещё выше, до 86,1 балла.
  • В сравнении с самым сильным автономным базовым решением люди-оценщики предпочли обновлённую конфигурацию в 84,3% случаев.

Почему это важно

Модели генерации видео сейчас упираются не в качество картинки, а в запросы со специальными требованиями: точная фактура, сохранение личности персонажа между кадрами, физическая достоверность движения, строгий порядок событий. VideoGen-Agent показывает путь решения не через ещё одну более мощную генеративную модель, а через агента, который умеет вызывать и комбинировать уже существующие инструменты, аугментации, генерации и проверки, под конкретную задачу. Прирост с 56,5 до 75,6 балла на специально собранном под эти сложные случаи бенчмарке VABench показывает, что именно координация инструментов, а не только сама генеративная модель, закрывает значимую часть таких запросов.

Кому это важно

Разработчикам инструментов генерации видео и мультимодальных агентов, как пример архитектуры, которая обучается использовать внешние инструменты, а не полагается на монолитную генеративную модель. Исследователям обучения с подкреплением для агентов, как пример гибридной награды, учитывающей и корректность вызова инструмента, и итоговое качество результата. Тем, кто оценивает генерацию видео, как готовый бенчмарк VABench с прицелом именно на процедурные знания, сохранение личности, физику и многокадровую структуру, а не на общее визуальное качество.

Как это применить

Ключевая практическая находка, агент, обученный координировать инструменты, продолжает выигрывать даже без переобучения, если заменить (апгрейднуть) сами инструменты генерации: оценка на VABench тогда растёт с 75,6 до 86,1 балла. Это означает, что вложение в обучение агента-координатора не привязывает результат намертво к конкретной версии генеративной модели, по мере появления более сильных инструментов агент может использовать их напрямую. Двухэтапная схема обучения (сначала дообучение с учителем на готовых траекториях, затем обучение с подкреплением) также описана достаточно детально, чтобы служить шаблоном для похожих агентных систем в других доменах генерации.

Можно ли доверять

Это препринт научной работы, а не объявление продукта: имя и место работы авторов, дата публикации и площадка размещения в источнике не указаны. Все ключевые цифры, прирост с 56,5 до 75,6 балла, дальнейший рост до 86,1 балла, предпочтение в 84,3% сравнений, получены на бенчмарке VABench, который авторы создали и опубликовали сами вместе с методом; независимой проверки на стороннем бенчмарке в источнике нет. Конкретные инструменты генерации, до которых был выполнен апгрейд, и название самого сильного автономного базового решения, с которым сравнивали в опросе людей, в источнике не названы, это сужает возможность независимо перепроверить результат.

Риски и подводные камни

Главный риск, бенчмарк для оценки метода придуман теми же авторами, что и сам метод, а не взят как независимый стандарт: это не делает цифры неверными, но требует поправки на то, что сравнение изначально настроено на сильные стороны предложенного подхода. В источнике нет данных о вычислительных затратах на обучение агента и о том, насколько подход переносится на инструменты и модели, для которых он не отлаживался. Отсутствие названий конкретных инструментов и базового решения затрудняет воспроизведение результата и независимую сверку заявленных цифр.

«Результаты подтверждают, что обучение использованию инструментов работает для задач генерации видео, и показывают, что обученный агент способен получать пользу от последующих улучшений инструментов генерации.»

— авторы работы