Исследователи представили VA-Judger, модель, которая оценивает генерацию видео со звуком как человек

Исследователи представили VA-Judger, модель, которая оценивает генерацию видео со звуком как человек

Дообучение моделей совместной генерации видео и звука методом обучения с подкреплением требует сигнала вознаграждения. Существующие подходы строят его из отдельных метрик, качества звука, визуальной достоверности, синхронизации, но эти метрики оценивают каждое измерение по отдельности и не отражают общую смысловую и временную согласованность между текстовым промптом, видео и звуком, которая формирует предпочтения человека. Из-за этого при оптимизации по таким метрикам модели учатся обманывать их (reward hacking): генерируют видео со звуком, которые получают высокие оценки метрик, но выглядят несогласованными или недостоверными для зрителя-человека.

Чтобы решить эту проблему, авторы сначала собрали крупный датасет человеческих предпочтений VAPref-10K для совместной генерации видео и звука: 9 тыс. промптов и 10,3 тыс. детализированных попарных сравнений, полученных на выходах открытых (open-source) генеративных моделей. Затем они представили бенчмарк VA-Judger-Bench со сравнениями моделей как внутри домена, так и вне его, чтобы проверять, действительно ли модели вознаграждения согласованы с предпочтениями людей.

Сама модель VA-Judger, это универсальная (omni) модель вознаграждения с цепочкой рассуждений (chain-of-thought), которая обучается в три этапа. Сначала она учится на парах с явным разрывом в качестве, чтобы выработать структурированный вывод и грубое различение предпочтений. Затем для более сложных пар с близким качеством модель дистиллирует надёжные объяснения предпочтений методом отбраковки (rejection sampling), сверенным с человеческой разметкой. Наконец, проводится обучение с подкреплением по отдельным измерениям: человеческая обратная связь раскладывается на отдельные аспекты качества, что даёт более плотный сигнал вознаграждения, чем один бинарный ярлык предпочтения.

По результатам экспериментов, VA-Judger превосходит метрические базовые методы в предсказании человеческих предпочтений, как на данных внутри домена, так и вне его. Использование её согласованных с человеком наград для дообучения модели совместной генерации видео и звука также заметно улучшает качество генерации; конкретные числовые показатели прироста в источнике не приведены.

Ключевые факты

  • VA-Judger, модель вознаграждения с цепочкой рассуждений для совместной генерации видео и звука, обучена в три этапа: грубое различение по явным разрывам качества, дистилляция объяснений для сложных пар через rejection sampling, дообучение с подкреплением по отдельным измерениям качества.
  • Собран датасет человеческих предпочтений VAPref-10K: 9 тыс. промптов и 10,3 тыс. попарных сравнений на выходах открытых генеративных моделей.
  • Представлен бенчмарк VA-Judger-Bench для проверки, действительно ли модели вознаграждения согласованы с предпочтениями людей, на данных внутри домена и вне его.
  • Существующие метрики (звук, картинка, синхронизация по отдельности) не ловят общую согласованность видео, звука и промпта, из-за чего модели обучаются обманывать эти метрики (reward hacking).
  • VA-Judger превосходит метрические базовые методы в предсказании человеческих предпочтений и заметно улучшает качество генерации при использовании как награды для дообучения; конкретные цифры прироста не раскрыты.

Почему это важно

Дообучение генеративных моделей видео и звука через обучение с подкреплением нуждается в сигнале вознаграждения. Раздельные метрики качества звука, картинки и синхронизации не отражают общую смысловую и временную согласованность с текстовым промптом, из-за этого модели находят лазейки и обманывают метрики (reward hacking), выдавая формально хорошо оцененный, но несогласованный или недостоверный результат. VA-Judger вместе с датасетом VAPref-10K и бенчмарком VA-Judger-Bench, попытка построить единую награду, ориентированную на человеческое восприятие, и честно проверять, насколько она действительно ему соответствует.

Кому это важно

Исследователям и инженерам, которые занимаются генерацией видео и звука и дообучением таких моделей методом обучения с подкреплением по обратной связи от человека, прежде всего тем, кто уже упирается в проблему reward hacking при использовании отдельных перцептивных метрик.

Как это применить

VA-Judger можно использовать как модель вознаграждения при пост-тренинге моделей совместной генерации видео и звука методом обучения с подкреплением, по данным авторов, это даёт заметное улучшение качества генерации. Датасет VAPref-10K и бенчмарк VA-Judger-Bench пригодны как материал для сравнения и проверки собственных моделей вознаграждения на согласованность с человеческими предпочтениями. Данных о цене, лицензии или сроках публикации кода и весов в источнике нет.

Можно ли доверять

Это научная работа с собственным экспериментальным сравнением: авторы показывают превосходство VA-Judger над метрическими базовыми методами на данных внутри домена и вне его. В аннотации не указаны ни имена авторов и организаций, ни площадка публикации, ни независимая проверка результатов третьей стороной, судить о выводах приходится по заявлениям самих авторов.

Риски и подводные камни

В источнике нет конкретных числовых показателей прироста качества (точность, доля побед или процент улучшения), оценить масштаб эффекта по тексту нельзя. Датасет VAPref-10K построен на выходах открытых генеративных моделей, которые в аннотации не названы, это может ограничивать перенос результатов на другие модели. Сама модель вознаграждения тоже может нести собственные систематические искажения, унаследованные от разметки, на которой она обучена.