Video-IFBench: новый бенчмарк показал, что ИИ-модели плохо следуют сложным инструкциям при работе с видео

Хунбо Лю с соавторами представили Video-IFBench, комплексный бенчмарк для оценки того, насколько хорошо мультимодальные большие языковые модели (MLLM) следуют пользовательским инструкциям при работе с видео. По словам авторов, существующие тесты в основном проверяют точность выполнения задачи, а не то, соблюдает ли модель конкретные условия, которые задаёт пользователь, эта способность оставалась почти неисследованной, хотя реальная работа с видео требует от модели не только верно понять содержание ролика, но и выполнить разнообразные ограничения, в том числе основанные на видеоряде и звуке.
Для бенчмарка исследователи разработали таксономию инструкций из четырёх шаблонов, одиночная задача, несколько задач, задача с выбором и вложенные инструкции. Таксономия охватывает 32 типа задач и 39 вручную составленных категорий ограничений, которые включают как смысловые, так и форматные требования.
Чтобы снизить затраты на разметку, авторы построили полуавтоматический конвейер сбора данных: он сочетает работу мультимодальных моделей, программную обработку и проверку людьми. В результате получился набор из 1500 примеров. На этом наборе исследователи провели масштабную оценку более 20 современных мультимодальных моделей и показали, что следование инструкциям при анализе видео остаётся для них сложной задачей, особенно когда инструкция содержит много ограничений, смысловые условия или разветвлённую логику, где нужно выбрать правильный путь в зависимости от содержания видео. Конкретные результаты и названия протестированных моделей в источнике не приводятся.
Ключевые факты
- Video-IFBench, новый бенчмарк, который проверяет не точность распознавания видео, а то, соблюдает ли мультимодальная модель конкретные инструкции пользователя, включая условия по изображению и звуку.
- Таксономия инструкций включает четыре шаблона, одиночная задача, несколько задач, выбор и вложенные инструкции, и охватывает 32 типа задач и 39 вручную составленных категорий ограничений (смысловых и форматных).
- Набор данных из 1500 примеров собран полуавтоматическим конвейером: мультимодальные модели плюс программная обработка плюс проверка людьми.
- На бенчмарке протестировали более 20 современных мультимодальных моделей, но источник не называет ни сами модели, ни их конкретные результаты.
- Хуже всего модели справляются с инструкциями, где много ограничений, есть смысловые условия или сложная ветвящаяся логика выбора пути по содержанию видео.
Почему это важно
Мультимодальные модели заметно продвинулись в понимании видео, но их способность следовать конкретным инструкциям пользователя в этой области почти не изучена. Существующие тесты обычно измеряют точность решения задачи, а не то, выполнила ли модель именно те условия, которые поставил пользователь, включая условия, завязанные на видеоряд и звук. Video-IFBench закрывает именно этот пробел: бенчмарк построен так, чтобы отдельно проверять соблюдение инструкций, на 32 типах задач и 39 категориях ограничений.
Кому это важно
Разработчикам и исследователям, которые создают или дорабатывают мультимодальные модели для работы с видео, ассистентов, инструменты видеопоиска, модерации контента, помощников для монтажа. Всем, чей продукт должен надёжно выполнять точные пользовательские инструкции по видео (например, «перескажи только эпизоды, где виден один конкретный персонаж» или «ответь ровно тремя пунктами, опираясь на то, что сказано в аудиодорожке»), а не просто правильно описывать происходящее на экране.
Как это применить
Структура бенчмарка, четыре шаблона инструкций, 32 типа задач, 39 категорий ограничений, даёт готовый каркас для собственного стресс-теста мультимодальной модели: можно проверять не только общую точность, но и конкретно устойчивость к множественным, смысловым и вложенным (ветвящимся) инструкциям, именно там, по данным авторов, модели сейчас проседают сильнее всего. Источник не сообщает, будет ли сам набор данных, код или таблица результатов выложены в открытый доступ.
Можно ли доверять
Данные для бенчмарка собирались не полностью автоматически: конвейер сочетал генерацию мультимодальными моделями, программную обработку и обязательную проверку людьми, а сами 39 категорий ограничений составлены исследователями вручную. Оценку прогнали более чем на 20 современных моделях, это широкий охват, а не выборочное сравнение пары систем. При этом в тексте источника нет ни мест работы авторов, ни названий протестированных моделей, ни конкретных цифр точности по каждой из них, ни сравнения с результатами людей, проверить эти детали независимо по имеющемуся материалу нельзя.
Риски и подводные камни
Как и у любого нового бенчмарка, у Video-IFBench есть риск переобучения под сам тест, как только его структура станет известна разработчикам моделей. Полуавтоматическая часть конвейера (генерация мультимодальными моделями) может вносить шум в разметку, даже несмотря на проверку людьми. Источник не приводит сравнения с человеческой способностью следовать тем же инструкциям, поэтому по имеющимся данным трудно оценить, насколько велик разрыв между моделями и приемлемым уровнем качества. Не указано и то, станет ли бенчмарк общедоступным, от этого зависит, смогут ли другие команды воспроизвести и развить результат.