Video-DeepResearch обошёл Claude, GPT-5 и Gemini в понимании видео

Исследователи представили Video-DeepResearch (Video-DR), мультимодального ИИ-агента, который переносит подход «глубокого исследования» (deep research), ранее применявшийся к статичным изображениям и тексту, на непрерывное видео. Чтобы ответить на вопрос по видео, агенту нужно одновременно плотно разобрать происходящее по кадрам в пространстве и времени (spatiotemporal grounding) и параллельно исследовать открытый веб.
Предварительные тесты действующих моделей выявили две системные проблемы. Первая, «смещение по модальности» (modality bias): агенты обходят инструменты для анализа видео стороной и вместо этого полагаются на текстовый поиск. Вторая, «утечка параметрических знаний» (parametric knowledge leakage): модели чаще угадывают ответ по тому, что уже «запомнили» при обучении, чем реально проверяют его через инструменты.
Чтобы устранить обе проблемы, авторы построили конвейер с разделёнными этапами восприятия и исследования и поэтапным открытием инструментов (stage-wise tool unlocking): агент обязан исчерпывающе разобрать кадры видео и только после этого получает доступ к поиску в вебе. Модель обучали в два этапа, сначала контролируемое дообучение (SFT), затем обучение с подкреплением по методу GRPO (Group Relative Policy Optimization), которое, по словам авторов, снимает потолок, характерный для обучения через имитацию, и даёт агенту больше самостоятельности при исследовании.
Для проверки авторы собрали собственный бенчмарк Video-DR-Bench, 200 сложных многошаговых вопросов по видео (VQA), составленных при участии людей и ИИ. На нём старшая версия, Video-DeepResearch-35B-A3B, показала среднюю точность 64,0%, авторы называют это новым лучшим результатом (state-of-the-art). Это на 5,0 п.п. выше, чем у проприетарной Claude-4.5-Sonnet (59,0%), и заметно выше, чем у GPT-5 (52,5%) и Gemini 2.5 Pro (57,5%). Уменьшенная версия, Video-DeepResearch-30B-A3B, набрала 59,3%, на уровне Claude-4.5-Sonnet, что, по мнению авторов, подтверждает эффективность их метода обучения даже при меньшем размере модели. Код проекта авторы опубликовали на GitHub.
Ключевые факты
- Video-DeepResearch переносит технологию «глубокого исследования», агентов, которые вызывают инструменты и ищут в вебе, а не просто отвечают по памяти, со статичных изображений на непрерывное видео: нужно одновременно разбирать кадры по времени и пространству и искать в вебе.
- Предварительные тесты выявили две проблемы действующих моделей: агенты обходят видео-инструменты в пользу текстового поиска (смещение по модальности) и полагаются на «запомненные» при обучении факты вместо проверки через инструменты (утечка параметрических знаний).
- Решение, конвейер с поэтапным открытием инструментов: агент обязан исчерпывающе разобрать кадры видео, прежде чем получить доступ к веб-поиску; модель обучали в два этапа, сначала SFT, затем GRPO.
- На новом бенчмарке Video-DR-Bench (200 сложных многошаговых вопросов по видео) версия Video-DeepResearch-35B-A3B показала 64,0% точности, новый лучший результат, на 5,0 п.п. выше Claude-4.5-Sonnet (59,0%) и выше GPT-5 (52,5%) и Gemini 2.5 Pro (57,5%).
- Уменьшенная версия Video-DeepResearch-30B-A3B набрала 59,3%, на уровне Claude-4.5-Sonnet при заметно меньшем размере модели; код проекта опубликован на GitHub.
Почему это важно
«Глубокое исследование» (deep research), агентный режим, в котором модель не просто отвечает по своим знаниям, а сама решает, какие инструменты вызвать и какие источники проверить, прежде чем дать ответ. До сих пор такие агенты работали в основном со статичным контентом, текстом и отдельными изображениями. Video-DeepResearch переносит эту схему на непрерывное видео, где вопрос нельзя закрыть, не разобрав происходящее покадрово в пространстве и времени и не сопоставив это с поиском в вебе. Вторая часть работы не менее важна: авторы называют и измеряют две конкретные причины, почему нынешние мультимодальные агенты справляются с видео плохо, подмену разбора кадров текстовым поиском и опору на «память» модели вместо реальной проверки фактов. Диагноз сформулирован так, что применим и за пределами конкретной модели.
Кому это важно
Разработчикам мультимодальных ИИ-агентов, которые вызывают инструменты и ищут в вебе, чтобы ответить на сложный вопрос, работа описывает конкретный архитектурный приём (поэтапное открытие инструментов) и схему обучения (сначала SFT, затем GRPO), которые можно перенести на собственную систему. Исследователям, которые занимаются оценкой мультимодальных агентов, новый бенчмарк Video-DR-Bench даёт готовый набор из 200 сложных многошаговых вопросов по видео для сравнения моделей между собой. Командам, которые строят продукты на основе видео, модерация контента, аналитика видеопотоков, ответы на вопросы по записям, результат показывает: на тесте, который для этого и собрали, специализированный агент обошёл универсальные модели Claude-4.5-Sonnet, GPT-5 и Gemini 2.5 Pro.
Как это применить
Практический вывод для тех, кто разрабатывает видео-агентов: не открывать модели доступ к веб-поиску раньше, чем она исчерпывающе разберёт сами кадры видео. Авторы жёстко зашили такую очерёдность в конвейер именно потому, что в предварительных тестах агенты стабильно выбирали более лёгкий путь, текстовый поиск вместо разбора видео. Двухэтапное обучение, сначала контролируемое дообучение на демонстрациях, затем GRPO поверх него, предлагается как способ снять потолок, типичный для обучения через имитацию, и дать агенту больше самостоятельности. Код проекта авторы выложили на GitHub, но в аннотации не сказано, публикуют ли они веса модели или сам датасет Video-DR-Bench, это стоит уточнить отдельно, прежде чем рассчитывать на полное воспроизведение результатов.
Можно ли доверять
Результаты, это самоотчёт авторов на бенчмарке, который они сами и создали: Video-DR-Bench впервые представлен в этой же работе, и всё сравнение с Claude-4.5-Sonnet, GPT-5 и Gemini 2.5 Pro проведено на нём, а не на независимом или ранее устоявшемся тесте. Бенчмарк собран «при участии людей и ИИ» и содержит 200 вопросов, выборка компактная, а о независимой проверке или воспроизведении результата другими командами в аннотации ничего не сказано. Из аннотации нельзя установить, кто авторы работы и в каком институте или компании она сделана: имена и организации там не названы. Указана лишь ссылка на код на GitHub, публикуют ли авторы веса модели или сам датасет, аннотация не сообщает, а без этого независимую проверку результатов провести не получится.
Риски и подводные камни
Главный риск, принять цифры 64,0% и 59,3% за универсальную оценку способности ИИ понимать видео. Они получены на одном узком бенчмарке из 200 вопросов конкретного типа (сложные многошаговые VQA-задачи), который собрали сами авторы, и могут не переноситься на другие видео-задачи или реальные продукты. Сравнение проведено с конкретными версиями Claude-4.5-Sonnet, GPT-5 и Gemini 2.5 Pro на момент тестов, у проприетарных моделей результаты меняются от обновления к обновлению, и разрыв способен сократиться. В доступной аннотации ничего не сказано о том, насколько дорог и практичен предложенный конвейер, два этапа обучения плюс поэтапное открытие инструментов, при развёртывании в реальном продукте: это стоит проверять отдельно, прежде чем опираться на результат при выборе архитектуры.