Представлен OneSearch-VL: агент глубокого поиска по картинкам и видео

Представлен OneSearch-VL: агент глубокого поиска по картинкам и видео

В статье представлен OneSearch-VL, единый агент для «глубокого исследования» (deep research) по визуальным данным: по одному изображению, по нескольким изображениям и по видео. Авторы исходят из того, что эти три случая требуют разных визуальных операций, но имеют общий рабочий процесс: визуальная привязка (поиск нужных фрагментов картинки), внешний поиск информации и сборка фактов в ответ. Главная трудность, по их словам, сохранить зависимости между локализованными визуальными опорами, связями между сущностями, фактами, подтверждёнными источниками, и операциями, которые приводят к ответу.

В центре подхода, Visually Grounded Evidence Graph (VGEG), граф свидетельств с визуальной привязкой. Он кодирует перечисленные зависимости и служит общей эталонной схемой задачи для построения данных, пошагового контроля процесса и оценки на уровне отдельных операций.

На основе VGEG авторы построили движок данных: он составляет и проверяет вопросы по нескольким изображениям и по видео, а также отфильтровывает экспертные траектории решения. Из этих данных собраны два набора: OneSearch-VL-SFT-110K для дообучения с учителем (SFT) и OneSearch-VL-RL-10K для обучения с подкреплением (RL). Кроме того, из разметки VGEG выведено вознаграждение Evidence-aware Visual-Grounded Rubric (EVGR): оно поддерживает на этапе RL прослеживаемость доказательств и визуальную привязку ответа.

Для детальной оценки созданы два новых бенчмарка, OneSearch-MI-Bench и OneSearch-Video-Bench; вопросы в них сгруппированы по исследовательским операциям, закодированным в их VGEG.

Итог по заявлению авторов: модель OneSearch-VL-8B превосходит Qwen3-VL-8B с доступом к инструментам на 20,2 и 17,6 процентного пункта на двух новых бенчмарках соответственно, а также показывает заметный прирост на 7 бенчмарках по изображениям и на VideoDR. Ссылка на репозиторий проекта: github.com/appletea233/OneSearch-VL.

Ключевые факты

  • OneSearch-VL, единый агент глубокого исследования для одного изображения, нескольких изображений и видео; в основе, граф Visually Grounded Evidence Graph (VGEG).
  • VGEG служит общей эталонной схемой для построения данных, пошагового контроля и оценки на уровне операций.
  • Собраны наборы OneSearch-VL-SFT-110K (дообучение с учителем) и OneSearch-VL-RL-10K (обучение с подкреплением), а также вознаграждение EVGR, поддерживающее прослеживаемость доказательств и визуальную привязку.
  • Созданы два бенчмарка: OneSearch-MI-Bench и OneSearch-Video-Bench, вопросы организованы по исследовательским операциям.
  • По данным авторов, OneSearch-VL-8B превосходит Qwen3-VL-8B с доступом к инструментам на 20,2 и 17,6 п.п. на двух новых бенчмарках и заметно улучшает результат на 7 бенчмарках по изображениям и на VideoDR.

Почему это важно

Агенты, которые не просто отвечают по картинке, а ищут информацию во внешних источниках и собирают из неё ответ, отдельная исследовательская задача. Здесь предлагается единый подход сразу для трёх режимов: одно изображение, несколько изображений и видео. Новизна, по описанию авторов, в том, что одна и та же структура (граф VGEG) используется и для создания обучающих данных, и для контроля процесса, и для оценки на уровне отдельных операций, а не только по конечному ответу.

Кому это важно

В первую очередь исследователям мультимодальных агентов и тем, кто строит системы визуального поиска и ответов на вопросы по изображениям и видео. Также материал будет полезен тем, кто занимается обучением моделей с подкреплением и ищет способы награждать не только правильный ответ, но и прослеживаемость доказательств.

Как это применить

Практически применимы заявленные ресурсы: наборы OneSearch-VL-SFT-110K и OneSearch-VL-RL-10K, бенчмарки OneSearch-MI-Bench и OneSearch-Video-Bench, схема вознаграждения EVGR. Ссылка на репозиторий проекта: github.com/appletea233/OneSearch-VL. Лицензия, дата выпуска и доступность весов модели в аннотации не указаны, поэтому условия использования нужно проверять в самом репозитории.

Можно ли доверять

Все цифры, собственные результаты авторов, приведённые в аннотации статьи; независимой проверки в тексте нет. Сравнение сделано только с Qwen3-VL-8B с доступом к инструментам, причём на двух новых бенчмарках, которые авторы создали сами. Абсолютные значения точности и сведения о размере бенчмарков в аннотации не даны, приведены лишь приросты в процентных пунктах. Размер прироста на 7 бенчмарках по изображениям и на VideoDR не уточнён: сказано лишь «заметный прирост».

Риски и подводные камни

Главное ограничение, узость сравнения: единственный названный базовый вариант, Qwen3-VL-8B с инструментами; сопоставления с другими открытыми или закрытыми моделями в аннотации нет. Оценка на бенчмарках, построенных на той же схеме VGEG, что и обучающие данные, может быть выгодна самой методике. Какая базовая модель легла в основу OneSearch-VL-8B, в аннотации не сказано, поэтому вклад подхода и вклад исходной модели по тексту разделить нельзя. Выводы стоит перепроверить по полной статье и репозиторию.