CLBench-V: новый бенчмарк показал, что ИИ-модели плохо учатся на мультимодальном контексте

CLBench-V: новый бенчмарк показал, что ИИ-модели плохо учатся на мультимодальном контексте

Многие реальные задачи требуют, чтобы модель училась не только на знаниях, заложенных при предобучении, но и на конкретном контексте задачи, этот навык называют контекстным обучением. Существующие тесты такого обучения почти всегда текстовые, хотя на практике контекст часто мультимодальный: научные данные подаются через графики и таблицы, финансовые показатели разбросаны по отчётам, а пространственные решения зависят от карт, снимков сцен или веб-страниц. Чтобы закрыть этот разрыв, авторы представили бенчмарк CLBench-V.

Бенчмарк устроен вокруг трёх способностей: привязка к контексту (умение найти нужную информацию в предоставленных материалах), применение новой информации из контекста и усвоение новых знаний, которых не было при предобучении. CLBench-V сочетает переработанные версии уже существующих публичных бенчмарков с новыми датасетами, охватывающими науку, финансы, работу с длинными документами, пространственное мышление и визуальные вопросы-ответы по веб-страницам. Чтобы не собирать каждый из этих датасетов вручную, авторы применили автоматизированные процедуры построения и фильтрации задач.

На выборке из 3443 примеров протестировали шесть современных мультимодальных моделей. Лучший общий результат составил лишь 0,2847, авторы делают вывод, что задача мультимодального контекстного обучения далека от насыщения (то есть модели пока далеки от предела возможностей на этом тесте). При этом лидеры разные по направлениям: InternVL3.5-30B-A3B показала лучший результат в привязке к контексту и в усвоении новых знаний, а Qwen3.5-Plus, в применении новой информации.

Помимо итоговых баллов авторы отдельно разобрали надёжность модели-судьи, которая оценивает ответы, а также то, как на результат влияют длина контекста, число изображений в задаче и типичные случаи провала моделей. Код выложен в открытый доступ на GitHub.

Ключевые факты

  • CLBench-V объединяет переработанные публичные бенчмарки и новые датасеты по науке, финансам, работе с длинными документами, пространственному мышлению и визуальным вопросам-ответам по веб-страницам
  • Бенчмарк проверяет три способности: привязку к контексту, применение новой информации и усвоение новых знаний
  • На 3443 примерах лучший результат среди шести современных мультимодальных моделей, всего 0,2847 балла, что говорит о далёком от насыщения уровне задачи
  • InternVL3.5-30B-A3B лидирует в привязке к контексту и усвоении новых знаний; Qwen3.5-Plus, в применении новой информации
  • Авторы отдельно проверили надёжность модели-судьи и разобрали влияние длины контекста, числа изображений и типичных ошибок; код выложен на GitHub

Почему это важно

Большинство существующих тестов контекстного обучения проверяют только текст, хотя на практике контекст часто мультимодальный, графики, таблицы, отчёты, карты, снимки сцен, веб-страницы. CLBench-V впервые системно оценивает эту способность по трём направлениям и показывает, что даже лучшие современные модели набирают лишь около четверти от максимума (0,2847), то есть задача совмещения новой мультимодальной информации с собственными знаниями моделям пока даётся плохо.

Кому это важно

В первую очередь, исследователям и командам, которые разрабатывают и оценивают мультимодальные модели, а также тем, кто строит на их основе агентов и системы для работы с документами, содержащими изображения: финансовую аналитику, научные обзоры, картографические и веб-сервисы. Для них бенчмарк, способ проверить, действительно ли модель понимает предоставленный контекст, а не просто угадывает по общим знаниям.

Как это применить

Код выложен в открытый доступ на GitHub (IamLihua/CLBench-V). Это позволяет прогонять собственные модели через готовый бенчмарк, а также использовать ту же автоматизированную схему для построения аналогичных контекстных задач в других предметных областях без ручной разметки каждого примера.

Можно ли доверять

Часть бенчмарка построена на переработке уже существующих публичных тестов, часть, на новых датасетах, собранных и отфильтрованных автоматизированными процедурами; методика и код открыты для проверки. Авторы отдельно исследовали надёжность модели-судьи, которая выставляет оценки, что повышает доверие к итоговым цифрам. Работа опубликована как препринт на Hugging Face Papers, независимое рецензирование в тексте не упоминается.

Риски и подводные камни

Автоматизированное построение и фильтрация датасетов могут вносить систематические артефакты или смещения, которые сложно заметить без ручной проверки каждого примера. Протестированы только шесть моделей на момент публикации, расстановка сил в этой быстро меняющейся области может измениться уже с выходом новых версий. Низкий средний балл (0,2847) говорит о слабости именно в этом узком типе задач и не означает, что модели бесполезны в целом; наконец, сама оценка зависит от модели-судьи, которая тоже может ошибаться, хотя авторы и проверяли её надёжность отдельно.