PerceptionBench проверил зрительное восприятие ИИ: ни одна модель не взяла 60% точности

PerceptionBench проверил зрительное восприятие ИИ: ни одна модель не взяла 60% точности

Zichao Lin с соавторами представили PerceptionBench, бенчмарк для проверки атомарного зрительного восприятия мультимодальных больших языковых моделей (MLLM). Проблема, которую решают авторы: существующие бенчмарки не умеют изолировать именно восприятие. Комплексные (holistic) оценки смешивают ошибки восприятия с провалами в рассуждении или предметных знаниях, а прикладные бенчмарки покрывают только узкие, разрозненные области, подобранные эвристически, из-за этого непонятно, где именно модель ошибается: не увидела деталь на картинке или не смогла сделать вывод.

Авторы пошли путём «снизу вверх»: они продиагностировали самые ранние точки сбоя в ответах передовых MLLM на 42 существующих бенчмарках и на этой основе построили таксономию ошибок. Её раздел, посвящённый восприятию, выделяет десять атомарных перцептивных способностей, то есть десять отдельных элементарных навыков «увидеть и распознать», которые можно проверять независимо друг от друга.

Под эту таксономию собрали 3000 проверенных вопросов с короткими однозначными ответами. Каждый вопрос изолирует ровно одну способность, а сложность вопроса создаётся именно восприятием, а не рассуждением или фоновыми знаниями.

Результаты тестирования шестнадцати передовых MLLM показали: атомарное восприятие остаётся во многом нерешённой задачей, ни одна модель не превысила 60% точности. Слабее всего в среднем модели справляются с перцептивными галлюцинациями (когда модель "видит" на изображении то, чего там нет). При этом близкие итоговые баллы разных моделей скрывают резко разные профили способностей: модели с одинаковым общим результатом могут проваливать разные из десяти атомарных навыков. PerceptionBench предлагается как стандарт для измерения и диагностики границ зрительного восприятия MLLM на уровне отдельных способностей, а не общего балла.

Ключевые факты

  • PerceptionBench, новый бенчмарк для изоляции чистого зрительного восприятия мультимодальных моделей от рассуждений и знаний
  • Таксономия ошибок построена по диагностике ранних точек сбоя MLLM на 42 существующих бенчмарках; выделено десять атомарных перцептивных способностей
  • Собрано 3000 проверенных вопросов с короткими однозначными ответами, каждый изолирует одну способность
  • На 16 передовых MLLM ни одна модель не превысила 60% точности; слабее всего, перцептивные галлюцинации
  • Похожие итоговые баллы моделей скрывают сильно разные профили способностей по отдельным навыкам

Почему это важно

Большинство бенчмарков для мультимодальных моделей меряют общий результат и не разделяют, где модель ошиблась: не разглядела деталь на изображении или не смогла сделать логический вывод из увиденного. PerceptionBench системно изолирует именно перцептивную составляющую, десять атомарных способностей, каждая проверяется отдельными вопросами. Это меняет саму методологию оценки мультимодальных моделей: вместо одного общего балла появляется профиль по конкретным навыкам восприятия.

Кому это важно

Разработчикам мультимодальных моделей (MLLM), бенчмарк показывает, какие именно перцептивные навыки у их моделей слабы, а не просто общий процент правильных ответов. Исследователям в области компьютерного зрения и ИИ-безопасности, таксономия ошибок и датасет из 3000 вопросов дают инструмент для диагностики источников галлюцинаций и ошибок восприятия. Тем, кто строит прикладные системы на базе MLLM (анализ изображений, документов, интерфейсов), результаты показывают, что даже топовые модели ошибаются в базовом восприятии почти в половине случаев.

Как это применить

PerceptionBench, это бенчмарк из 3000 вопросов, привязанных к десяти атомарным перцептивным способностям. Разработчики моделей могут прогонять свои MLLM через него, чтобы получить не общий балл, а разбивку по конкретным способностям и увидеть, какие именно виды восприятия (в том числе перцептивные галлюцинации) проседают сильнее всего, и целенаправленно дообучать модель под слабые места.

Можно ли доверять

Методология описана прозрачно: таксономия ошибок выведена эмпирически, из диагностики реальных ответов передовых MLLM на 42 существующих бенчмарках, а не придумана умозрительно. Вопросы бенчмарка (3000 штук) верифицированы и имеют короткие однозначные ответы, что снижает субъективность оценки. Результаты получены на 16 актуальных передовых моделях, что даёт достаточно широкую выборку для сравнения.

Риски и подводные камни

В доступном описании не раскрыты конкретные названия шестнадцати протестированных моделей и точные цифры по каждой из десяти способностей, судить о деталях профиля способностей конкретных моделей по одному этому источнику нельзя. Как и любой новый бенчмарк, PerceptionBench со временем может стать целью оптимизации (модели дообучают именно под тестовый набор), что размоет его диагностическую ценность, если вопросы не будут обновляться.

«Атомарное восприятие остаётся во многом нерешённой задачей: ни одна модель не достигла 60% точности, а перцептивные галлюцинации в среднем, самая слабая способность»

— авторы PerceptionBench