Moonshot AI представила PerceptionBench: ни одна модель не набрала 60%

Компания Moonshot AI, разработчик открытой ИИ-модели Kimi K3, представила бенчмарк PerceptionBench, тест, который впервые изолированно проверяет визуальное восприятие мультимодальных ИИ-моделей, отделяя его от логического рассуждения и внешних знаний. Каждый вопрос теста можно решить, просто посмотрев на изображение, без цепочки рассуждений и фоновых знаний.
Авторы объясняют подход тем, что существующие бенчмарки покрывают зрительные ошибки моделей лишь частично: анализ 42 открытых бенчмарков показал, что их профили ошибок почти не пересекаются, каждый тест фиксирует свой узкий срез слабостей, и ни один тест или небольшая группа тестов не охватывает зрительное восприятие целиком. Вместо того чтобы придумывать категории заранее, авторы построили таксономию на основе реальных ошибок моделей, проследив каждую до самого раннего сбойного шага. Так получилось десять «доменов навыков»: визуальные отношения, счёт, атрибуты, глубина и 3D, локализация, сравнение, распознавание мелких деталей, интеграция контекста, распознавание текста на изображении (OCR) и галлюцинации. Из внутреннего пула более 17 000 проверенных вопросов Moonshot AI опубликовала 3000 задач: 60% выведены из реальных ошибок моделей, 40% переформулированы с помощью изменённых изображений. На вид задачи тривиальны, определить, где на циферблате часов находится символ, посчитать цветы внутри красной рамки или отличить серо-розовую кружку для карандашей от однотонной розовой с рисунком.
Из 16 протестированных фронтир-моделей ни одна не преодолела порог в 60% точности. Лучший результат, 59,7% у GPT-5.6 Sol, за ней следуют Kimi K3 (58,5%), Claude Fable 5 (57,2%), Gemini 3.1 Pro (56,2%) и GPT-5.5 (55,8%). Открытые модели заметно отстают: Qwen3.5-397B-A17B набрала 47,5%, GLM-4.6V, 32,5%. Показательнее общего рейтинга, результаты по отдельным категориям: модели с почти одинаковым средним баллом резко расходятся по конкретным навыкам. В среднем слабее всего у всех моделей категория «галлюцинации», она проверяет, не «придумывает» ли модель объекты, которых нет на изображении, когда правильный ответ, просто «ноль». GPT-5.6 Sol, лидер общего зачёта, набирает здесь только 26,9%, тогда как более слабая в целом Gemini 3.5 Flash показывает в этой категории 50,6%, один из лучших результатов.
Авторы делают вывод: многие ошибки, которые обычно списывают на «сбои рассуждения», на самом деле происходят уже на этапе восприятия, модель неверно «прочитала» изображение ещё до того, как начала рассуждать. PerceptionBench разбивает такие многошаговые задачи на изолированные вопросы «только про зрение», что позволяет точно определить, какой именно зрительный навык подводит модель. Набор данных и код оценки выложены на GitHub, в репозитории MoonshotAI/PerceptionBench.
Работа встраивается в серию похожих исследований той же команды. Ранее та же группа выпустила бенчмарк WorldVQA, отделяющий распознавание объектов от рассуждения: лучшая модель там, Gemini 3 Pro, не дотянула до 50%, набрав 47,4%, и все проверенные модели систематически завышали уверенность в своих ответах. Отдельное исследование китайских институтов при участии Moonshot AI на бенчмарке BabyVision показало, что топовые модели проваливают зрительные задачи уровня раннего детского развития, например, проследить линию на рисунке или посчитать спрятанные кубики: Gemini 3 Pro набрала там 49,7% против 94,1% у людей. Разрыв исследователи объясняют эффектом «бутылочного горлышка вербализации»: визуальная информация, прежде чем модель может её использовать, переводится в язык и в этом переводе теряет точность.
Ключевые факты
- Moonshot AI, разработчик Kimi K3, представила бенчмарк PerceptionBench, 10 «доменов навыков», 3000 задач из пула свыше 17 000 вопросов, код и данные выложены на GitHub (MoonshotAI/PerceptionBench).
- Из 16 фронтир-моделей ни одна не взяла 60%: лидер GPT-5.6 Sol, 59,7%, Kimi K3, 58,5%, Claude Fable 5, 57,2%, Gemini 3.1 Pro, 56,2%, GPT-5.5, 55,8%.
- Открытые модели отстают заметнее: Qwen3.5-397B-A17B, 47,5%, GLM-4.6V, 32,5%.
- Самая слабая категория у всех моделей, «галлюцинации»: лидер общего зачёта GPT-5.6 Sol набирает там лишь 26,9%, при этом более слабая в целом Gemini 3.5 Flash показывает 50,6%.
- Авторы: часть «ошибок рассуждения» на деле, сбои восприятия на этапе чтения изображения; похожий паттерн подтверждают связанные бенчмарки WorldVQA и BabyVision (Gemini 3 Pro, 49,7% против 94,1% у людей).
Почему это важно
PerceptionBench показывает, что слабость мультимодальных моделей в «зрении», не гипотеза, а измеримый и системный провал: ни одна из 16 протестированных фронтир-моделей не взяла порог в 60% точности на задачах, которые решаются простым разглядыванием картинки, без рассуждений. Это меняет диагноз для многих сбоев, которые раньше списывали на «плохую логику»: авторы показывают, что часть таких ошибок на самом деле происходит уже на этапе чтения изображения, до начала рассуждения.
Кому это важно
Разработчикам и исследователям, которые строят или оценивают мультимодальные системы, ассистентов, работающих с фото и видео, инструменты для распознавания объектов, ИИ для доступности и медицинской визуализации: агрегированный балл бенчмарка маскирует, в каком именно из десяти навыков (счёт, глубина, OCR, галлюцинации и другие) конкретная модель проваливается.
Как это применить
Набор данных и код оценки PerceptionBench открыты на GitHub (MoonshotAI/PerceptionBench). Разбивка по десяти доменам навыков позволяет не просто сравнить модели по общему баллу, а найти, какая именно зрительная способность у конкретной модели слабее прочих, например, склонность «галлюцинировать» несуществующие объекты, которая у лидера общего зачёта GPT-5.6 Sol проседает до 26,9%.
Можно ли доверять
Методология выглядит основательной: категории построены не абстрактно, а на основе реальных ошибок моделей, прослеженных до конкретного сбойного шага, а необходимость нового теста подкреплена анализом 42 существующих открытых бенчмарков, чьи профили ошибок почти не пересекаются. Слабое место, в источнике не названы ни конкретные авторы работы за пределами формулировки «Moonshot AI», ни дата публикации; для сопутствующего исследования BabyVision также не указан размер выборки моделей или участников.
Риски и подводные камни
Главная находка, не столько низкий общий балл, сколько его неравномерность: категория «галлюцинации» проседает у всех моделей сильнее прочих, причём именно у формального лидера теста, GPT-5.6 Sol. Связанные работы той же команды указывают на более глубокую проблему: в исследовании WorldVQA все модели систематически завышали уверенность в своих ответах, а в BabyVision авторы связывают разрыв с людьми (49,7% против 94,1%) с «бутылочным горлышком вербализации», потерей точности при переводе визуальной информации в язык. Это системное ограничение, которое вряд ли снимается одним лишь увеличением масштаба модели.