GPT-5.5 и Claude Fable 5 провалили бенчмарк на активное зрение ActiveVision

Классическая работа по психофизике и когнитивной науке описывает зрение человека как замкнутый цикл: взгляд постоянно перенаправляется в зависимости от промежуточных гипотез о том, что мы видим, а не формируется одним статичным «снимком». Десятилетия исследований показывают, что такое активное наблюдение необходимо для широкого круга задач восприятия. Обладают ли современные мультимодальные большие языковые модели (MLLM) такой способностью, вопрос, на который не отвечают существующие бенчмарки, проверяющие связку «зрение плюс язык».
Группа исследователей во главе с Jiarui Zhang представила бенчмарк ActiveVision, который впервые делает активное наблюдение измеримым для MLLM. Бенчмарк включает 17 заданий в 3 категориях; задания устроены так, что решить их одним статичным взглядом на картинку нельзя, требуется повторное, целенаправленное визуальное считывание.
Результаты показали, что топовые MLLM «проваливаются» на ActiveVision. Лучшая из протестированных моделей, GPT-5.5, на максимальном доступном уровне «усилия рассуждений» решила лишь 10,6% заданий и набрала ноль баллов в 11 из 17 задач. Claude Fable 5, при том что эта модель лидирует в большинстве рейтингов по рассуждению и написанию кода, справилась лишь с 3,5% заданий. Для сравнения, три участника-человека в среднем решили 96,1% заданий, то есть радикально опередили обе модели.
Разрыв сохраняется даже тогда, когда моделям разрешают писать и запускать собственный код для анализа изображений вместо прямого «разглядывания»: такой код оказывается ненадёжным на реалистичных изображениях, а чтобы заметить его ошибки, самой модели снова требуется то самое активное восприятие, которого ей не хватает, получается замкнутый круг.
Авторы заключают, что современные MLLM не обладают устойчивой способностью к активному визуальному наблюдению, и это указывает на необходимость новых архитектур и целей обучения, которые связывали бы восприятие и рассуждение в единый цикл, а не рассматривали их как отдельные модули.
Ключевые факты
- Бенчмарк ActiveVision (17 заданий, 3 категории) впервые измеряет способность мультимодальных моделей к «активному наблюдению», постоянной корректировке взгляда по ходу распознавания, как у человека.
- Лучшая протестированная модель, GPT-5.5, на максимальном уровне «усилия рассуждений» решила лишь 10,6% заданий и получила ноль баллов в 11 из 17 задач.
- Claude Fable 5, лидирующая в большинстве рейтингов по рассуждению и коду, справилась всего с 3,5% заданий бенчмарка.
- Три участника-человека в среднем решили 96,1% заданий, фронтирные модели отстают от людей в разы.
- Разрыв сохраняется, даже когда моделям разрешают писать и запускать собственный код для анализа изображений: такой код ненадёжен на реалистичных снимках, а обнаружение его ошибок само требует активного восприятия, которого моделям не хватает.
Почему это важно
Бенчмарк впервые эмпирически показывает разрыв между тем, как «видят» современные MLLM, и тем, как видит человек. Люди воспринимают изображение как замкнутый цикл: взгляд постоянно перенаправляется по ходу формирования и проверки гипотез о том, что на картинке. Существующие бенчмарки для мультимодальных моделей этого не проверяли, они оценивали способность дать описание по одному «снимку», а не способность целенаправленно и повторно всматриваться. ActiveVision закрывает этот пробел и показывает, что даже лучшие модели почти не обладают активным наблюдением: GPT-5.5 решает лишь 10,6% заданий, Claude Fable 5, 3,5%, тогда как люди, 96,1%. Это ставит под вопрос заявления о «мультимодальном интеллекте» фронтирных моделей в задачах, которые требуют не разового взгляда, а внимательного, повторного разглядывания.
Кому это важно
Результат важен для команд, которые разрабатывают и оценивают мультимодальные модели: он показывает конкретный, измеримый пробел, который стоит закрывать в следующих поколениях архитектур и целей обучения. Важен он и для продуктовых команд, которые строят на базе GPT-5.5, Claude Fable 5 и подобных моделей инструменты для работы с изображениями, от анализа скриншотов и документов до визуальных агентов: если задача требует не одного взгляда, а повторной проверки деталей, качество может оказаться заметно ниже ожидаемого. Значим он и для исследователей когнитивной науки и психофизики зрения, чьи выводы об активном наблюдении у человека легли в основу самой постановки задачи.
Как это применить
Практический вывод, не полагаться на фронтирные MLLM в задачах, где нужно многократно и целенаправленно всматриваться в изображение: сверять мелкие детали, искать ошибку, последовательно проверять гипотезу, без дополнительной проверки результата человеком. Авторы проверили и обходной путь: разрешили модели писать и запускать собственный код для анализа изображений вместо прямого «разглядывания». Это не решает проблему, такой код ненадёжен на реалистичных изображениях, а заметить его ошибки моделям снова мешает нехватка активного восприятия. Для команд, которые оценивают или дообучают модели, сам бенчмарк ActiveVision (17 заданий, 3 категории) может служить проверкой, действительно ли модель повторно исследует изображение или ограничивается одним статичным описанием.
Можно ли доверять
Цифры (10,6% у GPT-5.5, 3,5% у Claude Fable 5, 96,1% у людей), из собственного отчёта авторов работы во главе с Jiarui Zhang, опубликованного как препринт на HuggingFace; в тексте нет указаний на независимое воспроизведение результатов третьей стороной. Человеческая база для сравнения небольшая, всего три участника, но разрыв с моделями настолько велик (в разы, а не в проценты), что общий вывод о слабости активного наблюдения у MLLM выглядит устойчивым даже с учётом небольшой выборки. Методика, 17 заданий в 3 категориях, специально построенных так, чтобы их нельзя было решить одним статичным взглядом, описана в самой работе и открыта для проверки и воспроизведения.
Риски и подводные камни
Главный риск, переоценка возможностей фронтирных моделей в задачах, которые требуют внимательной, повторной визуальной проверки: высокий балл на обычных мультимодальных бенчмарках не гарантирует, что модель заметит ошибку при повторном взгляде на изображение. Отдельный риск, сам обходной путь через генерацию кода: модели, которым разрешили писать и запускать код для анализа изображений, не решают проблему, потому что такой код ненадёжен на реалистичных снимках, а обнаружить его сбой моделям мешает та же нехватка активного восприятия, получается замкнутый круг, из которого сложно выйти без изменения самой архитектуры. Наконец, небольшая человеческая выборка (три участника) и то, что задания разработаны самими авторами бенчмарка, методологические ограничения, которые стоит учитывать при экстраполяции результатов.
«Фронтирные MLLM проваливаются на ActiveVision: лучшая из проверенных моделей, GPT-5.5 на максимальном уровне «усилия рассуждений», решает лишь 10,6% заданий и набирает ноль баллов в 11 из 17 задач, а Claude Fable 5, при том что лидирует в большинстве рейтингов по рассуждению и коду, решает всего 3,5%, далеко позади трёх участников-людей, в среднем набравших 96,1%.»
— Jiarui Zhang с соавторами, «ActiveVision: An Exam for Active Observers»