GPT-4o и Gemini 2.5-Pro провалили тест на разгадывание слов по звуку ручки
Исследователи представили новый бенчмарк The Unwritten Benchmark для проверки абстрактного перцептивного мышления мультимодальных моделей, способности выводить скрытую информацию из динамического, порождающего процесса, а не просто распознавать статичную картинку или звук.
Центральная задача бенчмарка, акустико-кинематический вывод слова (acousto-kinematic word inference): модели дают только звук скрипа пера по бумаге и видео движений кисти руки, пишущей слово, при этом сами чернильные следы на видео не видны. Слова написаны в трёх разных стилях письма. Модель должна по этим двум сигналам расшифровать, какое слово было написано.
Результаты показали резкий разрыв между людьми и машинами. Участники-люди справляются с задачей уверенно: точность распознавания порядка букв в слове превышает 80%. Ведущие мультимодальные модели, включая GPT-4o и Gemini 2.5-Pro, справляются намного хуже и не преодолевают порог в 10% точности.
Авторы также обнаружили парадоксальный эффект слияния модальностей: когда моделям одновременно дают и аудио, и видео, результат зачастую оказывается хуже, чем при использовании только одной из двух модальностей по отдельности, то есть добавление второго источника информации не помогает моделям, а мешает. Авторы делают вывод, что это говорит о фундаментальном сбое в способности моделей синтезировать взаимодополняющие перцептивные сигналы для подобной когнитивной задачи, и указывает на ограничения как в кросс-модальном каузальном рассуждении, так и в понимании моделями микрокинематики движения, то есть мелких деталей физического движения руки при письме.
Ключевые факты
- Исследователи представили новый бенчмарк The Unwritten Benchmark для проверки абстрактного перцептивного мышления мультимодальных моделей.
- Задача, акустико-кинематический вывод слова: модель должна расшифровать слово, написанное в одном из трёх стилей письма, опираясь только на звук скрипа пера и видео движений руки, без видимых чернильных следов.
- Люди справляются с задачей уверенно: точность распознавания порядка букв превышает 80%.
- Ведущие мультимодальные модели, GPT-4o и Gemini 2.5-Pro, не преодолевают порог в 10% точности.
- Обнаружен парадоксальный эффект слияния модальностей: одновременная подача моделям и аудио, и видео часто ухудшает результат по сравнению с использованием только одной модальности.
Почему это важно
Бенчмарк вскрывает разрыв, который обычные тесты на распознавание статичных изображений и звука не показывают: способность выводить скрытую информацию из динамического процесса, задача, с которой люди справляются интуитивно, а ведущие мультимодальные модели проваливаются почти полностью. Особенно показателен парадоксальный эффект слияния: добавление второй модальности не улучшает, а часто ухудшает ответ модели, то есть модели не умеют по-настоящему объединять взаимодополняющие сигналы из разных каналов восприятия, а не просто испытывают недостаток данных.
Кому это важно
Разработчикам и исследователям мультимодальных моделей, которые занимаются кросс-модальным рассуждением, слиянием сенсорных сигналов (fusion) и оценкой границ возможностей ИИ, бенчмарк даёт конкретную задачу, на которой заметен разрыв между заявленными возможностями моделей и реальным пониманием динамических процессов.
Как это применить
The Unwritten Benchmark можно использовать как диагностический тест при оценке новых мультимодальных моделей, в частности, для проверки того, действительно ли модель синтезирует информацию из разных модальностей или просто механически комбинирует сигналы. Коммерческого продукта, цены или условий доступа к бенчмарку в тексте не указано.
Можно ли доверять
Источник, препринт на arXiv с полным текстом аннотации, включающим конкретные числовые результаты (более 80% у людей против менее 10% у моделей). При этом имена авторов и их организационная принадлежность в доступном тексте не указаны, как и точный объём выборки, число слов, участников и попыток тестирования.
Риски и подводные камни
Точной цифры, насколько именно ниже 10% оказались результаты моделей, в тексте нет, известен только сам порог. Среди протестированных моделей в тексте названы только GPT-4o и Gemini 2.5-Pro, поэтому неясно, насколько вывод о провале распространяется на другие мультимодальные системы. Три стиля письма, использованные в задаче, в тексте не названы и не описаны, что затрудняет самостоятельную оценку сложности теста.