Claude 4.6 обошёл GPT 5.4 в бенчмарке на реляционные рассуждения
Исследователи представили SciReC, адаптивный к модели мультимодальный бенчмарк в формате академического диалога, который проверяет у мультимодальных больших языковых моделей (MLLM) способность к реляционному рассуждению: восприятию, сравнению и увязыванию отношений между понятиями. Эта способность включает несколько категорий, например, аналогические, структурные и причинно-следственные отношения, каждая раскрывает свой аспект понимания более высокого порядка.
Вместе с бенчмарком авторы предложили DMRA, диагностический фреймворк, основанный на выявлении дефицитов. Он количественно оценивает вклад трёх компонентов, визуального понимания, владения знаниями и работы памяти, в то, почему модель не справляется с задачей, и таким образом указывает главную причину конкретной неудачи.
По итоговому реляционному баллу лучший результат показала Claude 4.6, 73%, второй результат у GPT 5.4, 68%. Разбор по типам отношений выявил разницу между категориями моделей: открытые модели хуже всего справляются с пространственными отношениями, а проприетарные модели (закрытые, коммерческие) сильнее спотыкаются на иерархических и последовательных отношениях. По предметным областям результаты моделей ниже всего в астрономии и выше всего в психологии.
При этом сам диагностический разбор DMRA показал: главный источник ошибок у всех моделей без исключения, недостатки именно реляционного рассуждения, а не восприятия картинки или знаний по теме. На втором месте по частоте, ограничения памяти.
Ключевые факты
- Новый бенчмарк SciReC проверяет мультимодальные модели на реляционное рассуждение, аналогии, структурные и причинно-следственные связи, в формате многоходового академического диалога
- Диагностический фреймворк DMRA раскладывает ошибку модели на вклад визуального понимания, владения знаниями и памяти, чтобы найти главную причину промаха
- Claude 4.6 набрала лучший итоговый балл, 73%, GPT 5.4 на втором месте с 68%
- Открытые модели слабее всего в пространственных отношениях, закрытые, в иерархических и последовательных
- По предметным областям результаты ниже всего в астрономии, выше всего в психологии; по DMRA главная причина ошибок у всех моделей, само реляционное рассуждение, на втором месте, память
Почему это важно
Реляционное рассуждение, умение видеть и увязывать отношения между понятиями, а не просто распознавать объекты по отдельности, считается признаком более высокого уровня понимания у моделей. До сих пор было мало инструментов, которые не просто ставят моделям общую оценку, а показывают, ПОЧЕМУ именно модель ошибается: не хватает знаний, подводит зрение или подводит память в ходе диалога. DMRA закрывает именно этот пробел, это диагностика, а не просто ещё один лидерборд.
Кому это важно
В первую очередь, исследователям и командам, которые создают и сравнивают мультимодальные модели: бенчмарк и диагностика дают инструмент для точечного поиска слабых мест конкретной модели. Полезно и тем, кто выбирает модель под задачи, где нужно связывать текст и изображения содержательно, работа со схемами, научными данными, учебными и аналитическими материалами, а не просто описание картинки.
Как это применить
DMRA позволяет не гадать, а проверить: если модель ошибается, причина, в том, что она не разглядела деталь на изображении, не знает нужный факт или не удержала контекст многоходового диалога в памяти. Это даёт возможность точечно дорабатывать модель под конкретный дефицит вместо общего дообучения. Разбивка по предметным областям (слабее в астрономии, сильнее в психологии) также подсказывает, для каких доменов модель подходит уже сейчас, а где нужна дополнительная проверка.
Можно ли доверять
Материал, препринт на arXiv; в доступном тексте не указаны имена авторов, институты, размер датасета и точное число протестированных моделей, это ограничивает независимую проверку методики и масштаба эксперимента. Сами числовые результаты (73% и 68% для Claude 4.6 и GPT 5.4) приведены в тексте прямо и однозначно, без оговорок.
Риски и подводные камни
Итоговый балл, усреднение по нескольким разным типам отношений (аналогические, структурные, причинно-следственные, пространственные, иерархические, последовательные), поэтому разница в 5 процентных пунктов между Claude 4.6 и GPT 5.4 может маскировать более серьёзные провалы в отдельных категориях. В тексте не названы конкретные модели, отнесённые к категориям «открытые» и «проприетарные», за пределами самих этих ярлыков, что не позволяет точно понять, какие именно модели сравнивались.