VSysBench: новый бенчмарк показал, что системные инструкции снижают точность мультимодальных ИИ-моделей
В продакшн-продуктах мультимодальные ИИ-модели (модели, которые одновременно работают с текстом и изображениями) всё чаще управляются через системные сообщения, служебные инструкции, задающие модели рамки поведения ещё до того, как в разговор вступает пользователь. Но до сих пор не было единого способа проверить, действительно ли модель соблюдает эти рамки именно в мультимодальном контексте: существующие бенчмарки либо тестируют ограничения только на тексте, либо прячут их в реплику пользователя вместо системного сообщения. Из-за этого оставалось неизвестным, приходится ли платить за соблюдение правил потерей базовых способностей модели, точности в задачах на понимание изображений.
Авторы представили VSysBench, бенчмарк, построенный на датасете MMVet-v2 (тест на понимание изображений). Ограничения в нём разбиты на 5 основных категорий и 22 подкатегории: от чисто текстовых указаний, которые применяются к визуальному контенту, до ограничений, полностью завязанных на само изображение. У каждой категории есть «конфликтная» пара, вариант, где инструкция пользователя намеренно расходится с системным сообщением, чтобы проверить, какая из двух инструкций получает приоритет у модели. Каждый ответ оценивается сразу по двум осям, соблюдение ограничения и правильность самого ответа, с помощью двух метрик: Joint Satisfaction Rate (JSR, «показатель совместного удовлетворения») и Cross-Constraint Sensitivity (CCS, «чувствительность к перекрёстным ограничениям»); точная формула их расчёта в тексте не приводится.
Тест прогнали на 16 мультимодальных моделях и получили три вывода. Во-первых, само наличие системных ограничений заметно снижает базовую точность выполнения задачи (числовой размер этого падения в тексте не приводится). Во-вторых, при конфликте с инструкцией пользователя соблюдение системных правил у моделей с открытыми весами разваливается, тогда как у лучших проприетарных (закрытых) моделей остаётся стабильным. В-третьих, для всех моделей без исключения труднее всего дались именно ограничения, завязанные на изображении, а не текстовые.
Ключевые факты
- VSysBench, новый бенчмарк на основе датасета MMVet-v2, который проверяет, соблюдают ли мультимодальные ИИ-модели системные инструкции.
- Ограничения разбиты на 5 основных категорий и 22 подкатегории, от текстовых указаний до ограничений, полностью завязанных на изображение.
- У каждой категории есть конфликтующий вариант, где инструкция пользователя намеренно расходится с системным сообщением, так проверяется, какая инструкция главнее для модели.
- На 16 моделях: сами системные ограничения заметно снижают точность выполнения задачи по сравнению с ответами без ограничений.
- При конфликте с пользователем модели с открытыми весами чаще нарушают системные правила, а топовые проприетарные модели остаются стабильными; тяжелее всего всем моделям даются ограничения, завязанные на изображении.
Почему это важно
Системное сообщение, стандартный способ задать ИИ-модели рамки поведения: не обсуждать конкурентов, отвечать только по теме, соблюдать формат ответа. До VSysBench не было единого теста, который проверял бы, держится ли модель этих рамок именно тогда, когда в диалог добавляется изображение, и не платит ли она за это точностью ответа. VSysBench впервые собирает такую проверку в одном месте, сразу по 22 видам ограничений и с оценкой правильности ответа.
Кому это важно
Командам, которые строят продукты на мультимодальных моделях, например, чат-ботов с загрузкой изображений или ассистентов для работы со скриншотами и документами, и закладывают в системный промпт бизнес-правила: что нельзя обсуждать, в каком формате отвечать, какие данные не раскрывать. Разработчикам самих моделей, как ориентир, где именно модель теряет управляемость. Исследователям безопасности и надёжности ИИ-агентов, потому что соблюдение системных инструкций лежит в основе любых более сложных правил и защит.
Как это применить
VSysBench можно использовать как отдельную проверку при выборе модели для мультимодального продукта: прогнать кандидатов через все 22 подкатегории ограничений и сравнить не только точность ответов, но и то, насколько модель держит системные правила под давлением конфликтующей команды пользователя. Особое внимание стоит уделить ограничениям, завязанным на изображение, статья показывает, что это самая слабая категория у всех протестированных моделей без исключения, а значит, именно здесь нужны дополнительные проверки на стороне продукта, а не только надежда на системный промпт.
Можно ли доверять
Это исследовательская работа с arXiv: оценка идёт по общей для всех моделей методике, двум метрикам, JSR и CCS, на одном и том же датасете MMVet-v2 и охватывает сразу 16 моделей, а не единичный случай. В доступном тексте не названы авторы и их организация, не указан числовой размер падения точности, не приведены формулы расчёта JSR и CCS и не перечислены сами 16 протестированных моделей с указанием, какие из них открытые, а какие проприетарные, эти детали, вероятно, есть в полном тексте статьи, но не в фрагменте, на основе которого сделан этот пересказ.
Риски и подводные камни
Раз не названо, какие именно открытые и проприетарные модели участвовали в тесте и насколько велик разрыв между ними в цифрах, трудно самостоятельно оценить, распространяется ли вывод «открытые модели хуже держат системные инструкции» на конкретную модель, которой пользуется читатель. Также не объясняется механизм, почему ограничения, завязанные на изображении, даются моделям тяжелее текстовых, это остаётся открытым вопросом в доступном тексте.