KoNA: бенчмарк проверяет умение ИИ отказываться отвечать по частям

KoNA: бенчмарк проверяет умение ИИ отказываться отвечать по частям

Исследователи представили бенчмарк KoNA, инструмент для проверки того, умеют ли визуально-языковые модели (VLM, модели, работающие одновременно с изображением и текстом) избирательно отказываться отвечать: выполнять ту часть запроса, на которую можно ответить, и одновременно отказываться от той части, что содержит ошибочную предпосылку, небезопасна, невыполнима или не имеет ответа. По словам авторов, существующие бенчмарки в основном проверяют отказ отвечать на уровне запроса целиком, как будто на весь запрос нужно либо ответить, либо отказать целиком. На практике же реальные запросы часто смешивают отвечаемую часть с той, на которую отвечать не следует.

KoNA охватывает пять категорий: ложная предпосылка (False Premise), визуальная недоступность (Visual Inaccessibility), универсальная неизвестность (Universal Unknown), выполнимость задачи (Task Feasibility) и безопасность (Safety). Для каждой категории бенчмарк проверяет две способности модели: отказ на уровне всего запроса и отказ на уровне отдельного компонента запроса, на парах одиночных и составных (смешанных) запросов.

Проверка разных VLM на KoNA показала, что модели часто не справляются с задачей: не отказывают, не поправляют пользователя и не воздерживаются от ответа там, где это нужно, и эти сбои усиливаются именно на составных запросах, где требуется избирательный, а не сплошной отказ.

Чтобы решить эту проблему, авторы дообучили VLM на примерах из KoNA, требующих избирательного отказа, вместе с набором полностью отвечаемых запросов, на которые модель должна отвечать напрямую. Дообученные модели показали существенный прирост точности отказов, почти не потеряв в качестве на полностью отвечаемых задачах. По выводам авторов, это говорит о том, что дообученные модели способны различать отвечаемые и неотвечаемые части запроса и реагировать на них по-разному.

Ключевые факты

  • KoNA, бенчмарк для проверки избирательного отказа отвечать у визуально-языковых моделей: способности выполнить отвечаемую часть запроса и отказаться от неотвечаемой части
  • Пять категорий: ложная предпосылка, визуальная недоступность, универсальная неизвестность, выполнимость задачи, безопасность
  • Для каждой категории проверяются две способности, отказ на уровне всего запроса и отказ на уровне отдельного компонента, на одиночных и составных запросах
  • Проверка показала: модели часто не отказывают, не поправляют и не воздерживаются от ответа там, где нужно, особенно на составных запросах
  • Дообучение на примерах KoNA заметно повышает точность отказов, почти не снижая качество ответов на полностью отвечаемых задачах

Почему это важно

VLM всё чаще получают запросы, которые смешивают отвечаемую и неотвечаемую части, например, вопрос об изображении вместе с просьбой, отвечать на которую не следует. Существующие проверки безопасности и полезности моделей обычно оценивают запрос целиком и поэтому не видят случаев, когда модель корректно обрабатывает одну часть запроса, но ошибочно соглашается выполнить другую. KoNA формализует эту избирательность как отдельную измеримую способность.

Кому это важно

Разработчикам визуально-языковых моделей и командам, которые занимаются их оценкой и безопасностью: бенчмарк даёт способ проверить не «отказывает ли модель вообще», а «отказывает ли она именно в той части запроса, где это нужно». Также это важно тем, кто строит продукты на VLM с составными запросами от реальных пользователей, где смешение отвечаемого и неотвечаемого, обычное дело.

Как это применить

KoNA можно использовать как тестовый набор для оценки существующих VLM по пяти категориям отказов и как источник обучающих примеров: авторы показывают, что дообучение на данных KoNA вместе с полностью отвечаемыми примерами (чтобы не потерять полезность модели) заметно повышает точность избирательных отказов. Конкретные протестированные модели, числовые показатели точности и размер датасета KoNA в источнике не приводятся.

Можно ли доверять

Работа, материал с Hugging Face Papers с чёткой методологией: пять категорий отказов, парные одиночные и составные запросы, оценка на нескольких VLM и отдельная проверка того, что дообучение не портит качество ответов на полностью отвечаемых задачах. При этом в тексте не названы ни авторы, ни конкретные протестированные модели, ни числовые показатели точности, независимо оценить масштаб улучшений по одному описанию нельзя.

Риски и подводные камни

Без конкретных цифр точности и названий протестированных моделей трудно судить, насколько велик разрыв между базовыми и дообученными моделями и распространяется ли он на популярные коммерческие VLM. В тексте не сказано, проверялась ли отдельно частота ложных отказов на отвечаемых задачах сверх общей метрики удержания качества, это обычный риск для любого дообучения, нацеленного на отказы.