Исследователи представили PACE и PaceMaker для поиска скрытых конфликтов в запросах к ИИ

Персональные ИИ-ассистенты должны не только выполнять запросы пользователя, но и оценивать, уместен ли запрос в его текущих обстоятельствах. До сих пор исследования сосредотачивались на точном выполнении запросов и не учитывали, что ассистенту иногда нужно отказать из-за конфликта с контекстом. Кроме того, существующие методы обнаружения конфликтов и небезопасных запросов полагаются на факторы, заданные в запросе явно, тогда как в реальных сценариях значимая информация часто скрыта и её нужно доставать из базы знаний (БЗ).
Чтобы закрыть этот пробел, исследователи представили PACE (Personalized Assistants for Conflict Evaluation), датасет для проверки того, способны ли модели выявлять скрытые ограничения: эгоцентричные факты или события из жизни пользователя, из-за которых на первый взгляд разумный запрос на самом деле становится неуместным. В PACE запросы, привязанные к чётко описанным персонам, сопоставлены с фактами из личной базы знаний этой персоны; чтобы понять, конфликтует ли запрос с ситуацией, модель должна сопоставить его с контекстными фактами. Такая постановка с неявным поиском усложняет задачу: прямой связи между текстом запроса и знанием, вызывающим конфликт, нет, из-за чего существующим моделям трудно найти нужные, специфичные для пользователя факты.
Для решения этой задачи авторы также предложили PaceMaker, мультиагентную систему, в которой несколько специализированных агентов совместно работают над переформулированием запроса, многошаговым обходом графа знаний и отфильтровыванием фактов с учётом возможного конфликта, чтобы найти именно те свидетельства, которые решают, конфликтует запрос или нет. В экспериментах на PACE проверялись и качество поиска нужных свидетельств, и точность итогового решения о конфликте; по результатам PaceMaker стабильно превосходит существующие подходы по обоим показателям. Конкретные цифры точности, размер датасета, список моделей-конкурентов и полный авторский коллектив в тексте источника не приведены.
Ключевые факты
- PACE, датасет для проверки, различают ли ИИ-ассистенты запросы, которые формально разумны, но конфликтуют со скрытыми обстоятельствами пользователя
- Конфликтующие факты в PACE не даны явно в запросе, их нужно найти в личной базе знаний персоны, что усложняет задачу для существующих моделей
- PaceMaker, предложенная авторами мультиагентная система: агенты переформулируют запрос, обходят граф знаний за несколько шагов и фильтруют факты с учётом возможного конфликта
- На датасете PACE PaceMaker стабильно опережает существующие подходы и по качеству поиска нужных фактов, и по точности решения о конфликте; точные цифры в источнике не приведены
- Работа отмечает, что прежние методы обнаружения конфликтов и небезопасных запросов полагались на явно заданные факторы и не учитывали неявные, восстановимые только из базы знаний
Почему это важно
Персонализированные ассистенты всё чаще получают доступ к личным данным пользователя, календарю, истории, заметкам. Работа указывает на пробел: модели умеют выполнять запросы точно, но не умеют соотносить их со скрытым контекстом из этих данных и понимать, что формально корректный запрос на деле противоречит обстоятельствам самого пользователя. PACE впервые формализует именно эту задачу как отдельную проверку, а не как побочный случай безопасности.
Кому это важно
Разработчикам персональных ассистентов и агентов с доступом к памяти или базе знаний пользователя, а также исследователям безопасности и модерации ИИ, которые оценивают не прямые вредные запросы, а более тонкие конфликты с контекстом конкретного человека.
Как это применить
PACE можно использовать как бенчмарк для проверки собственных моделей и агентов на способность находить скрытые конфликты. Архитектура PaceMaker, разделение задачи между агентами для переформулирования запроса, многошагового обхода графа знаний и фильтрации фактов с учётом конфликта, предлагает шаблон конвейера поиска для систем, где нужный факт напрямую не связан с текстом запроса.
Можно ли доверять
Источник, научная публикация с описанием метода и результатами экспериментов на собственном датасете; в тексте нет ни количественных показателей, ни списка авторов и организаций, ни описания моделей-конкурентов, поэтому независимо оценить масштаб превосходства PaceMaker по этому фрагменту нельзя. Заявление о том, что PaceMaker "стабильно превосходит существующие подходы", вывод самих авторов по их собственному бенчмарку.
Риски и подводные камни
Результаты получены на датасете, созданном теми же авторами, что предлагают метод, это типичный риск конфликта интересов бенчмарка и решения. Отсутствие приведённых цифр не позволяет судить, насколько велик реальный отрыв PaceMaker от базовых подходов. Кроме того, способность находить конфликт в контролируемом датасете персон не гарантирует такую же точность на реальных, менее структурированных базах знаний пользователей.