PolicyGuide помогает ИИ-агентам соблюдать политику компании на всём диалоге

PolicyGuide помогает ИИ-агентам соблюдать политику компании на всём диалоге

ИИ-агенты, которые в клиентском сервисе действуют от имени пользователя, например, меняют условия тарифа или билета, обязаны соблюдать внутреннюю политику компании. По словам авторов работы, нарушения возникают по двум причинам: агент либо совершает запрещённое действие (скажем, оформляет изменение тому, кому оно не положено), либо пропускает обязательный по процедуре шаг, идентификацию клиента или подтверждение операции. Существующие способы контроля эту проблему, по их оценке, не закрывают: точечные проверки в момент действия умеют останавливать отдельный рискованный шаг, но не ведут агента через всю многошаговую процедуру целиком, а системы контроля выполнения сценария нацелены на то, чтобы сценарий был пройден до конца, а не на то, чтобы политика соблюдалась на каждом его шаге.

Предложенная авторами система PolicyGuide устроена иначе. Политику каждого домена, например, «телеком» или «авиаперевозки», она заранее компилирует в граф рабочего процесса, а затем после каждой реплики пользователя (а не только перед рискованным действием) запускает проактивный верификатор. Опираясь на сохранённое состояние графа, верификатор сверяет незакрытые запросы пользователя и возвращает агенту конкретную по шагу рекомендацию, которая ведёт его обратно на путь, соответствующий политике. Первым автором работы на странице Hugging Face указан Seongjae Kang.

Систему проверили на бенчмарке τ²-bench в трёх доменах, авиаперевозки, розница и телеком, используя GPT-5.4 в роли и агента, и верификатора. PolicyGuide подняла среднюю оценку Pass^4 с 0,42 до 0,62 по всем трём доменам вместе. Наибольший прирост показал телеком-домен, который авторы называют самым структурированным по рабочим процессам: там оценка выросла с 0,19 до 0,61. Одни и те же построенные графы рабочих процессов сработали и когда роль агента отдали Claude Sonnet 4.6 или Gemini 2.5 Pro вместо GPT-5.4.

В дополнительных проверках PolicyGuide показала самый низкий из зафиксированных показатель успешности атак при взаимодействии с намеренно агрессивными пользователями и самый высокий уровень соблюдения процедуры в отдельном тесте на уровне рабочего процесса, который разработали сами авторы. Точных числовых значений для этих двух результатов источник не приводит, только сравнительные формулировки.

Ключевые факты

  • PolicyGuide компилирует политику каждого домена в граф рабочего процесса и после каждой реплики пользователя запускает проактивный верификатор, который сверяет незакрытые запросы и даёт агенту конкретную по шагу рекомендацию для возврата на путь, соответствующий политике.
  • На бенчмарке τ²-bench (авиаперевозки, розница, телеком) с GPT-5.4 в роли агента и верификатора PolicyGuide подняла среднюю оценку Pass^4 с 0,42 до 0,62.
  • Наибольший прирост, в телеком-домене, который авторы называют самым структурированным по рабочим процессам: оценка выросла с 0,19 до 0,61.
  • Одни и те же графы рабочих процессов сработали и при замене агента на Claude Sonnet 4.6 или Gemini 2.5 Pro вместо GPT-5.4.
  • В дополнительных проверках PolicyGuide показала самый низкий из зафиксированных показатель успешности атак от агрессивных пользователей и самый высокий уровень соблюдения процедуры в собственном тесте авторов на уровне рабочего процесса, точных чисел для этих двух результатов источник не даёт.

Почему это важно

Большинство существующих систем контролируют ИИ-агента точечно, проверяют отдельное рискованное действие или следят, чтобы сценарий был пройден до конца. PolicyGuide закрывает промежуток между этими двумя подходами: он проверяет соблюдение политики на уровне всего диалога, шаг за шагом, а не только в момент, когда агент вот-вот сделает что-то рискованное. Это ощутимо поднимает саму метрику соответствия политике (с 0,42 до 0,62 в среднем по трём доменам), причём построенные графы рабочих процессов переносятся на разные базовые модели агента, GPT-5.4, Claude Sonnet 4.6 и Gemini 2.5 Pro, то есть подход не привязан к одной конкретной модели.

Кому это важно

Прежде всего командам, которые строят или эксплуатируют ИИ-агентов, действующих от имени клиента в регулируемых процессах с несколькими обязательными шагами, в духе тех, что проверялись в статье: телеком, авиаперевозки, розница. Ошибка такого агента оборачивается нарушением политики компании, а не просто неудачным ответом. Работа полезна и исследователям, которые оценивают надёжность ИИ-агентов на бенчмарках вроде τ²-bench, и командам, которые выбирают между разными базовыми моделями для агента и не хотят переписывать правила поведения при смене модели.

Как это применить

Сама работа, исследовательская, без цены и лицензии, но описанный в ней подход можно рассматривать как шаблон для команд, которые строят ИИ-агентов: политику домена заранее переводят в явный граф рабочего процесса, какие шаги обязательны, какие действия запрещены и при каких условиях, а затем на каждой границе хода пользователя (не только перед рискованным действием) прогоняют состояние диалога через отдельный проверяющий модуль. Он сверяется с графом и подсказывает агенту конкретный следующий шаг, а не просто блокирует или пропускает действие целиком.

Можно ли доверять

Текст, доступный для пересказа, это описание работы на странице Hugging Face, то есть уровень аннотации, а не полная статья: в нём нет имён соавторов и организаций (указан только первый автор), нет даты публикации и нет определения того, как именно устроена метрика Pass^4, сказано только, что PolicyGuide её поднимает. Нет и данных о числе тестовых случаев в τ²-bench. Два дополнительных результата, про устойчивость к атакам агрессивных пользователей и про соблюдение процедуры в собственном тесте авторов, даны только сравнительными словами («самый низкий», «самый высокий»), без конкретных цифр, и получены на проверках, которые описали сами авторы работы, а не независимая сторона: относиться к ним стоит как к предварительным.

Риски и подводные камни

Граф рабочего процесса под каждый домен нужно построить и поддерживать вручную, это заранее вложенная работа, которую придётся обновлять вслед за политикой компании. Даже с PolicyGuide средняя оценка Pass^4 по трём доменам доходит только до 0,62, заметно выше базовой линии, но далеко от идеала: часть диалогов агент по-прежнему ведёт с нарушением политики. Источник не сообщает, во что обходится сама проверка, не приведены ни вычислительные затраты, ни задержка от запуска верификатора на каждой реплике пользователя, а это прямой практический вопрос для реального внедрения. Наконец, перенос на другие модели проверен только для трёх конкретных агентов (GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Pro) и трёх доменов бенчмарка, сработает ли метод на незнакомой политике или другой модели, источник не говорит.