OpenAgentFlow блокирует 95% атак на ИИ-агентов в тестах

ИИ-агенты на основе больших языковых моделей всё чаще работают не поодиночке, а флотами: несколько агентов, планировщиков, контроллеров и исполнительных бэкендов одновременно действуют в одной пользовательской или корпоративной среде. Из-за этого безопасность превращается в системную задачу управления действиями, нужно решать, можно ли зафиксировать (закоммитить) уже сгенерированное агентом конкретное действие, прежде чем оно изменит общее состояние системы. Существующие защитные механизмы, по словам авторов, покрывают промпты, вызовы инструментов, действия в графическом интерфейсе и поведение отдельных агентов, но применяются разрозненно, плохо видят риски, возникающие на стыке многошаговых цепочек действий, и слабо поддерживают аудит и последующее изменение политик.

Авторы предлагают OpenAgentFlow, архитектуру из «плоскости управления» (control plane) и «плоскости действий» (action plane), которая проверяет безопасность именно в момент фиксации действия. Система приводит ожидающие выполнения действия в графическом интерфейсе, вызовы API, вызовы инструментов и запросы, сгенерированные самой моделью, к единому формату, потоку событий AgentEvent. Каждое такое событие проходит через общую точку применения политики (Policy Enforcement Point) ещё до выполнения, а плоскость управления хранит происхождение событий, состояние сессии, записи аудита и обновляемые политики. Благодаря этому получается единый управляемый поток действий, а новые правила безопасности можно вводить в действие, не меняя сами агенты, промпты, модели или пути исполнения.

Архитектуру реализовали для Android и проверили на нескольких наборах тестов. На бенчмарке из 300 сценариев действий система показала 94,0% точности и заблокировала 95,3% атак. На отдельном наборе из 30 сценариев для проверки динамической смены политик поведение системы совпало с ожидаемым в 27 случаях из 30 после установки новых правил. На третьем наборе, 100 сценариев в эмуляторе Android, из которых удалось отследить 98, система показала 90,8% точности по «сырым» результатам и 92,9% доли успешных прохождений с поправкой на трассировку действий, охватывая сценарии с действиями в интерфейсе, вызовами API и планированием со стороны модели. Авторы делают вывод, что OpenAgentFlow даёт практическую общую границу применения политик безопасности для разнородных флотов ИИ-агентов.

Ключевые факты

  • OpenAgentFlow, архитектура control-plane/action-plane, которая проверяет действия ИИ-агентов перед их фиксацией в системе, а не после
  • Действия в GUI, вызовы API, вызовы инструментов и запросы от LLM сводятся в единый поток событий AgentEvent и проходят через общую точку применения политики
  • На бенчмарке из 300 сценариев действий: 94,0% точности, 95,3% заблокированных атак
  • На тесте динамической смены политик (30 сценариев) после установки новых правил ожидаемое поведение достигнуто в 27 случаях из 30
  • На 98 отслеженных сценариях из 100-кейсового набора в эмуляторе Android: 90,8% точности по сырым данным и 92,9% доли успешных прохождений с поправкой на трассировку

Почему это важно

Пока ИИ-агент один, за его безопасностью можно следить точечно, через промпт, фильтр вызовов инструментов или проверку GUI-действий. Когда агентов, планировщиков и исполнительных бэкендов много и они делят одну среду, риск возникает не внутри отдельного агента, а на стыке многошаговых цепочек действий разных компонентов, и точечные защиты его не видят. OpenAgentFlow предлагает решать это не правками в каждом агенте, а единой точкой проверки перед фиксацией любого действия, и, что важно, позволяет менять правила безопасности, не трогая сами агенты, модели или промпты.

Кому это важно

Команды, которые строят системы из нескольких взаимодействующих ИИ-агентов, планировщиков и исполнительных бэкендов, в потребительских (автоматизация на Android) и корпоративных сценариях. Также специалистам по безопасности и аудиту, которым нужны единая точка контроля, происхождение событий и журнал действий для агентов, действующих в реальных системах, а не просто отвечающих текстом.

Как это применить

Архитектурный паттерн из статьи: разделить систему на плоскость управления (политики, состояние сессии, аудит, происхождение событий) и плоскость действий (нормализация GUI-, API-, tool- и LLM-вызовов в единый формат события). Каждое событие проверяется общей точкой применения политики до того, как оно изменит состояние системы. Такой подход можно перенести на другие среды, где несколько агентов действуют над общими данными: правила безопасности хранятся и обновляются отдельно от логики агентов, поэтому их можно менять без переразвёртывания самих агентов или моделей.

Можно ли доверять

Источник, препринт на arXiv, полный текст доступен, числа воспроизведены дословно. В тексте не названы ни авторы, ни организация, стоящая за работой, это ограничивает возможность независимо оценить репутацию и конфликт интересов. Сравнения с показателями других систем защиты агентов в тексте нет, поэтому судить, насколько 94-95% лучше или хуже существующих решений, по этой публикации нельзя. Детали тестовых сценариев, какие именно атаки, политики и типы действий проверялись, в тексте не раскрыты.

Риски и подводные камни

Ни один из показателей не достигает 100%: на основном бенчмарке система ошиблась в 6% случаев и пропустила часть атак, на тесте смены политик не сработала ожидаемо в 3 случаях из 30, а на наборе с эмулятором Android, примерно в каждом десятом сценарии. В тексте не объясняется, что именно пошло не так в этих случаях и какого рода ошибки это были, ложные срабатывания или пропущенные угрозы. Архитектура пока проверена только на Android; перенос на другие платформы и типы агентных систем в статье не описан.