Учёные представили NEXUS, систему, которая решает, разрешать ли действие ИИ-агента
ИИ-агенты, которые умеют вызывать внешние инструменты, всё чаще выполняют действия с реальными последствиями: правят файлы, дёргают API, переводят деньги. Простого бинарного «разрешить/запретить» для контроля таких действий недостаточно, поэтому авторы работы предложили NEXUS (Neural EXecution Utility and Safety), структурированный монитор безопасности для агентов, работающих с инструментами.
NEXUS применяет формальную политику вмешательства и на каждом шаге выбирает одно из четырёх действий: разрешить, заблокировать, запросить подтверждение у человека или потребовать переделать (пересмотреть) план агента. Решение строится на сочетании трёх механизмов: детерминированных правил безопасности, проверки на уровне аргументов вызываемых инструментов и калиброванной оценки риска на основе логистической регрессии, которая обеспечивает плавную, градуированную эскалацию вместо резкого стоп-крана.
На синтетическом бенчмарке из 128 примеров NEXUS достиг F1-оценки 0,949 и точности выбора верного из четырёх действий 64,06%, это на 27,3 процентного пункта выше, чем у решения, основанного только на жёстких правилах. На бенчмарке R-Judge система также обошла вариант с одними правилами (F1 0,861 против 0,849). На AgentHarm результат NEXUS совпал с результатом решения на правилах, авторы объясняют это ограничениями самой модели угроз в этом бенчмарке. На тесте на индиректные инъекции (IPI) NEXUS показал 0% успешных атак при сохранении 99% разрешённых легитимных (контрольных) действий. На специально созданном «слепом к правилам» стресс-тесте NEXUS-Stress результат оказался ниже, F1 0,881, что авторы приводят как свидетельство сложности точной маршрутизации вмешательства.
При этом добавленная задержка минимальна: медианное время работы монитора, 0,205 мс, то есть менее 0,1% накладных расходов на типичный цикл работы агента. Код, бенчмарки и калиброванный оценщик риска авторы выложили в открытый доступ.
Ключевые факты
- NEXUS выбирает одно из четырёх действий, разрешить, заблокировать, запросить подтверждение у человека или потребовать переделать план, с помощью формальной политики вмешательства
- На синтетическом тесте из 128 примеров: F1 0,949, точность выбора верного из 4 действий 64,06%, на 27,3 процентного пункта выше решения только на жёстких правилах
- На бенчмарке индиректных инъекций (IPI): 0% успешных атак при сохранении 99% разрешённых легитимных действий
- Медианная задержка, 0,205 мс, менее 0,1% накладных расходов на цикл работы агента
- На стресс-тесте NEXUS-Stress результат ниже (F1 0,881), а на AgentHarm система не превзошла решение только на правилах, из-за ограничений модели угроз в этом бенчмарке
Почему это важно
ИИ-агенты всё чаще выполняют действия с реальными последствиями, правят файлы, вызывают внешние сервисы, переводят деньги. Бинарное «разрешить/запретить» для такого контроля грубо: нужна соразмерная реакция на разную степень риска. NEXUS предлагает структурированный слой безопасности поверх работы агента, который различает риск действия и подбирает одно из четырёх вмешательств вместо единственного стоп-крана.
Кому это важно
Разработчикам, которые встраивают инструменты (доступ к файлам, платежи, внешние API) в LLM-агентов, и командам безопасности, отвечающим за их эксплуатацию в проде, там, где ошибка агента стоит данных или денег.
Как это применить
Авторы выложили код, бенчмарки и калиброванный оценщик риска в открытый доступ, так что систему можно подключить как отдельный слой поверх существующего агентного цикла. Задержка минимальна, медиана 0,205 мс, менее 0,1% накладных расходов, то есть внедрение не замедляет типичный цикл работы агента.
Можно ли доверять
NEXUS протестирован на нескольких независимых наборах: синтетический бенчмарк из 128 примеров (F1 0,949), R-Judge (F1 0,861 против 0,849 у решения только на правилах), AgentHarm (результат совпал с базовым решением, авторы указывают на ограничения модели угроз этого бенчмарка), тест на индиректные инъекции IPI (0% успешных атак при 99% разрешённых легитимных действий) и «слепой к правилам» стресс-тест NEXUS-Stress (F1 0,881). Это препринт на arXiv, не прошедший рецензирование, цифры получены самими авторами на собственных тестах.
Риски и подводные камни
Даже при высоком общем F1 точность выбора верного из четырёх действий, всего 64,06%: система нередко верно определяет, что действие рискованное, но ошибается с конкретным вмешательством. На стресс-тесте NEXUS-Stress результат заметно ниже основного бенчмарка (F1 0,881 против 0,949), сами авторы называют это подтверждением того, что точная маршрутизация вмешательства остаётся трудной задачей. На AgentHarm преимущества над простыми правилами не показано, из-за ограничений модели угроз бенчмарка, а не потому что задача решена.