Учёные представили Aegis: рантайм-контроль обнулил риски действий ИИ-агентов в тестах

Агентные ИИ-системы запрашивают у окружения действия с реальными последствиями: изменить файл, отправить сообщение, запустить задачу, поменять состояние рабочего процесса. Из-за этого проблема безопасности смещается: раньше речь шла о вредном тексте, который генерирует модель, теперь, о вредных побочных эффектах уже выполненных операций. Контроль на уровне промпта (инструкции и правила в самом запросе к модели) может направлять поведение модели, но не создаёт границу выполнения, реального барьера перед действием он не ставит.

Авторы предлагают Aegis, систему рантайм-управления, которая обращается с выводом модели не как с готовым результатом, а как с предложением действия. Прежде чем инструмент выполнится, предложение проходит через доверенный уровень принятия решений: «Модель предлагает, доверенный рантайм решает». Aegis сверяет предложение с активным состоянием политики, разрешает вопрос происхождения (provenance) запроса на стороне сервера, а при неопределённости отказывает по умолчанию (fail-closed), то есть не пропускает действие, если не может подтвердить его безопасность. Часть спорных случаев система направляет на «сенатское» урегулирование, путь авторизации через кворум, без права одного участника принять решение единолично.

Aegis проверили на многократном песочном (sandbox) корпусе: пять семейств прогонов, 42 задачи, три условия эксперимента и десять повторов на семейство, всего 6300 строк данных. При контроле только на уровне промпта (без Aegis) зафиксировано 79 строк с рискованной утечкой по «компараторному» пути, то есть модель всё же довела рискованное действие до выполнения в обход намеченного безопасного варианта. Среди 2100 строк, где действиями управлял Aegis, не зафиксировано ни одного применения тестового (mock) инструмента и ни одного рискованного побочного эффекта, доведённого до выполнения. Во всех 1832 строках, где Aegis обрабатывал попытку действия, происхождение запроса, подтверждённое Aegis, сохранилось без искажений; во всех 1019 строках, урегулированных через «сенат», зафиксированы доказательства кворума и итогового подписанного результата голосования.

Авторы прямо оговаривают предел вывода: результаты не доказывают безопасность автономных агентов в общем случае. Заявление у́же, в рамках именно этого проверенного песочного корпуса рантайм-контроль на границе действия не дал зафиксированным рискованным предложениям превратиться в реально выполненные побочные эффекты.

Ключевые факты

  • Aegis, рантайм-система: перехватывает предложения ИИ-агента о действиях и утверждает их через доверенный уровень решений до выполнения, а не после
  • При неопределённости система отказывает по умолчанию (fail-closed) и не пропускает действие
  • Спорные случаи проходят «сенатское» урегулирование, авторизацию через кворум, без единоличного решения
  • На корпусе из 6300 строк (5 семейств прогонов, 42 задачи, 3 условия, 10 повторов) контроль только на уровне промпта дал 79 строк с рискованной утечкой
  • Среди 2100 строк, управляемых Aegis, ноль применений тестовых инструментов и ноль доведённых до выполнения рискованных побочных эффектов; все 1832 строки с попыткой действия сохранили подтверждённое происхождение запроса, все 1019 «сенатских» решений, с доказательствами кворума

Почему это важно

У агентных ИИ-систем есть доступ к реальным инструментам: файлам, сообщениям, задачам, состоянию рабочих процессов. Поэтому опасность больше не сводится к вредному тексту от модели, она в том, что модель доведёт вредное действие до реального выполнения. Работа показывает: правила и инструкции внутри самого запроса к модели (контроль на уровне промпта) способны направлять поведение, но не создают физическую границу перед выполнением действия, барьер должен стоять снаружи модели, на уровне рантайма.

Кому это важно

Тем, кто строит или внедряет ИИ-агентов с доступом к инструментам, файловой системе, отправке сообщений, запуску задач: разработчикам агентных платформ, командам, отвечающим за безопасность таких систем в компаниях, и исследователям, изучающим границы автономности ИИ.

Как это применить

Aegis работает как отдельный доверенный уровень между моделью и исполнением: модель формулирует предложение действия, а не выполняет его напрямую; уровень решений сверяет предложение с текущей политикой, проверяет происхождение запроса на сервере и по умолчанию отказывает, если не уверен в безопасности; часть решений передаётся на кворумное урегулирование вместо единоличного одобрения. Работа, исследовательская, оценена только на песочном (sandbox) корпусе с тестовыми (mock) инструментами; о реальном продукте, развёртывании в проде или условиях доступа к коду в тексте не сказано.

Можно ли доверять

Источник, препринт arXiv, авторы и их принадлежность к организации в доступном тексте не указаны. Оценка проведена на многократном песочном корпусе (6300 строк, 5 семейств, 42 задачи, 3 условия), а не на реальном развёртывании с реальными инструментами. Сами авторы ограничивают вывод: результаты не доказывают безопасность автономных агентов в общем случае, а поддерживают более узкое системное утверждение, именно для этого проверенного корпуса.

Риски и подводные камни

Результат получен на тестовых (mock) инструментах в контролируемой песочнице, перенос на реальные инструменты и произвольные агентные среды не проверен. В тексте не раскрыто, из чего конкретно состояли зафиксированные «рискованные» действия и «утечки по компараторному пути», и не приведено сравнение Aegis по имени с другими существующими системами governance. Не описано и то, как определяются пороги кворума при «сенатском» урегулировании, это ограничивает воспроизводимость и оценку надёжности механизма.

«Модель предлагает, доверенный рантайм решает.»

— авторы работы