Исследователи представили HazardAuditor, систему контроля безопасности для ИИ-агентов, работающих с компьютером

Исследователи представили HazardAuditor, систему контроля безопасности для ИИ-агентов, работающих с компьютером

ИИ-агенты всё чаще получают доступ к реальным системам, браузерам, терминалам, файловой системе, внешним сервисам, и риск от них возникает не в сгенерированном тексте, а в самих действиях во время выполнения. По утверждению авторов, существующие модели контроля безопасности (guard models) рассчитаны на статичные запросы и ответы и плохо подходят для оценки исполняемых действий агента; а существующие платформы для исполняемой проверки безопасности выдают только вердикт по конкретному случаю, а не нормализованные данные, на которых такую модель можно обучать сразу для разных агентных фреймворков.

HazardAuditor, фреймворк, который, по словам авторов, закрывает оба пробела через привязку к реальному выполнению. Его инфраструктура запускает разнородных агентов, Claude Code, Codex, Hermes и OpenClaw, в контролируемых средах и приводит их действия к единому каноническому представлению событий, пригодному для обучения модели контроля сразу на нескольких фреймворках.

Авторы также обнаружили, что стандартные потокенные (token-level) методы дообучения плохо подходят для генеративных моделей контроля: более длинные текстовые обоснования вердикта начинают доминировать при обновлении градиентов, оттесняя сам вердикт. Предложенный авторами метод Guard Policy Optimization (GuardPO) решает эту проблему, переводя детерминированный исход проверки безопасности в оценку на уровне всей последовательности и нормализуя отдельно область обоснования и область вердикта, так, что именно решение по безопасности, а не текст вокруг него, становится основной единицей оптимизации.

По данным авторов, на нескольких бенчмарках и разнородных компьютерных агентных системах HazardAuditor повышает точность до 16,5 процентного пункта по сравнению с лучшей из прежних моделей контроля. Код, модели и материалы для оценки авторы обещают выложить на отдельной странице проекта; конкретной даты релиза в тексте нет.

Ключевые факты

  • HazardAuditor, фреймворк для обучения моделей контроля безопасности ИИ-агентов, привязанный к реальному выполнению действий, а не к тексту запроса и ответа.
  • Инфраструктура запускает четырёх разных агентов, Claude Code, Codex, Hermes и OpenClaw, в контролируемых средах и приводит их действия к единому событийному представлению для кросс-фреймворкового обучения.
  • Метод дообучения GuardPO переводит вердикт по безопасности в оценку на уровне всей последовательности, а не отдельных токенов, чтобы длинные текстовые обоснования не заслоняли собой сам вердикт при обучении.
  • На нескольких бенчмарках и агентных системах HazardAuditor превосходит лучшую из прежних моделей контроля по точности до 16,5 процентного пункта.
  • Код, модели и материалы для оценки авторы обещают опубликовать на странице проекта; дата релиза не указана.

Почему это важно

Компьютерные ИИ-агенты не просто генерируют текст, они кликают, вводят команды в терминал, читают и меняют файлы, обращаются к внешним сервисам. Ошибка или злонамеренное действие здесь проявляется не в формулировке ответа, а в реальном шаге, который агент уже совершил. По утверждению авторов работы, прежние модели контроля безопасности заточены под проверку статичных пар «запрос-ответ» и плохо ловят такие исполняемые риски, а системы, которые всё же проверяют реальное выполнение, отдают только итоговый вердикт по конкретному запуску, этого недостаточно, чтобы на этих данных обучить новую модель контроля сразу для нескольких разных агентных фреймворков.

Кому это важно

Разработчикам, которые встраивают в свои продукты компьютерных агентов вроде Claude Code, Codex и похожих систем и которым нужен отдельный слой безопасности поверх самого агента. Исследователям в области безопасности ИИ, которые ищут способ сравнивать и обучать модели контроля не на одном фреймворке, а сразу на нескольких. Командам, которые эксплуатируют агентную инфраструктуру и хотят проверять действия агента в момент выполнения, а не только итоговый текстовый ответ.

Как это применить

Авторы обещают выложить код, обученные модели и материалы для оценки на отдельной странице проекта, но конкретной даты и условий доступа (платно или бесплатно, под какой лицензией) в тексте не указано. Практический элемент, который можно применить уже сейчас как идею, сама схема: запускать агента в контролируемой среде, приводить его действия к единому событийному представлению и обучать модель контроля методом GuardPO, а не обычным потокенным дообучением генеративной модели.

Можно ли доверять

Материал, научная публикация на HuggingFace Papers; имена авторов, их аффилиации и институты в тексте аннотации не приведены. Цифра улучшения точности (до 16,5 процентного пункта), оценка самих авторов по их же экспериментам; в тексте не названы ни конкретные бенчмарки, на которых измерялся результат, ни конкретная модель, которая была «лучшей из прежних» и с которой шло сравнение. Независимой проверки или рецензии в источнике не упомянуто, а код и модели на момент публикации ещё не выложены, значит, результаты пока нельзя воспроизвести самостоятельно.

Риски и подводные камни

Главный риск, типичный для препринтов: цифры даны без имени бенчмарков и без имени модели-конкурента, поэтому проверить сравнение независимо невозможно. Обещание выложить код и модели пока не выполнено, дата не названа. Кроме того, инфраструктура протестирована на ограниченном наборе из четырёх конкретных агентных фреймворков (Claude Code, Codex, Hermes, OpenClaw), насколько подход обобщается на другие агентные системы, из текста не следует.