Исследователи предложили AIREP, протокол для аудита решений ИИ-систем

В статье представлен протокол AIREP, формат для записи управляющих решений, которые автоматические ИИ-рантаймы принимают по каждому отдельному выводу модели. Когда система пропускает, блокирует, откладывает, вырезает часть содержимого или эскалирует (передаёт человеку) конкретный вывод, AIREP фиксирует это решение как один подписанный объект. Проверить такую запись может любая сторона офлайн, независимо от того, какой именно рантайм её создал.

Каждая запись хранит решение как один из закрытого набора действий (глаголов), привязанный к заявленной политике, на основании которой оно принято. Входные и выходные данные, а также доказательства решения, запись ссылается не напрямую, а по хешу, и явно указывает, что именно это доказательство покрывает, а что нет. Записи выстраиваются в цепочку хешей SHA-256, которая привязывает каждую запись к её позиции в последовательности: благодаря пересчёту хешей можно обнаружить как подделку записи, так и пропуски в цепочке. Всё специфичное для конкретного вендора, модели или предметной области вынесено в единственное опциональное пространство имён, а отдельный механический тест на нейтральность следит, чтобы общий («shared») формат оставался свободен от такой специфики.

Авторы описывают референсную реализацию протокола и комплект для проверки соответствия (conformance kit) на двух языках программирования. Также разбираются нерешённые вопросы внедрения: согласование канонической формы записи между разными реализациями, механизмы подтверждения свежести записей и построение цепочек для случая, когда решения принимают сразу несколько рантаймов. Формат предлагается для добровольного принятия любым ИИ-рантаймом, который ведёт учёт своих управляющих решений.

Ключевые факты

  • AIREP, протокол для записи решений ИИ-рантайма по каждому отдельному выводу: пропустить, заблокировать, отложить, вырезать часть контента или эскалировать на человека
  • Каждое решение оформляется как один подписанный объект, который любая сторона может проверить офлайн, не завися от самого рантайма
  • Записи связаны в цепочку хешей SHA-256, что позволяет пересчётом обнаружить подделку записи или пропуск в цепочке
  • Вендор-, модель- и домен-специфичные данные вынесены в отдельное опциональное пространство имён; нейтральность общего формата проверяется механическим тестом
  • Есть референсная реализация и conformance-kit на двух языках программирования; открытыми остаются вопросы согласования канонической формы, подтверждения свежести записей и цепочек с несколькими рантаймами

Почему это важно

Автоматические ИИ-рантаймы сейчас сами решают, пропустить вывод модели, заблокировать его, отложить, вырезать часть содержимого или передать на рассмотрение человеку, но у этих решений обычно нет единого проверяемого следа. AIREP предлагает закрыть этот пробел: превратить каждое такое решение в подписанную, привязанную к политике запись, которую можно проверить независимо от системы, её принявшей, и обнаружить подделку или пропуск в истории решений через пересчёт хеш-цепочки.

Кому это важно

В первую очередь тем, кто строит или эксплуатирует автоматические ИИ-рантаймы с функциями модерации и контроля вывода, а также тем, кто должен проверять их работу постфактум, аудиторам, регуляторам, специалистам по комплаенсу и безопасности ИИ-систем в компаниях, где решения модели о выпуске или блокировке контента должны быть прослеживаемы.

Как это применить

Протокол сопровождается референсной реализацией и комплектом для проверки соответствия (conformance kit) на двух языках программирования, так что его можно опробовать на практике, а не только изучить по спецификации. Формат предлагается для добровольного принятия: авторы описывают его как открытый для любого ИИ-рантайма, который ведёт запись своих управляющих решений, а вендор- и модель-специфичные детали изолированы в отдельном опциональном пространстве имён, не затрагивающем общую (shared) часть формата.

Можно ли доверять

Это описание протокола и его референсной реализации, а не отчёт о промышленном внедрении: в тексте нет данных о том, что формат уже используется реальным ИИ-рантаймом в продакшене, нет версии, бенчмарков или результатов оценки реализации. Технически заявленная гарантия, обнаружение подделки и пропусков в цепочке через пересчёт SHA-256-хешей, стандартный и проверяемый механизм; авторы сами указывают, что часть вопросов внедрения (согласование канонической формы между реализациями, подтверждение свежести записей, цепочки с несколькими рантаймами) пока остаётся открытой, а не решённой.

Риски и подводные камни

Протокол защищает целостность и прослеживаемость самой записи о решении, но не гарантирует правильность или добросовестность решения, которое эта запись описывает: рантайм может честно и подробно задокументировать плохое или предвзятое решение. Хеш-цепочка обнаруживает подделку постфактум, но не предотвращает её в момент записи, если у атакующего есть доступ к ключу подписи. Практическая ценность формата зависит от того, согласятся ли разные разработчики рантаймов действительно вести такие записи и публиковать их для проверки, сам протокол этого не гарантирует, он лишь описывает формат.