Relic: команды ИИ-агентов учатся на сбоях через исполняемые протоколы

Relic: команды ИИ-агентов учатся на сбоях через исполняемые протоколы

Авторы статьи начинают с типичной проблемы: несколько агентов в одной организации конфликтуют. Например, один кодирующий агент меняет интерфейс в репозитории, а другой продолжает разработку на старой версии, из-за чего существующие тесты устаревают. Разговор может закрыть этот эпизод, но когда состав участников меняется, непонятно, что заставит урок и дальше действовать в команде.

Ответ авторов, система Relic. Она превращает повторяющиеся сбои совместной работы в исполняемые протоколы, которыми владеет организация, а не отдельные участники. Участники анализируют видимую работу, предлагают правила и сами управляют их принятием. Принятые протоколы привязывают к среде выполнения триггеры, ответственность, требуемые доказательства и последствия для исполнения, но остаются открытыми для пересмотра и отмены. В одном разобранном случае повторяющееся трение при интеграции породило правило проверки интерфейсов, которое затем управляло последующими pull request и пересматривалось по ходу работы.

Результаты. На 360 контрольных запусках по десяти программным рабочим нагрузкам и трём моделям Relic поднимает долю полной поставки по контракту (complete-contract delivery) с 14,06% до 19,76% (в статье указан прирост +5,71 процентного пункта) относительно сопоставимой структурированной команды без жизненного цикла протоколов. При этом улучшились все четыре проверенные производственные конечные точки в каждом модельном страте.

При передаче работы новому участнику поведенческая корректность составляет 25,4% без унаследованного протокола, 34,6%, если те же правила даны как читаемый текст, и 41,2%, с исполняемыми привязками. Авторы указывают преимущество исполняемых привязок над одним текстом в +6,5 пункта.

На полном бенчмарке CooperBench (после исключения некорректных пар) Relic набирает 367 из 477 (76,9%); авторы называют это лучшим опубликованным результатом среди систем с одноранговой структурой. На фиксированном подмножестве из 48 пар с одной и той же моделью Relic превосходит Solo (29/48 против 26/48), устраняя потерю от координации, которую показал официальный одноранговый базовый вариант.

Вывод авторов: опыт совместной работы может стать устойчивым состоянием организации, полезным и после ухода тех участников, которые его создали.

Ключевые факты

  • Relic превращает повторяющиеся сбои совместной работы агентов в исполняемые протоколы, которыми владеет организация; их можно предлагать, принимать, пересматривать и отменять.
  • На 360 контрольных запусках (десять программных нагрузок, три модели) полная поставка по контракту выросла с 14,06% до 19,76% против сопоставимой команды без жизненного цикла протоколов.
  • При передаче работы новому участнику поведенческая корректность: 25,4% без протокола, 34,6% с правилами в виде текста, 41,2% с исполняемыми привязками.
  • На полном CooperBench (без некорректных пар) Relic набирает 367/477 (76,9%), по словам авторов, лучший результат среди одноранговых систем.
  • На подмножестве из 48 пар Relic обходит Solo: 29/48 против 26/48.

Почему это важно

Мультиагентные команды в разработке сталкиваются с конфликтами: один агент меняет интерфейс, другой работает по старой версии. Разговор решает конкретный эпизод, но не гарантирует, что урок сохранится, когда состав участников сменится. Relic предлагает хранить такой опыт как состояние организации, а не память отдельных участников.

Кому это важно

Тем, кто строит и исследует системы из нескольких ИИ-агентов, особенно для совместной разработки кода, где важны интеграция, проверка интерфейсов и передача работы новым участникам.

Как это применить

Идея из статьи: превращать повторяющиеся сбои в правила с триггерами, ответственностью, требуемыми доказательствами и последствиями для исполнения, привязанными к среде выполнения, а не оставлять их текстовыми рекомендациями. Данных о доступности кода или о цене запуска в тексте нет.

Можно ли доверять

Это авторская аннотация на странице Hugging Face Papers, все цифры, заявления самих авторов. Имена авторов и организаций в тексте не указаны, три использованные модели и десять рабочих нагрузок не названы, сведений о рецензировании нет. Указанные в тексте приросты (+5,71 п.п. и +6,5 пункта) приведены так, как напечатаны, и не в точности совпадают с разностью перечисленных долей.

Риски и подводные камни

Абсолютные значения остаются невысокими: полная поставка по контракту выросла лишь до 19,76%, а преимущество исполняемых привязок над текстом составляет +6,5 пункта. Из текста не ясно, сколько запусков использовано в сравнениях с передачей работы и на CooperBench, а превосходство над Solo на подмножестве из 48 пар, 29 против 26. Утверждение о лучшем результате относится только к одноранговым системам.

«Участники анализируют видимую работу, предлагают правила и управляют их принятием.»

— авторы статьи о Relic