Учёные нашли теоретический предел самопроверки ИИ-агентов

Ихан Чэнь с соавторами предложили теоретическую модель работы мультиагентных систем на основе больших языковых моделей, тех, где оркестратор разбивает задачу на подзадачи для команды воркеров, а результат затем улучшается за счёт текстовой рефлексии (агент переписывает и уточняет собственные заметки-память по итогам работы). По словам авторов, несмотря на сильные практические результаты таких систем, у координации, улучшения памяти и роли внешней проверки до сих пор не было единого формального описания.
Авторы описывают взаимодействие оркестратора и воркеров как двухуровневую координационную игру: при ограниченной связанности задач локальная игра воркеров оказывается приближённо потенциальной, а зазор от идеального равновесия определяется качеством разбиения задачи оркестратором. Отдельно рефлексия рассматривается как случайное блуждание по пространству семантических состояний памяти: для свободной (неформализованной) рефлексии выведена верхняя оценка времени сходимости, доказана её точность в худшем случае и получена положительная нижняя оценка при выполнении проверяемого условия «устойчивого вреда».
Центральный результат работы, информационно-теоретическое доказательство невозможности: никакой фильтр, оценивающий обновление памяти только по сгенерированному тексту, не способен равномерно улучшать качество агента в средах, неразличимых по тексту, тогда как фильтр, опирающийся на сигнал из самой среды (например, факт прохождения теста), способен. Отталкиваясь от этого разрыва, авторы предлагают алгоритм SRMA (Stochastic Reflective Memory Ascent): он принимает кандидата на обновление памяти, только если привязанная к среде оценка риска строго снижается. При соблюдении условий калибровки и «неисчезающей корректирующей массы» SRMA доказанно сходится, точно, геометрически или полиномиально, и обе скорости сходимости показаны как предельно достижимые (order-tight). Дополнительно даны гарантии доверительного гейтинга для стохастической оценки и переякоривания памяти для сред, меняющихся кусочно-стационарно.
В экспериментальной части предсказанные законы координации и дрейфа памяти проверены на средах с привязанными к реальности метриками. На 500 задачах SWE-bench полная система на базе модели Kimi с SRMA решает 72,2% задач против 70,8% у публичного эталонного агента mini-SWE-agent. Код выложен на GitHub.
Ключевые факты
- Мультиагентная LLM-система «оркестратор, воркеры» описана как двухуровневая координационная игра: при ограниченной связанности локальная игра воркеров приближённо потенциальна, а зазор равновесия зависит от качества декомпозиции задачи оркестратором
- Доказан информационно-теоретический результат о невозможности: фильтр, видящий только текстовую стенограмму рассуждений агента, не может равномерно улучшать решения в средах, неразличимых по тексту, помогает только фильтр, привязанный к реальной среде
- Предложен алгоритм SRMA: он принимает обновление памяти агента, только если привязанная к среде оценка риска строго снижается; при выполнении условий калибровки сходится геометрически или полиномиально
- На 500 задачах SWE-bench система на базе модели Kimi с SRMA решает 72,2% задач против 70,8% у эталонного mini-SWE-agent
- Код работы выложен в открытом доступе на GitHub
Почему это важно
Мультиагентные системы с оркестратором и текстовой рефлексией сегодня строят «на глаз»: у практики сильные результаты, но не было формального объяснения, почему она вообще работает и когда ломается. Эта работа впервые даёт единую теоретическую рамку, игру для координации воркеров и стохастический процесс для эволюции памяти, и строгое доказательство того, что самопроверка агента по одной лишь стенограмме рассуждений принципиально ограничена: без сигнала из реальной среды фильтр не может гарантированно отсеивать вредные правки памяти.
Кому это важно
Тем, кто разрабатывает или встраивает мультиагентные ИИ-системы с рефлексией и памятью, фреймворки для автономных агентов, конвейеры для автоматического исправления кода, инструменты с самоулучшением по итогам работы. Результат прямо касается решения о том, на что опираться при проверке обновлений памяти агента: на текст рассуждений или на реальный сигнал среды (например, прохождение теста).
Как это применить
Практический вывод, принимать обновление памяти агента только после того, как привязанная к среде оценка риска (а не самооценка по тексту) показала строгое улучшение; это и есть механизм алгоритма SRMA из работы. Авторы выложили код на GitHub, так что подход можно воспроизвести и проверить на своих задачах, а не только на SWE-bench.
Можно ли доверять
Работа опубликована как препринт на HuggingFace Papers и сопровождается открытым кодом, что позволяет проверить как теорию, так и эксперимент. Основные результаты, доказанные теоремы (верхние и нижние оценки, доказательство порядковой точности скорости сходимости SRMA), а не только эмпирика. При этом в тексте не указаны ни аффилиации авторов, ни версия используемой модели Kimi, ни то, какой именно сплит SWE-bench (например, Verified или Lite) использован для 500 задач, это стоит держать в уме при оценке результата.
Риски и подводные камни
Эмпирическое улучшение скромное, 1,4 процентного пункта (с 70,8% до 72,2%) на 500 задачах SWE-bench, и сравнение дано только с одним публичным эталоном, mini-SWE-agent; более широкого сопоставления с другими системами в тексте нет. Неясно, насколько результат переносится за пределы SWE-bench и на другие базовые модели, кроме Kimi. Теоретические гарантии сходимости SRMA справедливы при выполнении условий калибровки и «неисчезающей корректирующей массы», в реальных системах эти условия ещё нужно проверять отдельно.