Учёные нашли теоретический предел самопроверки ИИ-агентов

Учёные нашли теоретический предел самопроверки ИИ-агентов

Ихан Чэнь с соавторами предложили теоретическую модель работы мультиагентных систем на основе больших языковых моделей, тех, где оркестратор разбивает задачу на подзадачи для команды воркеров, а результат затем улучшается за счёт текстовой рефлексии (агент переписывает и уточняет собственные заметки-память по итогам работы). По словам авторов, несмотря на сильные практические результаты таких систем, у координации, улучшения памяти и роли внешней проверки до сих пор не было единого формального описания.

Авторы описывают взаимодействие оркестратора и воркеров как двухуровневую координационную игру: при ограниченной связанности задач локальная игра воркеров оказывается приближённо потенциальной, а зазор от идеального равновесия определяется качеством разбиения задачи оркестратором. Отдельно рефлексия рассматривается как случайное блуждание по пространству семантических состояний памяти: для свободной (неформализованной) рефлексии выведена верхняя оценка времени сходимости, доказана её точность в худшем случае и получена положительная нижняя оценка при выполнении проверяемого условия «устойчивого вреда».

Центральный результат работы, информационно-теоретическое доказательство невозможности: никакой фильтр, оценивающий обновление памяти только по сгенерированному тексту, не способен равномерно улучшать качество агента в средах, неразличимых по тексту, тогда как фильтр, опирающийся на сигнал из самой среды (например, факт прохождения теста), способен. Отталкиваясь от этого разрыва, авторы предлагают алгоритм SRMA (Stochastic Reflective Memory Ascent): он принимает кандидата на обновление памяти, только если привязанная к среде оценка риска строго снижается. При соблюдении условий калибровки и «неисчезающей корректирующей массы» SRMA доказанно сходится, точно, геометрически или полиномиально, и обе скорости сходимости показаны как предельно достижимые (order-tight). Дополнительно даны гарантии доверительного гейтинга для стохастической оценки и переякоривания памяти для сред, меняющихся кусочно-стационарно.

В экспериментальной части предсказанные законы координации и дрейфа памяти проверены на средах с привязанными к реальности метриками. На 500 задачах SWE-bench полная система на базе модели Kimi с SRMA решает 72,2% задач против 70,8% у публичного эталонного агента mini-SWE-agent. Код выложен на GitHub.

Ключевые факты

  • Мультиагентная LLM-система «оркестратор, воркеры» описана как двухуровневая координационная игра: при ограниченной связанности локальная игра воркеров приближённо потенциальна, а зазор равновесия зависит от качества декомпозиции задачи оркестратором
  • Доказан информационно-теоретический результат о невозможности: фильтр, видящий только текстовую стенограмму рассуждений агента, не может равномерно улучшать решения в средах, неразличимых по тексту, помогает только фильтр, привязанный к реальной среде
  • Предложен алгоритм SRMA: он принимает обновление памяти агента, только если привязанная к среде оценка риска строго снижается; при выполнении условий калибровки сходится геометрически или полиномиально
  • На 500 задачах SWE-bench система на базе модели Kimi с SRMA решает 72,2% задач против 70,8% у эталонного mini-SWE-agent
  • Код работы выложен в открытом доступе на GitHub

Почему это важно

Мультиагентные системы с оркестратором и текстовой рефлексией сегодня строят «на глаз»: у практики сильные результаты, но не было формального объяснения, почему она вообще работает и когда ломается. Эта работа впервые даёт единую теоретическую рамку, игру для координации воркеров и стохастический процесс для эволюции памяти, и строгое доказательство того, что самопроверка агента по одной лишь стенограмме рассуждений принципиально ограничена: без сигнала из реальной среды фильтр не может гарантированно отсеивать вредные правки памяти.

Кому это важно

Тем, кто разрабатывает или встраивает мультиагентные ИИ-системы с рефлексией и памятью, фреймворки для автономных агентов, конвейеры для автоматического исправления кода, инструменты с самоулучшением по итогам работы. Результат прямо касается решения о том, на что опираться при проверке обновлений памяти агента: на текст рассуждений или на реальный сигнал среды (например, прохождение теста).

Как это применить

Практический вывод, принимать обновление памяти агента только после того, как привязанная к среде оценка риска (а не самооценка по тексту) показала строгое улучшение; это и есть механизм алгоритма SRMA из работы. Авторы выложили код на GitHub, так что подход можно воспроизвести и проверить на своих задачах, а не только на SWE-bench.

Можно ли доверять

Работа опубликована как препринт на HuggingFace Papers и сопровождается открытым кодом, что позволяет проверить как теорию, так и эксперимент. Основные результаты, доказанные теоремы (верхние и нижние оценки, доказательство порядковой точности скорости сходимости SRMA), а не только эмпирика. При этом в тексте не указаны ни аффилиации авторов, ни версия используемой модели Kimi, ни то, какой именно сплит SWE-bench (например, Verified или Lite) использован для 500 задач, это стоит держать в уме при оценке результата.

Риски и подводные камни

Эмпирическое улучшение скромное, 1,4 процентного пункта (с 70,8% до 72,2%) на 500 задачах SWE-bench, и сравнение дано только с одним публичным эталоном, mini-SWE-agent; более широкого сопоставления с другими системами в тексте нет. Неясно, насколько результат переносится за пределы SWE-bench и на другие базовые модели, кроме Kimi. Теоретические гарантии сходимости SRMA справедливы при выполнении условий калибровки и «неисчезающей корректирующей массы», в реальных системах эти условия ещё нужно проверять отдельно.