Recuris: рекурсивная архитектура памяти подняла успешность ИИ-агентов на долгих задачах

Рекурсивное самосовершенствование (RSI) плохо работает на долгих многошаговых задачах: растущая история действий агента размывает понимание текущего состояния задачи и сбивает выбор нужного навыка. Чтобы решить эту проблему, исследователи представили Recuris, рекурсивную архитектуру Experiential-Working Memory (память опыта и рабочая память) для агентных систем, рассчитанных на долгие сценарии.
В Recuris рабочая память (Working Memory) отслеживает прогресс по задаче и на его основе выбирает нужные навыки из памяти опыта (Experiential Memory), не заставляя агента опираться на всю накопленную историю целиком. Это же взаимодействие превращает выполнение задачи в структурированное свидетельство, которое точно указывает, в каком именно компоненте памяти произошёл сбой. Отдельный фиксированный мета-агент (Meta-Agent) превращает такие свидетельства в точечные, проходящие проверку (validation-gated) обновления памяти навыков (Skill Memory), которые меняют дальнейшее выполнение и порождают новые свидетельства, так складывается ограниченный рекурсивный цикл эволюции памяти.
На четырёх бенчмарках для долгих задач и десяти моделях Recuris улучшил успешность выполнения задач в 35 из 37 завершённых комбинаций модель-бенчмарк. На бенчмарке tau-bench архитектура добавила +17.8 пункта модели GPT-5.6 Sol и +15.6 пункта модели Claude Opus 5, подняв Opus 5 до 87.9% успешных решений. На бенчмарке SkillFlow модели Qwen3.6-27B и Qwen3.6-35B получили +16.6 и +13.5 пункта соответственно. Преимущество Recuris растёт вместе с длиной задачи: на самых долгих сценариях разрыв достигает +32.2 пункта, а число типичных ошибок долгих задач падает до 80%.
Авторы позиционируют рекурсивно эволюционирующую память как масштабируемую основу для RSI, способ, которым агенты могут непрерывно превращать накопленный опыт в более эффективное поведение на длинных горизонтах. Код архитектуры выложен в открытом доступе на GitHub, в репозитории Gen-Verse/Recuris.
Ключевые факты
- Recuris, рекурсивная архитектура памяти для ИИ-агентов на долгих задачах: рабочая память отслеживает прогресс, память опыта хранит навыки, а мета-агент точечно обновляет память навыков по проверяемым свидетельствам о сбоях.
- На четырёх бенчмарках и десяти моделях Recuris улучшил успешность в 35 из 37 комбинаций модель-бенчмарк.
- На tau-bench: +17.8 пункта у GPT-5.6 Sol и +15.6 пункта у Claude Opus 5, который в итоге достиг 87.9% успешных решений.
- На SkillFlow: +16.6 пункта у Qwen3.6-27B и +13.5 пункта у Qwen3.6-35B.
- Преимущество растёт вместе с длиной задачи, до +32.2 пункта на самых долгих сценариях, а типичные ошибки долгих задач сокращаются до 80%.
Почему это важно
Долгие многошаговые задачи, слабое место сегодняшних агентных систем: чем длиннее история действий, тем труднее агенту удерживать состояние задачи и выбирать релевантный навык из своего опыта. Recuris разводит эти две функции по разным типам памяти и связывает их через структурированные свидетельства о сбоях, что и даёт прирост успешности именно на длинных горизонтах, по данным авторов, разрыв с базовым подходом увеличивается по мере роста длины задачи, вплоть до +32.2 пункта.
Кому это важно
Прежде всего разработчикам агентных систем (agent harnesses) на базе моделей вроде GPT-5.6, Claude Opus 5 и семейства Qwen3.6, которые сталкиваются с деградацией качества на длинных сценариях. Также это важно исследователям, работающим над рекурсивным самосовершенствованием (RSI) агентов, авторы прямо связывают архитектуру памяти с этим направлением.
Как это применить
Код Recuris опубликован в открытом доступе на GitHub, в репозитории Gen-Verse/Recuris. Архитектура описана как надстройка над агентной системой: рабочая память и память опыта управляют выбором навыков во время выполнения, а мета-агент по накопленным свидетельствам вносит точечные, проходящие проверку изменения в память навыков, то есть встраивание предполагает интеграцию всех трёх компонентов памяти, а не подключение одного готового модуля.
Можно ли доверять
Данные взяты из полного текста препринта самих авторов (Hugging Face Papers), независимой проверки третьей стороной в источнике нет. В пользу доверия говорят конкретные, а не только усреднённые цифры по каждой модели и бенчмарку, широкий охват, четыре бенчмарка и десять моделей, и открытый код. Против, 2 из 37 комбинаций модель-бенчмарк улучшения не показали, а в тексте не раскрыто, что именно измеряют tau-bench и SkillFlow и с каким конкретно базовым методом сравнивался Recuris.
Риски и подводные камни
В тексте не названы авторы и организации, стоящие за работой (публично доступно лишь имя первого автора по метаданным листинга, что не тождественно полному составу), нет данных о стоимости обучения, составе данных и независимой воспроизводимости результатов сверх ссылки на код. Не раскрыта методология сравнения с базовой архитектурой без Recuris, поэтому масштаб заявленного выигрыша сложно оценить без деталей эксперимента.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.