Agentic Context Management: как управлять памятью ИИ-агентов

23 июля 2026 года на arXiv вышла статья «Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems». Авторы утверждают: промышленные ИИ-агенты чаще проваливаются не из-за неспособности рассуждать, а потому что не справляются с управлением собственным контекстом, историей переписки, объёмными промптами, описаниями инструментов и разрастающимися результатами их вызовов. По их мнению, распространённый подход, который сводит эту проблему к хранению и поиску данных, слишком узок. Вместо этого они предлагают рассматривать управление контекстом как жизненный цикл: решить, что запомнить, извлечь и структурировать это, выбрать подходящее хранилище под тип данных, консолидировать и забывать лишнее с сохранением происхождения информации, определить, что актуально сейчас, предвидеть, что понадобится дальше, и сжать контекст до нужного бюджета без потери важного. В реальном промышленном применении это работает не для одного пользователя, а сразу для целой иерархии организационных областей.

Эту дисциплину авторы называют Agentic Context Management (ACM) и раскладывают на пять базовых операций: architecting (архитектурное проектирование), ingesting (приём и структурирование данных), scoping (определение области видимости), anticipating (предвосхищение потребностей) и compacting & consolidation (сжатие и консолидация). Далее приводится экономическое обоснование: наивное накопление контекста увеличивает стоимость токенов квадратично по мере роста длины диалога; грубое суммирование даёт линейный рост стоимости, но ценой резкого обрыва точности; и только валидированное сжатие, по их данным, достигает линейного роста стоимости при сохранении точности.

В статье описана референсная реализация под названием Maximem Synap, многотенантный сервис, который, как утверждается, реализует все пять операций и показывает 92% на бенчмарке LongMemEval и 93,2% на бенчмарке LoCoMo при конфигурации, описанной в разделе 6 статьи. В заключение авторы указывают, что существующие бенчмарки пока не измеряют такие параметры, как задержка ответа, эффективность расходования токенов и устойчивость к «гниению контекста» (context rot), и намечают направление развития категории, переход к контексту уровня отдельных решений и уровня организации в целом.

Ключевые факты

  • 23 июля 2026 года на arXiv опубликована статья, вводящая понятие Agentic Context Management (ACM), управление контекстом ИИ-агента как жизненный цикл, а не как задачу хранения и поиска данных.
  • ACM раскладывается на пять базовых операций: architecting, ingesting, scoping, anticipating, compacting & consolidation.
  • Экономическое обоснование: наивное накопление контекста даёт квадратичный рост стоимости токенов от длины диалога, грубое суммирование, линейный рост ценой резкого падения точности, а валидированное сжатие, линейный рост при сохранении точности.
  • Референсная реализация Maximem Synap показывает 92% на бенчмарке LongMemEval и 93,2% на бенчмарке LoCoMo при конфигурации из раздела 6 статьи.
  • Авторы отмечают, что существующие бенчмарки не измеряют задержку, эффективность токенов и устойчивость к «гниению контекста», и указывают на переход категории к контексту уровня решений и организации.

Почему это важно

Статья переопределяет проблему, с которой сталкивается почти любой продакшен-агент: накопление истории диалога и разрастание промптов делает работу дороже с каждым ходом и приводит к провалам в памяти внутри и между сессиями. Авторы настаивают, что решать это одним лишь хранилищем-и-поиском недостаточно, нужна архитектурная дисциплина с пятью операциями, охватывающими весь жизненный цикл контекста. Отдельно они дают экономическое объяснение, почему наивные подходы дорожают квадратично, а простое суммирование покупает дешевизну ценой резкого падения точности.

Кому это важно

Инженерам и архитекторам, которые строят продакшен-системы на основе ИИ-агентов с длинными диалогами, большими наборами инструментов и множеством пользователей или организационных областей: именно у них раньше всего проявляются описанные симптомы, рост стоимости токенов и провалы в памяти.

Как это применить

Пять операций ACM (architecting, ingesting, scoping, anticipating, compacting & consolidation) описаны в статье как каркас для проектирования собственной системы управления контекстом агента, а не как готовый продукт с ценой или сроками выпуска, в тексте статьи такие детали для Maximem Synap не приводятся. Ключевой практический вывод: если цель, не просто снизить расходы, а сохранить точность, обычное суммирование истории для этого не годится, нужна валидированная схема сжатия.

Можно ли доверять

Источник, препринт на arXiv, то есть публикация без прохождения рецензирования на момент выхода. В сохранённом тексте нет имён авторов и указания их организационной принадлежности, поэтому атрибуцию по конкретным людям или институтам дать нельзя. Показатели 92% и 93,2%, это результаты собственной референсной реализации авторов (Maximem Synap) на двух конкретных бенчмарках при заданной в статье конфигурации; в доступном тексте нет сравнительных цифр для конкурирующих систем или предыдущих подходов, с которыми эти показатели можно было бы сопоставить.

Риски и подводные камни

Заявленные результаты бенчмарков получены на собственной реализации авторов без приведённых в тексте цифр конкурентов, что затрудняет независимую проверку того, насколько предложенный подход лучше существующих. В доступном тексте также нет описания того, что именно измеряют бенчмарки LongMemEval и LoCoMo, и нет данных о сроках или условиях выпуска Maximem Synap, судить о практической доступности решения преждевременно.

«Промышленные ИИ-агенты чаще проваливаются не из-за неспособности хорошо рассуждать, а потому что не могут управлять тем, что находится в их контексте рассуждений: историей переписки, объёмными промптами, описаниями инструментов и разрастающимися результатами их вызовов.»

— авторы статьи