Agentic Context Management: фреймворк для памяти и стоимости ИИ-агентов

Авторы утверждают: сбои продакшен ИИ-агентов чаще случаются не из-за слабого рассуждения, а из-за неспособности управлять тем, что попадает в контекст, историей переписки, объёмными системными подсказками, описаниями инструментов и разрастающимися результатами их вызовов. Агент буквально тонет в накопленной истории, при этом стоимость в токенах растёт с каждым ходом диалога, а часть информации теряется как внутри одного разговора, так и между разговорами.
Авторы считают, что привычный взгляд на проблему, «это просто хранение и поиск данных», слишком узкий. Вместо этого они предлагают рассматривать управление контекстом как жизненный цикл: решить, что запомнить; извлечь и структурировать это; выбрать подходящее хранилище под тип данных; консолидировать и забывать лишнее, сохраняя историю происхождения данных; определить, что актуально прямо сейчас; предугадать, что понадобится дальше; и сжать контекст до нужного бюджета токенов, не потеряв важное. В реальных продакшен-системах это происходит не для одного пользователя, а сразу для целой организационной иерархии областей доступа. Авторы называют эту дисциплину Agentic Context Management (ACM) и раскладывают её на пять составляющих (primitives): проектирование архитектуры (architecting), приём и разбор данных (ingesting), определение области видимости (scoping), прогнозирование потребностей (anticipating) и сжатие с консолидацией (compacting & consolidation).
Далее в статье приведён экономический аргумент. Наивное накопление контекста увеличивает стоимость в токенах квадратично относительно длины диалога. Грубая суммаризация даёт линейный рост стоимости, но ценой резкого падения точности, часть смысла теряется. И только выверенное (validated) сжатие контекста, по утверждению авторов, даёт линейный рост стоимости при сохранении точности ответов.
В качестве референсной реализации описан сервис Maximem Synap, который реализует все пять составляющих ACM как многопользовательский (multi-tenant) сервис. Авторы сообщают результаты 92% на бенчмарке LongMemEval и 93.2% на бенчмарке LoCoMo при конфигурации, описанной в разделе 6 статьи.
В заключение авторы отмечают, что существующие бенчмарки пока не измеряют ряд важных для продакшена параметров: задержку ответа, эффективность по токенам и устойчивость к деградации контекста (context rot, постепенной потере качества контекста со временем). Они указывают на это как на направление для дальнейшей работы, вместе с управлением контекстом на уровне отдельных решений и на уровне организации в целом.
Ключевые факты
- Сбои продакшен-агентов чаще вызваны не слабым рассуждением, а неспособностью управлять разрастающимся контекстом (историей диалога, подсказками, результатами вызова инструментов), из-за этого стоимость в токенах растёт с каждым ходом, а часть данных теряется
- Авторы предлагают рассматривать управление контекстом как жизненный цикл, а не как задачу хранения и поиска, причём в продакшене это работает не для одного пользователя, а для целой организационной иерархии областей доступа
- Названа дисциплина Agentic Context Management (ACM) с пятью составляющими: проектирование архитектуры, приём данных, определение области видимости, прогнозирование потребностей, сжатие и консолидация
- Экономика: наивное накопление контекста, квадратичный рост стоимости; грубая суммаризация, линейная стоимость ценой резкой потери точности; выверенное сжатие, линейная стоимость при сохранении точности
- Референсная реализация Maximem Synap показывает 92% на LongMemEval и 93.2% на LoCoMo; авторы отмечают, что нынешние бенчмарки не измеряют задержку, эффективность по токенам и устойчивость к деградации контекста
Почему это важно
Статья называет проблему, с которой на практике сталкивается почти любой продакшен-агент: не нехватку «ума» модели, а перегрузку контекста, раздутую историю переписки, объёмные подсказки, описания инструментов и результаты их вызовов. Это не абстрактная теория, а прямое объяснение двух знакомых симптомов: агент забывает то, что было сказано раньше, и стоимость его работы в токенах растёт с каждым новым ходом диалога. Авторы предлагают решать это не точечными патчами хранения данных, а целостным жизненным циклом управления контекстом.
Кому это важно
В первую очередь, инженерам и командам, которые строят и эксплуатируют ИИ-агентов в продакшене, особенно там, где агент работает не с одним пользователем, а в многопользовательской (multi-tenant) среде с организационной иерархией доступа: корпоративные ассистенты, платформы для нескольких клиентов, системы с долгой историей взаимодействия. Также полезно тем, кто оценивает архитектуру памяти агентов и хочет понимать, чем выверенное сжатие контекста отличается от простой суммаризации.
Как это применить
Авторы формулируют пять составляющих управления контекстом как практический чек-лист: продумать архитектуру хранения по типам данных (architecting), настроить приём и структурирование входящих данных (ingesting), явно определять область видимости контекста для текущей задачи (scoping), прогнозировать, что понадобится агенту дальше (anticipating), и сжимать контекст до бюджета токенов без потери важного, консолидируя данные с сохранением истории их происхождения (compacting & consolidation). Ключевой практический вывод: не полагаться на грубую суммаризацию ради экономии, она даёт линейную стоимость, но резко теряет точность; вместо этого нужно выверенное (validated) сжатие, которое сохраняет качество.
Можно ли доверять
Это материал со страницы препринта на Hugging Face Papers, автор, Гаурав Дадхич с соавторами; на момент сбора у публикации скромный отклик, 18 очков и 3 комментария за примерно 129 часов. Заявленные метрики (92% на LongMemEval, 93.2% на LoCoMo) получены на референсной реализации авторов, Maximem Synap, и приведены при конкретной конфигурации из раздела 6, это самоотчёт разработчиков системы, а не независимая проверка третьей стороной, так что к абсолютным цифрам стоит относиться с поправкой на источник.
Риски и подводные камни
Главное ограничение авторы называют сами: существующие бенчмарки памяти агентов (LongMemEval, LoCoMo) пока не измеряют задержку ответа, эффективность по токенам и устойчивость к деградации контекста со временем, то есть высокий процент точности не гарантирует, что решение будет быстрым и дешёвым в реальной эксплуатации. Кроме того, заявленные результаты получены на собственной реализации авторов при определённой конфигурации, и неясно, насколько они переносятся на другие агентные системы и на более сложные многоорганизационные сценарии, о которых говорится в статье.
«Сбои продакшен ИИ-агентов чаще случаются не из-за неспособности хорошо рассуждать, а потому что агенты не могут управлять тем, что находится в их контексте рассуждения.»
— Гаурав Дадхич с соавторами, статья об Agentic Context Management