LycheeMemory V2 экономит до 86% токенов на память ИИ-агентов

LycheeMemory V2 экономит до 86% токенов на память ИИ-агентов

Долгоживущие ИИ-агенты, те, что работают на протяжении многих сессий или длинных диалогов, должны сохранять информацию из прошлого, чтобы опираться на неё в будущих задачах. По словам авторов работы, типичные системы памяти консолидируют её сразу после каждой реплики: LLM вызывается после каждого взаимодействия, чтобы извлечь, суммировать или обновить память, и из-за этого построение памяти дорожает по мере роста диалога. Грубая суммаризация снижает эту стоимость, но рискует потерять детальные контекстные свидетельства; расширение контекста поиска или многошаговое рассуждение LLM решают проблему иначе, они просто переносят издержки с момента построения памяти на момент запроса к ней.

LycheeMemory V2 меняет саму гранулярность консолидации: вместо того чтобы обрабатывать каждое взаимодействие по отдельности, система объединяет несколько обменов репликами в сегменты и, когда сегмент закончен, кодирует его целиком в типизированные записи памяти, не зависящие от контекста. Консолидация по сегментам снижает частоту обращений к LLM при построении памяти, а границы сегментов система определяет по смысловым переходам, а не по фиксированному окну реплик, это помогает сохранить целостность события и временную последовательность фактов лучше, чем консолидация фиксированными окнами. Полученные записи организованы в лёгкие структурированные индексы, по которым поиск нужных свидетельств планируется под конкретный запрос.

В экспериментах с моделью GPT-4.1-Mini в качестве базовой LLM LycheeMemory V2 показывает новый лучший результат: 89,22% на бенчмарке LoCoMo и 92,20% на LongMemEval-S. По сравнению с системой A-Mem этот результат достигается при заметно меньшем расходе токенов на построение памяти, на 86,0% меньше на LoCoMo и на 75,9% меньше на LongMemEval-S, и без роста расхода токенов на этапе запроса к памяти.

Более широкий вывод авторов: соотношение точности и стоимости долгосрочной памяти агента зависит не только от того, какая информация в ней сохраняется, но и от того, какими порциями, с какой гранулярностью, эта информация консолидируется.

Ключевые факты

  • LycheeMemory V2 заменяет консолидацию памяти «после каждой реплики» на консолидацию по смысловым сегментам: несколько обменов репликами объединяются в сегмент и кодируются в память целиком, а не по одному взаимодействию.
  • Границы сегментов система определяет по смысловым переходам, а не фиксированным окном реплик, это помогает сохранить целостность событий и временную последовательность фактов.
  • На бенчмарках с моделью GPT-4.1-Mini результат, новый лучший показатель: 89,22% на LoCoMo и 92,20% на LongMemEval-S.
  • По сравнению с системой A-Mem расход токенов на построение памяти падает на 86,0% на LoCoMo и на 75,9% на LongMemEval-S, без роста токенов на этапе запроса к памяти.
  • Вывод авторов: соотношение точности и стоимости долгосрочной памяти агента зависит не только от того, что хранится, но и от того, с какой гранулярностью это консолидируется.

Почему это важно

Агенты на базе LLM, которые работают на протяжении многих сессий или длинных диалогов, не могут удержать всю историю в промпте и поэтому нуждаются в отдельной памяти. Типичные системы памяти консолидируют её сразу после каждой реплики, вызывая LLM после каждого взаимодействия, из-за этого построение памяти дорожает по мере роста диалога. Альтернативы, которые называют авторы работы, грубая суммаризация или более тяжёлое рассуждение LLM на этапе запроса, либо рискуют потерять детали, либо просто переносят издержки с момента построения памяти на момент запроса к ней. LycheeMemory V2 предлагает третий путь: менять не то, что запоминается, а то, какими порциями это записывается в память. По словам авторов, соотношение точности и стоимости долгосрочной памяти агента зависит не только от того, какая информация сохраняется, но и от того, с какой гранулярностью она консолидируется, а заявленная экономия токенов при рекордной точности это подтверждает.

Кому это важно

Тем, кто строит долгоживущих LLM-агентов с памятью между сессиями, персональных ассистентов, агентов поддержки, автономных исследовательских или кодовых агентов: подход даёт способ хранить историю взаимодействий, не оплачивая вызов LLM за каждую реплику. Исследователям в области архитектур памяти агентов: LoCoMo и LongMemEval-S, устоявшиеся бенчмарки, на которых уже проверялась система A-Mem, так что результат LycheeMemory V2 напрямую сравним с прежней работой в этой области. Командам, которые считают расход токенов на инфраструктуру агентов: экономия на построении памяти в 86,0% и 75,9% без роста токенов на запросах, это прямое снижение счёта за LLM-вызовы в продакшене с интенсивной работой памяти.

Как это применить

Практически применимая идея, которую можно перенести в архитектуру своей агентной памяти: не обязательно вызывать LLM после каждой реплики диалога, можно накапливать несколько реплик в сегмент, определяя его границу по смысловому переходу, а не по фиксированному размеру окна, и кодировать сегмент в типизированные записи памяти целиком, когда он завершён. Для поиска по накопленной памяти авторы предлагают лёгкие структурированные индексы, которые планируют, какие свидетельства нужно достать под конкретный запрос. В экспериментах авторов схема проверена с моделью GPT-4.1-Mini в роли базовой LLM; распространяется ли эффект на другие модели, из текста не следует, это стоит проверить перед переносом в свой стек.

Можно ли доверять

Материал опубликован на HuggingFace Papers под идентификатором 2608.12990. Авторы и организации в самом тексте не названы, дата публикации тоже отсутствует. Показатели 89,22% на LoCoMo и 92,20% на LongMemEval-S, это собственные результаты авторов; с каким именно прежним результатом или системой они сравнивают эти цифры, источник не говорит, назван только один ориентир, A-Mem, и то лишь для экономии токенов на построении памяти, а не для точности. Независимой проверки этих чисел в источнике нет. Методика проверена на одной базовой модели, GPT-4.1-Mini; о том, воспроизводится ли эффект с другими LLM, источник ничего не сообщает.

Риски и подводные камни

Результат проверен только с одной базовой моделью, GPT-4.1-Mini; перенесётся ли выигрыш в токенах и точности на другие LLM, источник не сообщает. Механика ключевых компонентов, как именно устроены «типизированные записи памяти» и как система определяет смысловые границы сегмента, в тексте не раскрыта, известно только то, что они есть; оценить их устойчивость со стороны нельзя. Экономия токенов дана в сравнении только с одной системой, A-Mem, а для самих показателей точности (89,22% и 92,20%) источник вообще не называет, с чем именно они сравниваются, насколько велико реальное превосходство над другими подходами к памяти агентов, из текста не видно. Данных о задержке, затратах в деньгах или требованиях к инфраструктуре при развёртывании в тексте нет.