Учёные представили Jev-Mem, архитектуру памяти ИИ-агентов с ускорением в 6,6 раза

Авторы представили Jev-Mem, новую архитектуру памяти для долгоживущих ИИ-агентов. Авторы отмечают, что многие существующие системы памяти управляют организацией, извлечением и использованием воспоминаний через авторегрессивные LLM, из-за чего дорогая генерация текста оказывается на критическом пути каждой операции с памятью.
Jev-Mem переносит в память архитектуру, вдохновлённую разделением когнитивных систем System One / System Two: быстрое, лёгкое принятие решений против медленного, вдумчивого рассуждения. Архитектура состоит из трёх частей: управляющий контур System One, структурная мульти-реляционная плоскость памяти и рассуждающий контур System Two. Контур System One отвечает за типизацию памяти и её реляционную организацию при построении, а также динамически выполняет маршрутизацию запросов, распределение бюджета на извлечение, обход графа, оценку кандидатов и адаптивную остановку при поиске в памяти. System Two подключается только для сложных рассуждений и синтеза итогового ответа.
На бенчмарке LoCoMo Jev-Mem получил суммарную оценку 0,777 по методике LLM-as-a-Judge, это на 11,0% выше относительно лучшей из сравниваемых систем (её название в источнике не указано). Время построения памяти сократилось до 158 секунд, что в 6,6 раза быстрее самой быстрой из конкурирующих систем памяти (тоже не названа). Средняя задержка ответа на запрос снизилась до 0,93 секунды, на 36,7% меньше, чем у сравниваемой системы. Состав самого бенчмарка LoCoMo и типы задач в нём в источнике не описаны.
Ключевые факты
- Jev-Mem, архитектура памяти ИИ-агентов на основе разделения System One (быстрый контроль) и System Two (медленное рассуждение)
- System One сам управляет типизацией памяти, маршрутизацией запросов, распределением бюджета на извлечение и обходом графа памяти, без обращения к LLM на каждом шаге
- System Two подключается только для сложных рассуждений и итогового синтеза ответа
- На бенчмарке LoCoMo: оценка LLM-as-a-Judge 0,777 (на 11,0% выше лучшего конкурента), построение памяти за 158 с (в 6,6 раза быстрее самой быстрой конкурирующей системы), задержка ответа 0,93 с (на 36,7% меньше)
- Названия систем, с которыми сравнивали Jev-Mem, и авторы/институции в источнике не указаны
Почему это важно
Память, узкое место современных долгоживущих ИИ-агентов: чем дольше агент работает, тем больше ему нужно хранить, находить и переиспользовать информацию. Проблема в том, что многие существующие системы для каждой операции с памятью, записи, поиска, обновления, заставляют работать саму большую языковую модель, а генерация текста дорога и медленна. Jev-Mem предлагает разделить труд: рутинные операции с памятью выполняет лёгкий управляющий контур System One без обращения к LLM, а дорогая модель (System Two) включается только тогда, когда нужно действительно рассуждать и формулировать ответ. По заявленным авторами результатам на бенчмарке LoCoMo это одновременно повышает точность (на 11,0%) и радикально ускоряет систему, построение памяти быстрее в 6,6 раза, ответ на запрос быстрее на 36,7%.
Кому это важно
В первую очередь, разработчикам ИИ-агентов, которые строят системы с долгосрочной памятью: ассистентов, работающих с историей диалогов за недели и месяцы, автономных агентов с многошаговыми задачами, продукты на базе retrieval-архитектур. Для них Jev-Mem, пример того, как можно снизить стоимость и задержку памяти агента без потери качества ответов.
Как это применить
В источнике нет ни ссылки на код или веса, ни цены, ни условий использования, это исследовательская статья с описанием архитектуры и результатами на одном бенчмарке (LoCoMo). Практически применить идею сейчас можно только на уровне архитектурного паттерна: выносить типизацию, маршрутизацию и оценку кандидатов памяти в отдельный лёгкий управляющий контур, а полноценную LLM вызывать только для финального рассуждения и синтеза ответа, по образцу разделения System One / System Two, описанного авторами.
Можно ли доверять
Результаты получены на одном стандартном бенчмарке для долгосрочной памяти диалоговых агентов (LoCoMo) и оценивались методикой LLM-as-a-Judge, а не человеческой разметкой напрямую, это стоит учитывать при оценке точности цифр. Источник не называет ни авторов и институции (кроме имени, указанного при публикации), ни конкретные системы, с которыми сравнивался Jev-Mem, ни состав самого бенчмарка, независимо перепроверить сравнение по одному лишь тексту абстракта нельзя.
Риски и подводные камни
Все заявленные цифры, из абстракта самой работы, без независимого воспроизведения и без имени системы-конкурента, у которой отняли рекорд по скорости и точности. Результаты получены на одном бенчмарке (LoCoMo), а обобщаемость архитектуры на другие типы задач и другие типы памяти в источнике не обсуждается. Как и любая система на LLM-as-a-Judge, оценка качества ответов зависит от того, какая модель выступала судьёй, эта деталь в тексте тоже отсутствует.