MemArena показал: система памяти важнее размера модели ИИ-ассистента
Персональные ИИ-ассистенты с памятью, которые работают прямо на устройстве (edge-deployed), должны обрабатывать приватные межличностные переписки локально, на открытых (open-weight) моделях. Авторы отмечают, что существующие бенчмарки памяти плохо покрывают сочетание трёх условий сразу: плотного, насыщенного событиями взаимодействия, эго-центричной точки зрения (от лица одного участника) и связного многосессионного мира, где события разных дней логически связаны между собой.
Чтобы закрыть этот пробел, исследователи создали MemArena, бенчмарк на основе единого смоделированного мира, построенный с помощью собственного симулятора агентов MASim. Мир охватывает 50 агентов на протяжении 15 дней и содержит 10,3 млн токенов диалогового текста, а также 24,1 тыс. токенов эго-наблюдений (только текст) на одного агента в день. На основе истории взаимодействий бенчмарк автоматически генерирует эталонные ответы (ground truth) по шести измерениям оценки: способности вспоминать факты, рассуждать на их основе и оценивать достоверность.
На этом бенчмарке протестировали пять открытых моделей-«читателей» (readers) в связке с пятью разными бэкендами памяти: обычный контекст без поиска (Vanilla context), поиск по ключевым словам (BM25-RAG), эталонный поиск с доступом к точному ответу (Oracle retrieval), а также системы Memobase и MemSearch. Получилось три ключевых результата.
Во-первых, выбор бэкенда памяти сильнее влияет на точность ответов, чем масштабирование самой модели-читателя. На модели Qwen3-0.6B переход с бэкенда Memobase на MemSearch даёт прирост точности в +32,5 и +19,2 процентных пункта по двум метрикам, это больше, чем прирост от масштабирования самого ридера MemSearch (+10,6 и +6,8 процентных пункта на тех же метриках).
Во-вторых, ни один бэкенд не справляется с разграничением доступа по правам (permission-aware access): эталонный Oracle-поиск массово «протекает», раскрывает информацию, которую не должен показывать, а остальные бэкенды, наоборот, слишком осторожны и не раскрывают то, что раскрыть можно и нужно.
В-третьих, задержка поиска по памяти заметно сказывается только на очень маленьких моделях-читателях. На edge-устройстве Spark GB10 поиск по памяти добавляет фиксированную задержку в 87 мс (BM25-RAG), 7 мс (Memobase) и 48 мс (MemSearch), для большинства сочетаний модели и бэкенда это небольшая доля общего времени до первого токена (TTFT). Код, симулятор MASim и расширенная версия бенчмарка MemArena-L будут опубликованы после принятия работы к публикации; конкретная дата и площадка публикации в тексте не названы.
Ключевые факты
- MemArena, бенчмарк памяти для локальных ИИ-ассистентов: единый смоделированный мир с 50 агентами за 15 дней, 10,3 млн токенов диалогов и 24,1 тыс. токенов эго-наблюдений на агента в день, построенный симулятором MASim
- Эталонные ответы генерируются автоматически по шести измерениям: способность вспоминать факты, рассуждать и оценивать достоверность
- Протестированы пять открытых моделей-читателей с пятью бэкендами памяти: Vanilla context, BM25-RAG, Oracle retrieval, Memobase, MemSearch
- На Qwen3-0.6B смена бэкенда Memobase на MemSearch даёт +32,5/+19,2 п.п. точности, больше, чем масштабирование самого ридера MemSearch (+10,6/+6,8 п.п.)
- Разграничение доступа по правам не работает ни у одного бэкенда: Oracle раскрывает лишнее, остальные слишком осторожны; на Spark GB10 поиск по памяти добавляет фиксированные 87/7/48 мс (BM25-RAG/Memobase/MemSearch)
Почему это важно
Персональные ИИ-ассистенты с долгой памятью всё чаще проектируют так, чтобы они работали прямо на устройстве пользователя, а не в облаке, именно потому, что имеют дело с приватными переписками. MemArena впервые сводит вместе три условия, которые по отдельности встречались в других бенчмарках, но редко все сразу: насыщенное событиями общение, взгляд от лица одного конкретного человека и связный многодневный мир. Это делает оценку памяти ассистентов ближе к тому, как она реально используется, а не к упрощённым лабораторным сценариям.
Кому это важно
Работа адресована в первую очередь разработчикам архитектур памяти для ИИ-агентов и edge-моделей, тем, кто выбирает, каким способом хранить и извлекать историю переписки для локального ассистента. Также она важна исследователям приватности и безопасности ИИ-систем: один из трёх главных выводов бенчмарка напрямую касается того, что системы памяти пока не умеют корректно разграничивать доступ к личным данным.
Как это применить
MemArena, это исследовательский бенчмарк и инструмент оценки, а не готовый продукт. Практический вывод для разработчиков: при ограниченном бюджете вычислений выгоднее вложиться в улучшение бэкенда памяти (способа хранения и поиска по истории переписки), чем в увеличение размера самой модели-читателя, на тестовой модели Qwen3-0.6B смена бэкенда дала больший прирост точности, чем масштабирование модели. Источник сообщает, что код, симулятор MASim и расширенная версия бенчмарка MemArena-L будут опубликованы после принятия работы к публикации, но конкретной даты или площадки в тексте нет.
Можно ли доверять
Материал, препринт на arXiv, в аннотации не названы ни авторы, ни их аффилиация, ни площадка и статус рецензирования. Приведённые числа, это разница в процентных пунктах между конфигурациями (например, +32,5/+19,2 п.п.), а не абсолютные показатели точности каждого бэкенда или модели по отдельности: абсолютных значений точности в тексте нет, поэтому оценить итоговое качество каждой отдельной связки модель-бэкенд по нему нельзя. Также не поясняется, что именно представляют собой системы Memobase и MemSearch как технологии, они упоминаются только как тестируемые бэкенды.
Риски и подводные камни
Главный практический риск описан в самой работе: разграничение доступа по правам (кто из участников переписки что может узнать) не работает ни у одного из протестированных бэкендов памяти, эталонный Oracle-поиск раскрывает избыточно много, а остальные системы слишком осторожны и недораскрывают нужную информацию. Это означает, что на текущем уровне зрелости системы памяти для ИИ-ассистентов рискуют либо утечкой приватных сведений, либо потерей полезности из-за чрезмерной скрытности. Кроме того, отсутствие абсолютных цифр точности и обещанный, но не датированный релиз кода и бенчмарка MemArena-L затрудняют независимую проверку и воспроизведение результатов на момент публикации препринта.