REMORY: нейросеть дополняет сжатый контекст агента токенами памяти

REMORY: нейросеть дополняет сжатый контекст агента токенами памяти

Агенты, работающие на длинных задачах, сжимают свою историю, чтобы уложиться в конечное контекстное окно. Авторы статьи отмечают, что одного текстового пересказа может не хватать для каждого последующего решения агента.

Для этого они предлагают REMORY: нейросеть памяти, которая дополняет пересказ ограниченной по длине последовательностью «мягких» токенов памяти (soft memory tokens). Сеть получает историю и пересказ и учится порождать токены, которые помогают замороженной языковой модели приблизить то продолжение, какое она выдала бы при полной истории. Токены строятся с опорой на пересказ и дописываются после него, образуя аналог остаточной связи (residual connection) вдоль оси последовательности.

Результаты, о которых сообщают авторы. На SummHay REMORY улучшает указание источников (source attribution) при почти неизменном охвате ключевых идей (insight coverage) и приближается к совместной оценке при полном контексте, используя лишь 5,2% входных позиций. На бенчмарках долгих агентных задач модели Qwen3.8-27B и GLM-5.3-Flash показывают устойчивый выигрыш от остаточной памяти. Кроме того, обе модели заметно реже повторяют вывод инструментов и допускают ошибки при вызове инструментов на BrowseComp и Terminal-Bench 2.1.

Ключевые факты

  • REMORY дополняет текстовый пересказ истории агента ограниченной последовательностью «мягких» токенов памяти, которые дописываются после пересказа.
  • Сеть обучается так, чтобы замороженная языковая модель приближала продолжение, которое она выдала бы при полной истории.
  • На SummHay улучшается указание источников при почти неизменном охвате идей; совместная оценка приближается к уровню полного контекста при 5,2% входных позиций.
  • Qwen3.8-27B и GLM-5.3-Flash показывают устойчивый выигрыш на бенчмарках долгих агентных задач.
  • На BrowseComp и Terminal-Bench 2.1 у обеих моделей заметно меньше повторных выводов инструментов и ошибок инструментов.

Почему это важно

Сжатие истории, обычный приём для агентов, которым нужно работать дольше, чем вмещает контекстное окно. По мысли авторов, текстовый пересказ при этом может терять сведения, нужные для будущих решений. REMORY пробует закрыть этот пробел без изменения самой языковой модели: она остаётся замороженной, а недостающее добавляет отдельная сеть памяти.

Кому это важно

Тем, кто строит или исследует долгоживущих агентов (веб-поиск, работа в терминале) и сталкивается с потерями при сжатии контекста. Также разработчикам методов памяти и сжатия контекста для языковых моделей.

Как это применить

Прямого рецепта в описании нет: упоминаний кода, релиза модели или лицензии там не приведено. Практически работа пока даёт идею архитектуры, дополнять пересказ обучаемыми токенами памяти, дописываемыми после него, и ориентир, на каких бенчмарках её проверяли (SummHay, BrowseComp, Terminal-Bench 2.1).

Можно ли доверять

Перед нами только краткое описание работы. Авторы и их организации в нём не названы. Абсолютных оценок на SummHay, BrowseComp и Terminal-Bench 2.1 нет, а величины улучшений («устойчивый выигрыш», «заметно меньше» ошибок) не выражены числами; единственная приведённая цифра, 5,2% входных позиций. Сравнения с другими методами сжатия контекста и памяти в описании не упомянуты. Заявленные результаты стоит проверять по полному тексту статьи.

Риски и подводные камни

Из описания неясно, сколько токенов памяти допускается, как и на каких данных обучается сеть и каковы её размер и стоимость. Метод лишь приближается к оценке при полном контексте, а не достигает её. Выводы относятся к двум названным моделям и перечисленным бенчмаркам; переносить их на другие модели и задачи без проверки нельзя.