JitMem: память ИИ-агентов «по требованию» обошла прежние методы на 16+ пунктов

JitMem: память ИИ-агентов «по требованию» обошла прежние методы на 16+ пунктов

Большинство систем памяти ИИ-агентов курируют опыт «на запись»: как только задача выполнена, её траектория сжимается в готовый артефакт, рефлексию, рабочий процесс, навык или стратегию рассуждения, который потом извлекается по схожести с новым запросом. Авторы новой статьи указывают на проблему такого подхода: система вынуждена решать, что стоит запомнить, ещё до того, как станет известен будущий запрос, и безвозвратно отбрасывает часть информации, а итоговое резюме должно годиться сразу для множества разных задач впоследствии. Обучать такого «куратора на запись» тоже сложно: ценность решения о том, что сохранить, может проявиться лишь много шагов спустя, когда придёт подходящий запрос, это создаёт проблему присвоения заслуг на длинном горизонте.

Авторы предлагают другой подход, Just-in-Time Memory (JitMem, «память точно в срок»). Система сохраняет сырые траектории как есть и откладывает их курирование до момента чтения, когда текущая задача уже известна. Получив извлечённые прошлые эпизоды и новую задачу, куратор памяти синтезирует компактный набор данных, подстроенный именно под неё. Поскольку этот набор используется сразу же, для той же задачи, куратора можно обучать напрямую по немедленному успеху выполнения задачи, без отложенных сигналов полезности и без искусственной группировки похожих задач.

JitMem проверили на трёх агентных бенчмарках, ALFWorld (выполнение бытовых задач в текстовой среде), WebShop (покупки в интернет-магазине) и τ²-bench. Система стабильно обходит агентов без памяти, а также эвристические и обученные методы памяти «на запись»: превосходство над лучшей альтернативой составило 16,2 процентных пункта успешности на ALFWorld, 16,3, на WebShop и 3,9, на τ²-bench. Отдельно отмечается, что даже необученный куратор памяти уже конкурентен с базовыми методами или превосходит их, это показывает, что основной прирост даёт сама идея адаптации памяти под конкретную задачу в момент чтения, а не обучение куратора как таковое. При этом дообучение куратора дополнительно усиливает результат.

Ключевые факты

  • Большинство систем памяти ИИ-агентов формируют её «на запись»: сразу после задачи траектория сжимается в готовый артефакт, из-за чего система отбрасывает информацию ещё до того, как известен будущий запрос
  • JitMem откладывает курирование памяти до момента чтения, когда текущая задача уже известна, и синтезирует компактный набор данных именно под неё
  • На бенчмарках ALFWorld, WebShop и τ²-bench JitMem обошла лучшую из существующих альтернатив на 16,2, 16,3 и 3,9 процентных пункта успешности соответственно
  • Даже необученный куратор памяти уже конкурентен с базовыми методами или превосходит их, основной прирост даёт сама идея адаптации памяти под задачу в момент чтения
  • Куратора памяти можно обучать напрямую по немедленному успеху выполнения задачи, без отложенных сигналов полезности и искусственной группировки похожих задач, и это дополнительно улучшает результат

Почему это важно

Память, ключевое узкое место агентных систем на базе языковых моделей: агент, который заново «набивает шишки» на каждой похожей задаче, работает хуже того, что умеет переиспользовать прошлый опыт. Стандартный подход, сжимать опыт в готовые резюме сразу после выполнения задачи, вынуждает выбрасывать информацию до того, как понятно, для чего она пригодится в будущем. JitMem показывает, что перенос этого решения на момент, когда задача уже известна, даёт заметный прирост качества без принципиально новой архитектуры агента.

Кому это важно

Прежде всего это интересно разработчикам агентных систем на базе LLM и исследователям, работающим над памятью и переиспользованием опыта в таких системах, например, для агентов, выполняющих последовательности бытовых или торговых задач, диалоговых агентов с долгой историей взаимодействия. Подход также важен тем, кто разрабатывает методы обучения агентов с отложенной обратной связью, поскольку JitMem предлагает способ обучать компонент памяти по немедленному сигналу успеха.

Как это применить

Идея JitMem, хранить сырые траектории прошлых задач без предварительного сжатия, а в момент получения новой задачи «куратор» на основе извлечённых прошлых эпизодов и текущего запроса синтезирует компактный, специально подстроенный под эту задачу набор данных для памяти. Важная деталь: такой подход работает даже с необученным куратором, то есть его можно опробовать как готовую схему поверх существующего агента, а обучение куратора на сигнале немедленного успеха задачи, дополнительная надстройка, усиливающая результат.

Можно ли доверять

Результаты представлены авторами работы и проверены на трёх разных агентных бенчмарках, ALFWorld, WebShop и τ²-bench, что снижает риск случайного успеха на одной узкой задаче. В доступном тексте не указаны авторы, их принадлежность к организациям и дата публикации, поэтому независимую репутационную проверку источника провести нельзя; также не приведены абсолютные показатели успешности JitMem и базовых методов, только разница в процентных пунктах относительно лучшей альтернативы.

Риски и подводные камни

Из текста не видно ни устройства куратора, ни деталей его обучения, сложно оценить вычислительную стоимость и переносимость метода на другие среды за пределами трёх протестированных бенчмарков. Отсутствие абсолютных цифр успешности (есть только относительный прирост в пунктах) затрудняет сравнение с другими опубликованными результатами на тех же бенчмарках. Как и для любой самопубликуемой научной работы, стоит дождаться независимого воспроизведения результатов.

«Это вынуждает систему решать, что стоит запоминать, ещё до того, как станет известен будущий запрос, безвозвратно отбрасывая информацию»

— авторы работы о JitMem