AgentKVShift ускоряет KV-кэш для памяти ИИ-агентов

В системах памяти ИИ-агентов языковая модель поддерживает контекст на протяжении сотен взаимодействий. При каждом извлечении сохранённых единиц памяти, сгенерированных моделью сводок, ключевых слов и тегов, их приходится заново кодировать в состояния Key-Value (KV). По утверждению авторов, этот полный пересчёт доминирует во времени предварительной обработки контекста.

Статья предлагает AgentKVShift, не требующий дообучения метод повторного использования KV-кэша с коррекцией остаточной ошибки по небольшому набору проверочных токенов. Метод работает с каждой извлечённой единицей памяти отдельно. Авторы обнаружили, что ошибка при повторном использовании KV-кэша для такой единицы состоит из общего для памяти смещения и небольших различий между токенами. AgentKVShift оценивает это смещение по пробному набору и одной взвешенной поправкой корректирует все повторно используемые токены.

В отличие от прежних методов, которые пересчитывают только выбранные токены, а оставшуюся часть кэша оставляют без обновления, AgentKVShift корректирует и непересчитанные токены. На двух бенчмарках долговременной памяти агентов, для длительных диалогов и агентных приложений, и на четырёх открытых языковых моделях размером от 3 до 32 млрд параметров авторы сообщают о качестве, близком к полному пересчёту, при обновлении 10, 30% кэша. Для достижения такого режима методу требовалось до пяти раз меньше пересчёта, тогда как прежним подходам нужно было обновлять 45, 55% кэша. На одной NVIDIA A100 это соответствовало ускорению предварительной обработки в 2, 3,5 раза по сравнению с вариантом без повторного использования KV-кэша. Метод также сочетался с квантованием KV-кэша: при агрессивной 2- и 4-битной точности он, по заявлению авторов, сохранял F1 более чем вдвое выше, чем у прежних методов повторного использования.

Ключевые факты

  • AgentKVShift предназначен для систем памяти ИИ-агентов, где извлечённые сводки, ключевые слова и теги обычно приходится полностью заново кодировать в KV-состояния.
  • Метод оценивает общее смещение ошибки для каждой единицы памяти по небольшому набору проверочных токенов и корректирует весь повторно используемый кэш.
  • На четырёх открытых моделях от 3 до 32 млрд параметров и двух бенчмарках авторы получили близкое к полному пересчёту качество при обновлении 10, 30% кэша.
  • Авторы сообщают, что прежним методам для того же режима требовалось обновлять 45, 55% кэша, а AgentKVShift давал ускорение предварительной обработки в 2, 3,5 раза на одной A100.
  • При 2- и 4-битном квантовании KV-кэша метод, по заявлению статьи, сохранял более чем двукратное преимущество по F1 над прежними подходами.

Почему это важно

Долговременная память помогает ИИ-агенту учитывать сотни прошлых взаимодействий, но извлечённые записи памяти приходится заново превращать в KV-состояния. Авторы называют этот этап главным источником задержки при предварительной обработке контекста. AgentKVShift предлагает сократить объём пересчёта, не оставляя большую часть старого кэша без поправки.

Кому это важно

Работа адресована разработчикам систем ИИ-агентов с долговременной памятью, особенно использующим структурированные записи: сводки, ключевые слова и теги. Эксперименты охватывают открытые языковые модели от 3 до 32 млрд параметров, длительные диалоги и агентные приложения.

Как это применить

AgentKVShift не требует дообучения. Для каждой извлечённой единицы памяти нужно обновить небольшой пробный набор токенов, по нему оценить общее смещение ошибки и применить взвешенную коррекцию ко всем повторно используемым токенам. Авторы также указывают, что метод можно сочетать с квантованием KV-кэша.

Можно ли доверять

Это результаты статьи: заявленные показатели получены на двух бенчмарках памяти агентов, четырёх открытых моделях и одной NVIDIA A100. Авторы сравнивали подход с базовыми методами при одинаковой доле пересчёта, но приведённый материал не содержит независимой репликации результатов.

Риски и подводные камни

Заявленное качество и ускорение зависят от конкретного режима: структурированной памяти агентов, доли обновляемого кэша, выбранных моделей и тестов. Цифры 2, 3,5 раза приведены для одной A100 и сравнения с отсутствием повторного использования KV-кэша; их нельзя автоматически переносить на другие аппаратные и прикладные условия.