HeteroFold передаёт KV-кэш между разными семействами нейросетей без повторной обработки контекста

HeteroFold передаёт KV-кэш между разными семействами нейросетей без повторной обработки контекста

В многоагентных системах на основе больших языковых моделей всё чаще совмещают разные модели под специализированные роли агентов. Обычно агенты обмениваются текстом, и это означает, что каждый получатель должен заново обработать (выполнить prefill, то есть предзаполнение) общий контекст, который отправитель уже обработал. Повторного расчёта можно избежать, если передавать KV-кэш (ключи и значения внимания) отправителя. Но между семействами моделей это непросто: нужно учесть различия в токенизации, глубине моделей и представлении KV.

Авторы работы предлагают метод HeteroFold: это перенос KV-кэша между семействами моделей без предзаполнения на стороне получателя, причём и отправитель, и получатель остаются замороженными (их веса не меняются). Метод действует в три шага: выравнивает структуры моделей, отображает кэш отправителя в пространство получателя и калибрует его так, чтобы сохранить поведение получателя.

Результаты, по заявлению авторов: по шести направлениям переноса HeteroFold показывает лучшее качество переноса кэша на всех четырёх бенчмарках с длинным контекстом и в большинстве настроек с коротким контекстом. На мультиагентном бенчмарке метод сопоставим по качеству с текстовым обменом (но не превосходит его). По скорости: при контексте 32K перенос Llama-3.1-8B → Ministral-3-14B в 10,7 раза быстрее обычного предзаполнения (Native Prefill) и в 1,18, 1,47 раза быстрее лучших существующих методов без предзаполнения, Dense Latent и KV Ridge. Авторы делают вывод, что HeteroFold обеспечивает эффективное повторное использование KV-кэша между семействами без предзаполнения у получателя.

Ключевые факты

  • HeteroFold переносит KV-кэш отправителя в модель-получатель из другого семейства; обе модели остаются замороженными, получателю не нужно заново обрабатывать контекст.
  • Метод работает в три шага: выравнивает структуры моделей, отображает кэш в пространство получателя и калибрует его, чтобы сохранить поведение получателя.
  • По шести направлениям переноса метод лучший среди способов переноса кэша на всех четырёх бенчмарках с длинным контекстом и в большинстве коротких настроек.
  • На мультиагентном бенчмарке HeteroFold соответствует текстовому обмену между агентами.
  • При 32K контекста перенос Llama-3.1-8B → Ministral-3-14B в 10,7 раза быстрее Native Prefill и в 1,18, 1,47 раза быстрее Dense Latent и KV Ridge.

Почему это важно

Когда в одной системе работают агенты на разных моделях, текстовая передача контекста заставляет каждого получателя заново пересчитывать то, что отправитель уже обработал. Авторы показывают, что этот расчёт можно пропустить, даже если модели принадлежат разным семействам и различаются токенизацией, глубиной и представлением KV. Заявленный выигрыш: при 32K контекста перенос Llama-3.1-8B → Ministral-3-14B в 10,7 раза быстрее обычного предзаполнения.

Кому это важно

Прежде всего тем, кто строит многоагентные системы из моделей разных семейств под разные роли, и исследователям, работающим над эффективным выводом и обменом состояниями между моделями. Для остальных это скорее ориентир направления, чем готовый инструмент.

Как это применить

Из описания практических шагов не видно: данных о том, опубликованы ли код или веса, в источнике нет. Идея для проектирования, вместо передачи текста между агентами разных семейств передавать преобразованный KV-кэш, при этом обе модели можно не дообучать. Цифры скорости приведены для одного направления (Llama-3.1-8B → Ministral-3-14B) при контексте 32K, переносить их на другие пары и длины без проверки нельзя.

Можно ли доверять

Это аннотация научной работы: все утверждения принадлежат самим авторам. Названы базовые методы сравнения (Native Prefill, Dense Latent, KV Ridge), но сами бенчмарки, остальные пять направлений переноса и абсолютные значения задержки или точности в тексте не приведены, приведены только отношения скорости при 32K. Независимой проверки результатов нет.

Риски и подводные камни

На мультиагентном бенчмарке HeteroFold лишь соответствует текстовому обмену, а не превосходит его; лучшим он назван в «большинстве», а не во всех коротких настройках. Ускорение в 10,7 и 1,18, 1,47 раза относится только к одному направлению при 32K. О затратах на сам метод, например на калибровку, в аннотации ничего не сказано.