BeaconKV сжимает KV-кэш рассуждающих моделей до 5,8 раза почти без потери точности

BeaconKV сжимает KV-кэш рассуждающих моделей до 5,8 раза почти без потери точности

Большие рассуждающие модели (LRM) добиваются качественных ответов за счёт длинных цепочек рассуждений (Chain-of-Thought, CoT) перед финальным ответом. У этого есть цена: KV-кэш, кэш пар «ключ-значение», служебная память, которую модель накапливает по ходу генерации, растёт линейно с длиной последовательности. При длинных цепочках рассуждений он создаёт серьёзные ограничения по памяти и часто перестаёт помещаться в память GPU.

Существующие методы сжатия KV-кэша решают эту проблему, ориентируясь на недавние запросы модели: они исходят из того, что эти запросы, надёжный ориентир на то, какие пары кэша будут важны дальше, и на этом основании выбрасывают из кэша более старые пары. Авторы показывают, что при длинных рассуждениях это предположение не работает: на части шагов декодирования модель генерирует то, что они называют «токенами возврата к мысли» (Thought Revisiting Tokens, TRT), эти шаги заново обращаются к далёкому, уже как будто пройденному контексту, например к плану решения задачи, сформулированному в самом начале рассуждения. При этом запросы, соответствующие TRT, группируются в небольшое число похожих кластеров в пространстве эмбеддингов.

На этом наблюдении построен BeaconKV, метод сжатия KV-кэша, не требующий дообучения модели. Вместо того чтобы хранить всю историю запросов, он держит по одному компактному «запросу-маяку» (в оригинале, beacon query) на каждый такой кластер и заранее предсказывает по нему, какие пары кэша модель захочет перечитать позже, включая далёкие, но всё ещё нужные фрагменты.

Метод проверили на четырёх открытых больших рассуждающих моделях и разных бенчмарках на рассуждение. По заявлению авторов, BeaconKV в целом превосходит существующие методы сжатия: он сокращает память под KV-кэш до 5,8 раза и, по сравнению с другими методами сжатия, повышает пропускную способность вывода более чем в 4,3 раза, при этом почти сохраняя точность полного, несжатого кэша.

Ключевые факты

  • У больших рассуждающих моделей (LRM) KV-кэш растёт линейно с длиной цепочки рассуждений и часто превышает память GPU при длинных рассуждениях.
  • Находка авторов: на части шагов декодирования появляются «токены возврата к мысли» (Thought Revisiting Tokens, TRT), они заново обращаются к далёкому контексту, например к плану, сформулированному в начале рассуждения; запросы TRT группируются в небольшое число кластеров в пространстве эмбеддингов.
  • Решение, BeaconKV, метод сжатия KV-кэша без дообучения модели: вместо всей истории запросов хранит по одному компактному «запросу-маяку» на кластер, чтобы заранее знать, какие пары кэша понадобятся снова.
  • На четырёх открытых LRM и разных бенчмарках на рассуждение BeaconKV в целом превосходит существующие методы сжатия: память под кэш сокращается до 5,8 раза, а пропускная способность по сравнению с другими методами сжатия растёт более чем в 4,3 раза, точность при этом почти сохраняется на уровне полного кэша.
  • В источнике не названы ни конкретные модели и бенчмарки, ни институты авторов, ни статус рецензирования, и не сказано, опубликованы ли код или веса самого BeaconKV.

Почему это важно

Качество ответа рассуждающей модели растёт вместе с длиной её цепочки рассуждений, но вместе с ней линейно растёт и KV-кэш, служебная память, в которой модель хранит уже сгенерированные токены. На по-настоящему длинных рассуждениях память GPU часто кончается раньше, чем модель успевает додумать до ответа. Обычные методы сжатия исходят из того, что недавние запросы модели, надёжный ориентир на то, что будет важно дальше, и по этому ориентиру выбрасывают старые пары кэша. Авторы показывают, что на длинных рассуждениях это ломается: модель периодически возвращается к далёким фрагментам, например, к плану, который сама же сформулировала в начале, а обычное сжатие к этому моменту их уже стёрло. BeaconKV предсказывает такие возвраты заранее и не даёт нужным парам кэша исчезнуть, не трогая веса самой модели.

Кому это важно

Тем, кто разворачивает вывод больших рассуждающих моделей на своём железе и упирается в память GPU при длинных цепочках рассуждений, командам, которые обслуживают такие модели в проде, и инженерам, которые строят инфраструктуру вывода. А также исследователям, которые занимаются сжатием KV-кэша и эффективным выводом языковых моделей: BeaconKV даёт конкретную технику и объяснение того, почему методы, полагающиеся на недавние запросы, теряют точность именно на длинных рассуждениях.

Как это применить

BeaconKV не требует дообучения модели, это техника сжатия, которую применяют поверх готовой модели во время вывода. Вместо всей истории запросов она хранит по одному компактному «запросу-маяку» на кластер похожих запросов и по ним заранее решает, какие пары KV-кэша ещё понадобятся, а какие можно выбросить. В экспериментах на четырёх открытых больших рассуждающих моделях и разных бенчмарках на рассуждение это даёт до 5,8 раза меньше памяти под кэш и, по сравнению с другими методами сжатия, более чем в 4,3 раза более высокую пропускную способность вывода, почти без потери точности. Источник не говорит, опубликованы ли код или веса самого BeaconKV: открытыми в тексте названы только четыре модели, на которых его проверяли, так что до появления реализации речь идёт скорее об описанном методе, чем о готовом к установке инструменте.

Можно ли доверять

Это препринт на HuggingFace Papers (идентификатор 2609.04971), описание метода и результаты собственных экспериментов авторов, а не независимая проверка или воспроизведение третьей стороной. В тексте не названы ни институты авторов, ни статус рецензирования; первым в карточке указан Чанхён Ким (Janghyeon Kim), остальной авторский состав не перечислен. Конкретные модели (их четыре) и бенчмарки, на которых получены цифры, в тексте по именам не названы, оценить, насколько результат переносится на другие модели и задачи, по одной аннотации нельзя. Заявленные «до 5,8 раза» по памяти и «более чем в 4,3 раза» по скорости относительно других методов сжатия, это верхняя и нижняя границы среди проверенных конфигураций, а не типичный или средний результат.

Риски и подводные камни

Заявленный выигрыш, потолок и нижняя граница, а не типичное значение: на конкретной модели и задаче он может оказаться заметно скромнее. Выгода метода объясняется устройством длинных цепочек рассуждений с «возвратами к мысли», на коротких ответах без такого паттерна прирост, вероятно, не так заметен, но источник это отдельно не разбирает. Ни код, ни веса BeaconKV в тексте не названы открытыми (открыты только четыре модели, на которых его проверяли), так что самостоятельно воспроизвести цифры пока не на чем. Не указаны и конкретные модели с бенчмарками, требования к железу или дополнительные накладные расходы на кластеризацию запросов, сравнить метод с уже знакомыми альтернативами по одной этой публикации не получится.