Сжатие KV-кэша по блокам дало «периодические слепые зоны»: точность поиска различается до 40 п.п.

Блочное (chunked) сжатие KV-кэша снижает затраты памяти и внимания при работе с длинным контекстом: окна из подряд идущих токенов сворачиваются в меньшее число записей кэша с фиксированным шагом. Авторы статьи отмечают, что такое сжатие вводит новую позиционную координату, фазу токена, то есть его положение относительно границ окон сжатия.
Главное наблюдение: у моделей с таким сжатием есть систематическая асимметрия. Одну и ту же информацию легко извлечь при одной фазе и трудно при другой. Периодическое изменение качества поиска авторы называют фазовой чувствительностью (phase sensitivity). В больших открытых моделях со сжатием этого типа точность поиска в длинном контексте может различаться между фазами до 40 процентных пунктов. По словам авторов, это «периодические слабые места», которые средние баллы бенчмарков могут скрывать.
Чтобы изучить эффект, авторы с нуля предобучили семейство трансформеров с несколькими вариантами дизайна сжатия KV-кэша и воспроизвели фазовую чувствительность во всех вариантах. Механистический анализ с причинными вмешательствами показал фазовую специализацию: разные компоненты внимания неодинаково вносят вклад в извлечение информации из разных исходных фаз. Кроме того, анализ идеализированных моделей поиска показывает, как динамика градиентного потока может способствовать резкой фазовой специализации.
Вывод авторов: оценивать модели с блочным сжатием KV-кэша нужно с замерами по фазам сжатия, потому что высокая средняя точность может уживаться с систематическими позиционными провалами.
Ключевые факты
- Блочное сжатие KV-кэша сворачивает окна подряд идущих токенов в меньшее число записей с фиксированным шагом и вводит новую координату, фазу токена относительно границ окон.
- Фазовая чувствительность: одна и та же информация извлекается легко при одной фазе и трудно при другой.
- В больших открытых моделях со сжатием точность поиска в длинном контексте различается между фазами до 40 процентных пунктов.
- Эффект воспроизвели в семействе трансформеров, обученных с нуля с несколькими вариантами сжатия; причинные вмешательства показали фазовую специализацию компонентов внимания.
- Авторы предлагают оценивать такие модели по фазам сжатия: средняя точность скрывает систематические позиционные провалы.
Почему это важно
Сжатие KV-кэша, способ удешевить работу с длинным контекстом. Работа показывает, что у него есть скрытая цена: качество поиска информации зависит от положения токена относительно границ окон сжатия, причём разброс может достигать 40 процентных пунктов. Средние оценки бенчмарков этого не показывают.
Кому это важно
Тем, кто разрабатывает и оценивает модели с длинным контекстом и сжатием KV-кэша, а также тем, кто выбирает такие модели для задач поиска фактов в больших документах. Для исследователей интерпретируемости интересен результат о фазовой специализации компонентов внимания.
Как это применить
Практический вывод авторов касается оценки: замерять качество не только в среднем, но и отдельно по фазам сжатия. Исправления или способа смягчения эффекта в описании работы не предложено.
Можно ли доверять
Доступно только краткое описание (аннотация) статьи. В ней не названы конкретные большие открытые модели с разрывом в 40 пунктов, не указаны степень сжатия, шаг, длина контекста и бенчмарки. Цифра 40 п.п., максимум («до»), а не типичное значение. Эффект воспроизведён и в моделях, обученных авторами с нуля, что усиливает вывод, но детали эксперимента по аннотации проверить нельзя.
Риски и подводные камни
Высокая средняя точность может скрывать систематические провалы на отдельных позициях: информация, попавшая в «неудобную» фазу, может не извлекаться. Вывод о том, что динамика градиентного потока может способствовать фазовой специализации, авторы формулируют осторожно (через «может») и опираются на анализ идеализированных моделей.