FlashPrefill V2 ускоряет обработку длинного контекста LLM до 47 раз

Квадратичная сложность механизма внимания остаётся главным узким местом при обработке длинного контекста в больших языковых моделях, особенно на вычислительно тяжёлом этапе prefill (обработка входного промпта перед генерацией ответа). Более ранняя работа тех же авторов, FlashPrefill, снижала эту стоимость за счёт мгновенного обнаружения паттернов разреженности и динамического порога на основе максимума, но оставалась алгоритмическим прототипом, далёким от промышленного применения. FlashPrefill V2 развивает прототип в трёх направлениях. Во-первых, добавлена коррекция среднего значения (mean correction term), которая подавляет ошибку аппроксимации и сдерживает деградацию качества даже при экстремальной степени разреженности. Во-вторых, переработан сам оператор разреженного внимания: доступ к памяти по схеме PackGQA, варп-специализация и pingpong-конвейеризация, что полностью согласует его с последними реализациями FlashAttention-3/4 и добавляет поддержку инференса в FP8 для соответствия практическим требованиям квантования. В-третьих, FlashPrefill V2 нативно поддерживает постраничный KV-кэш и непрерывное батчирование запросов, что позволяет встроить его как backend внимания в современные инференс-фреймворки вроде SGLang. Замеры на GPU NVIDIA H20, по словам авторов, одном из самых массово используемых ускорителей для инференса, показывают, что при длине контекста 128К токенов FlashPrefill V2 даёт ускорение до 47,26 раза в FP8 и до 27,19 раза в BF16 относительно FlashAttention-2, а в FP8 сохраняет ускорение в 30,49 раза даже против плотного (без разреженности) базового варианта, согласованного с FlashAttention-3/4.
Ключевые факты
- FlashPrefill V2, развитие более раннего прототипа FlashPrefill: тот же принцип блочно-разреженного внимания для prefill-этапа, но доведённый до практического использования
- Коррекция среднего значения (mean correction term) подавляет ошибку аппроксимации и сдерживает потерю качества даже при экстремальной разреженности
- Оператор внимания переработан под PackGQA, варп-специализацию и pingpong-конвейеризацию, согласован с FlashAttention-3/4 и поддерживает инференс в FP8
- Нативная поддержка постраничного KV-кэша и непрерывного батчирования позволяет использовать FlashPrefill V2 как backend внимания во фреймворках вроде SGLang
- На GPU NVIDIA H20 при контексте 128К токенов ускорение достигает 47,26x (FP8) и 27,19x (BF16) против FlashAttention-2, и 30,49x против плотного FA3/4-совместимого базового варианта в FP8
Почему это важно
Обработка длинного контекста упирается в квадратичную сложность внимания, и особенно дорого это на этапе prefill, когда модель проходит весь входной промпт перед первым сгенерированным токеном. Прежний прототип FlashPrefill показывал сам принцип решения, но не годился для промышленного развёртывания. FlashPrefill V2 закрывает именно этот разрыв: та же идея разреженного внимания, но переработанная под реальные требования инференс-серверов, точность при высокой разреженности, совместимость с новейшими реализациями FlashAttention и поддержку низкоточных форматов вроде FP8.
Кому это важно
В первую очередь, инженерам, которые обслуживают LLM с длинным контекстом на GPU-кластерах, и разработчикам инференс-фреймворков наподобие SGLang, куда FlashPrefill V2 можно встроить как backend внимания. Полезно и командам, считающим стоимость инференса на распространённых ускорителях вроде NVIDIA H20: ускорение prefill-этапа напрямую снижает время ответа и расход вычислений на длинных промптах.
Как это применить
FlashPrefill V2 задуман как готовый компонент инференс-стека, а не только исследовательский прототип: нативная поддержка постраничного KV-кэша и непрерывного батчирования означает совместимость со стандартными паттернами обслуживания LLM-запросов, а согласованность с FlashAttention-3/4 и поддержка FP8, что его можно подключить к уже существующим современным пайплайнам инференса без переработки архитектуры под старые форматы внимания.
Можно ли доверять
Источник, карточка препринта на Hugging Face Papers, то есть авторское описание собственной работы; в самом тексте аннотации не названы ни авторы, ни организации, стоящие за исследованием. Все приведённые цифры ускорения, результаты замеров, поставленных самими авторами на GPU NVIDIA H20; независимого воспроизведения или стороннего бенчмарка в тексте нет.
Риски и подводные камни
Все цифры, self-reported: авторы сравнивают собственный метод с FlashAttention-2 и с собственным же плотным FA3/4-совместимым базовым вариантом, а не с независимыми замерами. В тексте нет данных об ускорении на других длинах контекста или других GPU, кроме H20 при 128К токенов, и ничего не сказано о том, будет ли опубликован код или веса, так что оценить воспроизводимость и применимость результатов за пределами описанного сценария по этому тексту нельзя.