DeepSeek выпустила V4.1 Flash: сжатие KV-кэша в 4 раза
Независимый блогер разобрал технический отчёт DeepSeek о модели DeepSeek-V4.1 Flash, мультимодальной модели типа MoE (смесь экспертов) на 552 млрд параметров с поддержкой контекста до 1 млн токенов. По словам автора разбора, поначалу он принял релиз за небольшое дообучение прежней версии, но скорость генерации около 420 токенов/с и последующее сообщение, по словам некоего Цуя, все модели DeepSeek-V4 Pro будут сняты с обслуживания, заставили присмотреться внимательнее. После чтения полного технического отчёта автор пришёл к выводу, что по масштабу изменений модель тянет на DeepSeek-V5 Flash, а не на минорное обновление.
Задача архитектуры, довести сжатие KV-кэша (кэша ключей и значений внимания) до предела. Агентные сценарии с длинным контекстом и частыми вызовами инструментов создают тяжёлую вычислительную нагрузку на этапе предзаполнения (prefill) и раздувают объём KV-кэша в памяти ускорителя и на SSD, что ограничивает пропускную способность сервиса и повышает его стоимость. Модель использует архитектуру Causal Encoder-Decoder (причинный энкодер-декодер, CED): всего в ней 40 слоёв, но глобальный KV декодера получается проекцией финальных скрытых состояний энкодера, поэтому большей части длинного промпта достаточно пройти только первые 20 слоёв. В результате на этапе предзаполнения активируется 8 млрд параметров на токен, а на этапе декодирования, 16 млрд.
Сжатие KV-кэша (механизм CSA2) идёт сразу по трём измерениям. По каналам: 512-мерный латентный вектор делит представление ключей и значений между всеми головами внимания. По последовательности: энкодер объединяет каждые 2 соседние позиции в одну запись кэша, тогда как декодер хранит запись на каждую позицию отдельно. По слоям: несколько слоёв используют один и тот же глобальный KV, и на всю сеть остаётся всего 3 копии кэша энкодера и 1 копия кэша декодера. Само внимание построено на скользящем окне шириной 128 позиций в сочетании с глобальным разреженным поиском и переиспользованием KV между слоями. Вместе с квантованием кэша в формат FP4 это даёт рост объёма хранения около 890 байт на токен.
По данным отчёта, при одинаковой длине последовательности DeepSeek-V4.1 Flash требует для рабочего KV-кэша примерно в 4 раза меньше памяти, а для сохраняемого (persistent) кэша, примерно в 8 раз меньше, чем предыдущая DeepSeek-V4 Flash, при этом итоговое качество модели заявлено выше, чем у предшественницы. В целом, по формулировке отчёта, KV-кэш сжат в 4 раза без потери качества выполнения задач.
Модель также нативно поддерживает мультимодальный ввод: визуальный энкодер (ViT) с размером патча 14 пикселей обрабатывает изображение, соседние признаки затем объединяются с коэффициентом 3, а итоговое число визуальных токенов на одно изображение ограничено бюджетом в 1024 токена. Заявленное в отчёте разрешение до примерно 1344×1344 пикселей определяется именно этим бюджетом токенов, а не физическим лимитом энкодера.
Автор подчёркивает, что разобранный материал, первая часть серии разборов по главам технического отчёта. Сам отчёт не приводит бенчмарков или оценок качества, которые подтверждали бы заявление о сохранении качества при таком сжатии, и не сравнивает модель с решениями других компаний.
Ключевые факты
- DeepSeek выпустила V4.1 Flash, мультимодальную модель на 552 млрд параметров с контекстом до 1 млн токенов, архитектура заточена под максимальное сжатие KV-кэша
- Архитектура Causal Encoder-Decoder (CED): у модели 40 слоёв, но декодер переиспользует общий KV, спроецированный из энкодера, поэтому большей части промпта достаточно первых 20 слоёв; активируется 8 млрд параметров на предзаполнении и 16 млрд на декодировании
- Механизм CSA2 сжимает KV-кэш сразу по трём измерениям, каналам, последовательности и слоям, плюс квантование FP4; рост объёма хранения около 890 байт на токен
- При той же длине последовательности рабочий KV-кэш меньше примерно в 4 раза, а сохраняемый, в 8 раз по сравнению с предыдущей DeepSeek-V4 Flash, при заявленном более высоком качестве модели
- Автор разбора наблюдал скорость около 420 токенов/с и считает, что по масштабу изменений модель заслуживала названия DeepSeek-V5 Flash; независимых бенчмарков, подтверждающих сохранение качества, отчёт не приводит
Почему это важно
Длинный контекст и частые вызовы инструментов в агентных сценариях раздувают объём KV-кэша и создают тяжёлую нагрузку на этапе предзаполнения, это упирается в память ускорителя, ёмкость SSD и пропускную способность межсоединений и ограничивает масштабирование таких сервисов. Архитектура DeepSeek-V4.1 Flash (CED плюс CSA2) отвечает именно на эту проблему, снижая как вычислительную нагрузку на предзаполнение, так и объём кэша, который нужно хранить и перемещать.
Кому это важно
В первую очередь, инженерам, которые разворачивают и обслуживают модели с длинным контекстом для ИИ-агентов, и инфраструктурным командам, у которых хранение и перенос KV-кэша уже стало узким местом по стоимости и пропускной способности. Также полезно исследователям архитектур трансформеров, изучающим рекуррентные и энкодер-декодерные схемы переиспользования KV.
Как это применить
Технический подход можно изучать и частично переносить на собственные системы: разделение модели на энкодер (проходит по промпту один раз, на меньшем числе слоёв) и декодер, переиспользующий сжатый глобальный KV; сжатие кэша сразу по нескольким измерениям, компрессия голов внимания, блочное объединение соседних позиций, разделение KV между слоями; квантование кэша в низкую точность (FP4). Это ориентиры для проектирования собственного long-context serving-стека, а не готовый рецепт без адаптации.
Можно ли доверять
Источник, независимый (не от DeepSeek) разбор технического отчёта компании, первая часть серии; имя и место работы автора блога в тексте не указаны. Приведённые цифры взяты из самого отчёта DeepSeek, а не из независимой проверки: сам отчёт не публикует бенчмарки или оценки качества, которые подтверждали бы, что качество действительно сохраняется при таком уровне сжатия, и не сравнивает модель с решениями других компаний.
Риски и подводные камни
Архитектура оптимизирована конкретно под агентные, input-объёмные сценарии, насколько выигрыш сохраняется на других типах нагрузки, из текста не следует. Упомянутое в тексте сообщение о том, что все модели DeepSeek-V4 Pro будут сняты с обслуживания, приведено только со слов источника без указания его роли и без даты или деталей перехода, что это означает для действующих пользователей V4 Pro, из материала не понятно.
«Только после того как вышел технический отчёт, я понял, что это стоило бы назвать DeepSeek-V5 Flash»
— автор блога, разбирающего технический отчёт DeepSeek