Kimi Linear впервые обогнала полное внимание на всех задачах
Группа исследователей опубликовала на arXiv препринт о новой архитектуре внимания, Kimi Linear. Это гибридная архитектура линейного внимания, которая при честном сравнении впервые превосходит классическое полное внимание сразу в нескольких сценариях: на коротком контексте, на длинном контексте и в режимах масштабирования при обучении с подкреплением (RL).
В основе архитектуры лежит модуль Kimi Delta Attention (KDA), развитие модели Gated DeltaNet с более тонким механизмом гейтинга (управления потоком информации), который позволяет эффективнее использовать ограниченную память рекуррентной сети с конечным числом состояний. Авторы разработали собственный блочный (chunkwise) алгоритм на основе специального варианта матриц перехода типа Diagonal-Plus-Low-Rank (диагональ плюс низкий ранг, DPLR): он заметно снижает объём вычислений по сравнению с общей формулировкой DPLR и при этом остаётся ближе к классическому дельта-правилу (delta rule).
На основе KDA исследователи предобучили модель Kimi Linear с 3 млрд активных параметров и 48 млрд параметров всего (архитектура типа mixture-of-experts, где на каждый токен работает лишь часть параметров), послойно чередуя KDA с многоголовым латентным вниманием (Multi-Head Latent Attention, MLA). При одинаковом рецепте обучения Kimi Linear обошла модель на чистом MLA с заметным отрывом по всем протестированным задачам: расход KV-кэша сократился на величину до 75%, а скорость декодирования на контексте в 1 млн токенов выросла вплоть до 6 раз. По утверждению авторов, это делает Kimi Linear прямой заменой (drop-in replacement) архитектур полного внимания, с более высоким качеством и эффективностью, включая задачи с длинными входами и выходами.
Для дальнейших исследований авторы открыли исходный код ядра KDA и его реализацию для vLLM, а также выложили в открытый доступ веса предобученной и дообученной под инструкции версий модели. Статья впервые опубликована на arXiv 30 октября 2025 года и обновлена 1 ноября 2025 года; на Hacker News публикация набрала 295 баллов и 125 комментариев.
Ключевые факты
- Kimi Linear, первая архитектура линейного внимания, которая в честном сравнении обходит полное внимание сразу на коротком контексте, длинном контексте и при обучении с подкреплением
- Ядро архитектуры, модуль Kimi Delta Attention (KDA), развитие Gated DeltaNet с более тонким гейтингом и собственным блочным (chunkwise) алгоритмом на матрицах DPLR
- Модель на 3 млрд активных и 48 млрд общих параметров (гибрид KDA и MLA) при одинаковом обучении обошла аналог на чистом MLA по всем протестированным задачам
- Расход KV-кэша сократился на величину до 75%, скорость декодирования на контексте в 1 млн токенов выросла вплоть до 6 раз
- Код ядра KDA, реализация для vLLM и веса предобученной и инструктивной моделей опубликованы в открытом доступе
Почему это важно
Стандартное полное внимание в трансформерах требует вычислений и памяти, растущих квадратично с длиной контекста, это делает работу с длинными последовательностями дорогой. Линейное внимание давно предлагалось как более дешёвая альтернатива, но обычно проигрывало полному вниманию в качестве. Kimi Linear заявлена как первая архитектура, которая совмещает эффективность линейного внимания с превосходством над полным вниманием сразу в нескольких режимах, на коротком контексте, на длинном контексте и при обучении с подкреплением, то есть претендует на снятие компромисса «дешевле, но хуже».
Кому это важно
Инженерам, которые обслуживают модели с длинным контекстом (в статье, до 1 млн токенов) и упираются в стоимость KV-кэша и скорость декодирования. Исследователям, работающим над эффективными механизмами внимания и рекуррентными архитектурами с конечной памятью. Командам, которые проводят обучение с подкреплением в больших масштабах, где эффективность инференса напрямую влияет на стоимость цикла обучения.
Как это применить
Авторы открыли исходный код ядра Kimi Delta Attention и его реализацию для vLLM, популярного движка инференса, а также выложили веса предобученной и дообученной под инструкции версий модели Kimi Linear. Это позволяет протестировать архитектуру без обучения с нуля и, по описанию авторов, встроить её как прямую замену (drop-in replacement) слоёв полного внимания в существующий стек.
Можно ли доверять
Материал, препринт на arXiv, то есть независимого рецензирования журналом или конференцией пока не проходил. Все цифры (сравнение с полным вниманием и с моделью на чистом MLA, снижение KV-кэша, ускорение декодирования), собственные измерения авторов, полученные, по их описанию, при одинаковом рецепте обучения для сравниваемых моделей. В пользу проверяемости, открытые код и веса, что позволяет независимо воспроизвести результаты; за первые часы публикация уже набрала 295 баллов и 125 комментариев на Hacker News, то есть попала под внимание сообщества.
Риски и подводные камни
Заявленное превосходство «с заметным отрывом» пока не подтверждено независимыми замерами за пределами статьи. В тексте не раскрыты вычислительные затраты на предобучение самой модели и не показано, как архитектура ведёт себя при масштабировании за пределы протестированных 48 млрд параметров. Гибридная схема, чередующая KDA и MLA, добавляет инженерную сложность по сравнению с обычным трансформером, переход на неё, даже с готовым кодом, требует интеграционной работы, а не простой замены одной строки.