Kimi K3: открытая MoE-модель с 1 млн токенов контекста и 2,8 трлн параметров

Kimi K3: открытая MoE-модель с 1 млн токенов контекста и 2,8 трлн параметров

Команда Kimi представила и выложила в открытый доступ полные веса модели Kimi K3, Mixture-of-Experts (MoE) модель на 2,8 триллиона параметров, из которых на каждый токен активируется 104 миллиарда. У модели встроенная поддержка зрения (native vision) и окно контекста в 1 миллион токенов.

В основе архитектуры, Kimi Delta Attention и Attention Residuals: механизмы, которые, по описанию авторов, улучшают прохождение информации как по длине последовательности, так и по глубине модели. Вместе с новой схемой маршрутизации экспертов Stable LatentMoE, которая на каждый токен активирует 16 из 896 доступных экспертов, и обновлёнными рецептами обучения и данных это дало примерно 2,5-кратный прирост общей эффективности масштабирования по сравнению с предыдущей моделью Kimi K2.

На этапе постобучения применялось обучение с подкреплением по общим, агентным и кодовым задачам с несколькими уровнями «усилия рассуждения» (reasoning effort), это, по словам авторов, дало модели композиционное обобщение и устойчивое выполнение задач с длинным горизонтом. Для тренировки модели такого масштаба команда описывает ряд инфраструктурных решений: совместный дизайн алгоритма и системы под Kimi Delta Attention, сбалансированное экспертно-параллельное обучение с эффективным управлением памятью, агентное обучение с подкреплением на контексте до миллиона токенов с сохранением состояния роллаутов и песочниц, а также отдельные оптимизации для развёртывания модели в проде.

По результатам собственных тестов авторов, Kimi K3 показывает результат уровня frontier-моделей в задачах на кодинг с длинным горизонтом, агентных задачах, знаниях, рассуждении и работе с изображениями. При этом в тексте прямо признаётся: по общей производительности модель всё ещё уступает самым мощным проприетарным моделям, Claude Fable 5 и GPT-5.6 Sol. Однако среди всех остальных открытых и проприетарных моделей, участвовавших в их наборе тестов, Kimi K3 стабильно оказывается впереди. Команда опубликовала полные веса модели, чтобы облегчить дальнейшие исследования и ускорить внедрение открытых frontier-моделей.

Ключевые факты

  • Kimi K3, MoE-модель на 2,8 трлн параметров, из которых 104 млрд активируются на каждый токен; контекст, 1 млн токенов, есть встроенное зрение
  • Новая архитектура (Kimi Delta Attention, Attention Residuals, Stable LatentMoE с маршрутизацией 16 из 896 экспертов) дала примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2
  • Постобучение через RL по общим, агентным и кодовым задачам с несколькими уровнями глубины рассуждения, упор на выполнение длинных агентных сценариев
  • По собственным тестам команды модель уступает только Claude Fable 5 и GPT-5.6 Sol, но опережает все остальные открытые и проприетарные модели из сравнения
  • Команда выложила полные веса модели в открытый доступ

Почему это важно

Kimi K3, один из крупнейших открытых релизов на сегодня: 2,8 трлн параметров, 1 млн токенов контекста, встроенное зрение и полные веса в открытом доступе. Это заявка на то, чтобы открытые модели вплотную подошли к уровню лучших закрытых систем, а не просто догоняли их с большим отставанием.

Кому это важно

Исследователям и командам, которым нужна мощная модель без привязки к закрытому API, для дообучения, локального развёртывания или изучения архитектуры MoE. Разработчикам агентных систем, где важны длинный контекст и устойчивость на многошаговых задачах. Также это ориентир для остальных открытых моделей: Kimi K3 заявлена как превосходящая их все в тестах авторов.

Как это применить

Полные веса модели выложены в открытый доступ, что позволяет скачивать, изучать и дообучать модель самостоятельно. В тексте не указаны условия лицензирования, цены или ограничения на использование, эти детали не раскрыты в исходном материале.

Можно ли доверять

Все цифры, из собственного технического отчёта команды Kimi, независимой проверки в источнике нет. При этом авторы сами честно указывают на слабое место: модель уступает Claude Fable 5 и GPT-5.6 Sol, это снижает риск маркетингового приукрашивания, но методология сравнения (какие бенчмарки, как считались) в доступном тексте не раскрыта.

Риски и подводные камни

Заявленные результаты основаны на внутренних тестах разработчиков, что типично для подобных релизов и требует независимой проверки. Модель такого масштаба (2,8 трлн параметров) требует значительных вычислительных ресурсов для развёртывания, что может ограничить практическое применение вне крупных лабораторий и компаний. По собственному признанию авторов, модель всё ещё не достигает уровня лучших проприетарных систем.