AirLLM научилась запускать Kimi K3 (2,8 трлн параметров) на 3,72 ГБ VRAM

AirLLM, открытая Python-библиотека, которая позволяет запускать большие языковые модели на видеокартах, чьей памяти в норме на модель совершенно не хватает. Вместо того чтобы держать в видеопамяти всю модель целиком, AirLLM разбивает её по слоям и подгружает с диска на GPU по одному слою за раз, выполняет вычисления и переходит к следующему; для разреженных MoE-моделей (mixture of experts, моделей, состоящих из отдельных «экспертов») библиотека таким же образом подгружает по одному эксперту, а не весь слой. Поэтому объём нужной VRAM определяется размером одного слоя модели, а не суммарным числом параметров.
Благодаря этому 70-миллиардная модель работает на одной видеокарте с 4 ГБ памяти без квантования, дистилляции или прунинга. Llama 3.1 на 405 млрд параметров умещается в 8 ГБ, DeepSeek-V3 на 671 млрд параметров, примерно в 12 ГБ, а Qwen3-235B, примерно в 3 ГБ. В выпуске 2026/07 AirLLM добавила поддержку модели Kimi K3 на 2,8 трлн параметров, по данным проекта, самой крупной открытой модели на сегодняшний день. Она работает на одной карте RTX 6000 Ada, и измеренный расход видеопамяти end-to-end составил 3,72 ГБ. Для Kimi K3 модель диктует и окружение: обязательна flash attention независимо от настроек пользователя, нужна сборка torch под CUDA 12 (готового пакета flash-attn под CUDA 13 пока нет) и версия transformers 4.56.x, поскольку удалённый код модели не загружается на ветке 5.x.
Отдельно AirLLM поддерживает блочное квантование весов, оно ускоряет инференс до 3 раз почти без потери точности; предзагрузка (prefetching), совмещающая загрузку модели с вычислениями, добавляет ещё около 10% скорости. Библиотека работает через единый интерфейс AutoModel.from_pretrained(...) и из коробки поддерживает большинство популярных открытых семейств: Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3, включая MoE и FP8), DeepSeek (V2/V3/R1), Mistral и Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi, и, как правило, новые модели в день их выхода. Есть поддержка инференса на CPU и запуска на Apple Silicon (MacOS). Автором проекта в его описании указан Gavin Li; значительная часть кода, по признанию авторов, основана на работе разработчика SimJeg из конкурса на Kaggle.
Ключевые факты
- 70-миллиардная модель работает на GPU с 4 ГБ VRAM без квантования, дистилляции и прунинга, за счёт потоковой подгрузки модели по одному слою за раз
- Llama 3.1 (405 млрд параметров) умещается в 8 ГБ, DeepSeek-V3 (671 млрд), примерно в 12 ГБ, Qwen3-235B, примерно в 3 ГБ
- В выпуске 2026/07 добавлена поддержка Kimi K3 (2,8 трлн параметров, по данным проекта, крупнейшей открытой модели на сегодня): она работает на одной RTX 6000 Ada, измеренный расход видеопамяти end-to-end, 3,72 ГБ
- Для Kimi K3 нужны свои условия: обязательная flash attention, сборка torch под CUDA 12 и transformers версии 4.56.x
- Библиотека поддерживает большинство открытых семейств моделей (Llama, Qwen, DeepSeek, Mistral, Phi, Gemma и другие) через единый интерфейс, а также инференс на CPU и Apple Silicon
Почему это важно
AirLLM убирает главный барьер для работы с крупными открытыми моделями, дорогие видеокарты с десятками и сотнями гигабайт памяти. Библиотека держит на GPU только один слой модели (а для MoE-моделей, только тех «экспертов», к которым реально идёт запрос) и подгружает остальное с диска по мере необходимости. Поэтому нужный объём VRAM определяется размером одного слоя, а не суммарным числом параметров: 70-миллиардная модель умещается в 4 ГБ, а модель на 2,8 трлн параметров (Kimi K3), в 3,72 ГБ, измеренных на одной карте RTX 6000 Ada.
Кому это важно
Разработчикам, исследователям и энтузиастам, у которых нет доступа к кластерам из нескольких GPU или дорогим картам с большим объёмом памяти, но которые хотят запускать и тестировать самые крупные открытые модели, Llama, Qwen, DeepSeek, Kimi K3 и другие, на обычном железе, включая ноутбуки на Apple Silicon.
Как это применить
Библиотека ставится командой pip install airllm, после чего модель загружается одной строкой: model = AutoModel.from_pretrained("<repo_id>") с указанием Hugging Face ID или локального пути; дальше инференс делается как с обычной моделью transformers. Есть опция сжатия (compression='4bit' или '8bit') для дополнительного ускорения до 3 раз, предзагрузка (prefetching) для совмещения загрузки и вычислений, а также инференс на CPU или запуск на Apple Silicon для MacOS. Для Kimi K3 отдельно нужно поставить пакеты compressed-tensors и flash-attn, версию torch под CUDA 12 и transformers 4.56.x, более новые версии transformers с этой моделью не работают.
Можно ли доверять
Проект развивается с 2023 года, ведёт подробный список версий и уже последовательно добавлял поддержку Llama, Mixtral, DeepSeek и других крупных семейств моделей. Для Kimi K3 в описании указана конкретная измеренная цифра, 3,72 ГБ видеопамяти end-to-end на одной карте RTX 6000 Ada, а не только оценка. В то же время источник не приводит данные о скорости инференса (токены в секунду) ни для одной конфигурации и не указывает, кто выпустил Kimi K3 и когда, только то, что AirLLM умеет её запускать.
Риски и подводные камни
Экономия видеопамяти достигается за счёт постоянной подгрузки слоёв с диска, поэтому итоговая скорость инференса зависит от скорости диска и в источнике никак не измерена, экономия VRAM не означает такую же скорость, как при полностью загруженной в память модели. Разбиение модели по слоям требует значительного места на диске в кеше Hugging Face. Для Kimi K3 версии зависимостей жёстко зафиксированы: transformers работает только на ветке 4.56.x, а flash-attn под CUDA 13 пока не собран, что усложняет обновление окружения. Часть моделей доступна только по токену Hugging Face (gated-модели).