DwarfStar 4 (ds4) запускает DeepSeek V4 локально: C-движок с 2-битным сжатием

DwarfStar 4, или ds4, это узкоспециализированный движок вывода (инференса) на языке C для машин с большим объёмом памяти: Mac (Metal), а также видеокарт на CUDA и ROCm. Проект распространяется под лицензией MIT. Он поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next, причём как текстовые, так и мультимодальные модели. Всё собрано в один стек: интерфейс командной строки, локальные HTTP-API и собственный агент.

Главная идея, асимметричное 2-битное квантование. Сжимаются «маршрутизируемые» эксперты (routed experts) в моделях со смесью экспертов (MoE), а критические общие участки остаются точными. По словам сайта проекта, именно так поддерживаемые сборки помещаются в целевые машины. Сайт описывает это тремя фазами: DeepSeek V4 Flash, большая MoE-модель, которую обычно запускают удалённо; ds4 исходит из обратного ограничения; асимметричное квантование делает модель практичной на машинах с большой памятью.

Проект сознательно не является универсальным запускальщиком GGUF-файлов. ds4 следует небольшому, выбранному по обстоятельствам набору семейств моделей и проверяет каждую поддерживаемую раскладку целиком, сверяя результат с выводом официальных моделей. Целью служат собственные GGUF проекта, а произвольные GGUF-файлы, нет.

Среди других решений, сохранение длинных префиксов промпта на SSD с возобновлением по хэшу промпта: перезапуск не обязан означать полное повторное предзаполнение (prefill). CLI, HTTP-API и агент используют общее состояние модели и общий кэш. Запускаются они так: ./ds4 для чата./ds4-server для локальных API и ./ds4-agent для постоянных сессий кодинга. Сервер понимает API в стиле OpenAI и Anthropic, поэтому локальные кодинг-агенты подключаются к вашей машине через базовый URL.

По «проверке посадки» (fit check) на 128 ГБ базовым вариантом служит V4 Flash Q2; GLM 5.3 Q2 и Qwen Q4 тоже помещаются, а V4.1 Q2 подгружается с SSD. Для Qwen на сайте указан порог в 64 ГБ. В эталонной строке для M5 Max с 128 ГБ и контекстом 32K приведено 34,4 токена/с генерации и 557 токенов/с предзаполнения. Сайт отмечает, что это эталонные строки из исходной таблицы, и советует оценивать предзаполнение и генерацию отдельно, особенно для агентных задач с длинным контекстом. Порядок установки: скачать GGUF проекта (например./download_model.sh ds4f-q2), собрать под свой бэкенд командой make и запустить CLI или сервер.

Ключевые факты

  • ds4 (DwarfStar 4), узкий движок вывода на C для мощных Mac (Metal), CUDA и ROCm; лицензия MIT.
  • Поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next; в одном стеке CLI, локальные HTTP-API и собственный агент.
  • Асимметричное 2-битное квантование сжимает маршрутизируемых экспертов, а критические общие участки остаются точными.
  • Эталонная строка: M5 Max 128 ГБ, контекст 32K, 34,4 токена/с генерации и 557 токенов/с предзаполнения; на 128 ГБ V4 Flash Q2, базовый вариант.
  • Сервер понимает API в стиле OpenAI и Anthropic; длинные префиксы можно сохранять на SSD и возобновлять по хэшу промпта.

Почему это важно

Крупные MoE-модели вроде DeepSeek V4 Flash обычно обслуживают удалённо. ds4 исходит из противоположного ограничения: запустить такую модель на одной машине с большим объёмом памяти, пожертвовав универсальностью ради узкой, но проверенной поддержки нескольких семейств моделей. Для тех, кому важно держать модель и данные у себя, это практичный путь.

Кому это важно

Владельцам Mac с большим объёмом памяти и машин на CUDA или ROCm, которые хотят гонять большие открытые модели локально. Также тем, кто использует кодинг-агентов и хочет подключить их к собственной машине вместо облачного API.

Как это применить

По описанию на сайте: скачать GGUF проекта (пример команды./download_model.sh ds4f-q2), собрать командой make под свой бэкенд, затем запустить ./ds4 для чата./ds4-server для локальных API или ./ds4-agent для сессий кодинга. Для подключения редактора или агента достаточно указать базовый URL локального сервера, он понимает API в стиле OpenAI и Anthropic. Код распространяется под лицензией MIT. На 128 ГБ в качестве базового варианта сайт называет V4 Flash Q2.

Можно ли доверять

Все сведения взяты с проектного сайта, то есть это самоописание, а не независимая проверка. Цифры скорости, эталонные строки из таблицы проекта (по оценке сайта), а не независимые замеры. Сравнений с llama.cpp и другими движками, а также данных о качестве ответов после 2-битного сжатия на странице нет. Имя автора, дата выпуска и ссылка на репозиторий на странице не указаны.

Риски и подводные камни

Движок не универсален: целевыми служат только собственные GGUF проекта и небольшой набор семейств моделей, произвольные GGUF-файлы не поддерживаются. Нужна машина с большим объёмом памяти; уже на 128 ГБ вариант V4.1 Q2 подгружается с SSD. Сайт советует отдельно смотреть скорость предзаполнения и генерации, особенно для агентных задач с длинным контекстом, одной цифры недостаточно. Как именно определены «критические общие участки» и как сжатие влияет на качество, страница не раскрывает.