DeepGrove выпустила Maple-Preview: тернарную reasoning-модель на 20 млрд параметров
Лаборатория DeepGrove представила Maple-Preview, открытую reasoning-модель на 20 млрд параметров с тернарными весами (каждый вес принимает одно из значений -1, 0 или 1), из которых активны около 1 млрд за один проход (обозначение 20B-A1B, архитектура mixture-of-experts). Модель построена как 24 слоя со смесью из 256 экспертов, из которых на каждом шаге работают 8, окно контекста, 131 072 токена. Благодаря тернарным весам чекпоинт занимает всего 5,31 ГБ. Модель распространяется по лицензии MIT, доступны квантованные версии для llama.cpp, LM Studio, Jan и Ollama; попробовать модель можно в веб-чате на сайте DeepGrove.
По собственным данным DeepGrove с карточки модели на Hugging Face, Maple-Preview показывает «SOTA reasoning для своего веса» и конкурентоспособна с более крупными моделями, решает задачи уровня Международной олимпиады по математике (IMO) и работает со скоростью 200+ токенов/с (в спецификации указано точное значение 218 токенов/с) на Mac mini M4, это в 5, 16 раз быстрее, чем у сравнимых по эффективности моделей Gemma 4, Qwen3.5 и gpt-oss в том же тесте на том же устройстве. DeepGrove подчёркивает, что, в отличие от типичного подхода, сжимать уже обученную модель до низкой битности, Maple-Preview с самого начала обучалась в тернарном формате.
Заголовок публикации на Hacker News («Show HN: Maple-Preview, тернарная MoE на 20B работает со скоростью 120 токенов/с на iPhone») заявляет тест на iPhone, но ни карточка модели на Hugging Face, ни какой-либо другой доступный источник такого измерения не содержат: единственная задокументированная скорость, 218 токенов/с на Mac mini M4. Сама статья на сайте deepgrove.ai/maple-preview, на которую ссылается пост, отдаёт ошибку HTTP 404, а архивная копия недоступна. Один из комментаторов на Hacker News прямо указал на это несоответствие, пошутив «в мышах»: по его словам, речь на самом деле о Mac Mini M4, а не об iPhone.
Реакция сообщества на Hacker News разделилась. Часть комментаторов отметила впечатляющее соотношение скорости и качества для модели такого размера и назвала происходящее приметой того, что локальный ИИ становится доступнее на слабом железе. Другие указали на типичную для маленьких и сильно квантованных моделей склонность уверенно выдавать неверные факты: один из пользователей проверил модель на вопросе с историческим уклоном и получил уверенный, но полностью ошибочный ответ, тогда как более крупная Qwen 3.6 35B-A3B справилась корректно. Сравнительную таблицу бенчмарков (против Qwen 3.5 35B-A3B и Bonsai 27B) в карточке модели можно увидеть только как картинку, а не как текст, поэтому конкретные цифры сравнения нельзя независимо проверить, числа, которые комментаторы пытались считать с изображения, остаются их собственной расшифровкой, а не подтверждённым фактом источника. Отдельно комментаторы обратили внимание, что несколько первых откликов на пост оставили аккаунты с 0-1 кармы, что показалось им подозрительным.
DeepGrove сама предупреждает об ограничениях: у превью-версии минимум пост-обучения для агентных задач и лишь небольшое обучение с подкреплением общего назначения, поэтому на агентных бенчмарках модель может показывать результаты хуже. Компания говорит, что продолжит обучение перед полноценным релизом модели под названием Maple.
Ключевые факты
- DeepGrove выпустила Maple-Preview, открытую reasoning-модель с тернарными весами (-1/0/1), 20 млрд параметров всего и около 1 млрд активных за проход (MoE, 24 слоя, 256 экспертов, 8 активны), окно контекста 131 072 токена, чекпоинт 5,31 ГБ, лицензия MIT.
- По данным DeepGrove модель показывает SOTA reasoning для своего веса, решает задачи уровня IMO и работает со скоростью 218 токенов/с на Mac mini M4, в 5, 16 раз быстрее Gemma 4, Qwen3.5 и gpt-oss в этом же тесте.
- Заголовок публикации на Hacker News заявляет скорость 120 токенов/с на iPhone, но ни карточка модели, ни какой-либо другой источник такого теста не подтверждают, задокументирован только Mac mini M4; комментатор HN прямо указал на подмену устройства.
- Часть сообщества на Hacker News впечатлена скоростью и качеством для размера модели, другая часть отмечает склонность к уверенным галлюцинациям и невозможность проверить таблицу сравнения с Qwen3.5 35B-A3B и Bonsai 27B, она доступна только как картинка.
- DeepGrove предупреждает: превью получило минимум пост-обучения под агентные задачи и лишь небольшое RL, поэтому возможна просадка на агентных бенчмарках; полноценный релиз модели Maple ещё впереди.
Почему это важно
Maple-Preview, пример модели, обученной в низкой битности (тернарные веса) с нуля, а не сжатой из уже готовой полноразмерной модели постфактум, именно на этом различии DeepGrove делает акцент. Благодаря такому подходу чекпоинт весит всего 5,31 ГБ при 20 млрд параметров, а инференс на обычном настольном устройстве (Mac mini M4) идёт в разы быстрее сравнимых по классу моделей. Это часть более широкого тренда, переноса ИИ-инференса с облачных серверов на локальные устройства.
Кому это важно
Разработчикам локальных и офлайн-приложений на базе ИИ, которым нужна компактная модель с приемлемым качеством рассуждений без обращения к облаку; энтузиастам, тестирующим модели на собственном железе (Mac mini, ПК с ограниченной памятью); исследователям квантования, которым интересен именно вариант «обучение с нуля в тернарном формате», а не постфактумное сжатие.
Как это применить
Модель распространяется по лицензии MIT, веса доступны на Hugging Face, квантованные сборки, под llama.cpp, LM Studio, Jan и Ollama, что позволяет запускать её без специализированной инфраструктуры. Опробовать модель можно и без установки, через веб-чат на сайте DeepGrove. Цены, условия использования и дата полноценного релиза (модель под названием Maple, о которой DeepGrove говорит как о следующем шаге) в доступных материалах не указаны.
Можно ли доверять
Ключевая часть заголовка публикации, «120 токенов/с на iPhone», не подтверждается ни одним доступным источником. Статья на сайте DeepGrove, на которую ссылается пост, отдаёт ошибку HTTP 404 и не сохранилась в веб-архиве, а собственная карточка модели на Hugging Face указывает скорость только для Mac mini M4 (218 токенов/с). Комментатор Hacker News прямо назвал заявление подменой устройства. Цифры сравнения из таблицы бенчмарков в карточке модели тоже нельзя проверить напрямую, таблица опубликована только как изображение, а не как текст, и конкретные значения, которые обсуждают комментаторы, это их собственное прочтение картинки, а не подтверждённые данные источника.
Риски и подводные камни
Несколько комментаторов Hacker News, протестировавших модель, отмечают её склонность уверенно и убедительно выдавать неверные фактические сведения, типичная проблема маленьких и сильно квантованных моделей, которую сама DeepGrove не отрицает: по словам компании, превью получило лишь минимальное дополнительное обучение под агентные задачи и небольшое обучение с подкреплением, поэтому на агентных бенчмарках возможна просадка результатов. Отдельно вызывает вопросы происхождение части ранних положительных откликов на публикацию, несколько из них оставили аккаунты с нулевой или минимальной кармой.
«В мышах. Я имел в виду Mac Mini M4, а не iPhone.»
— hahahaa, комментатор на Hacker News