PrismML выпустила Ternary Bonsai 2 27B: сжатие в 9 раз почти без потерь качества

Стартап PrismML выпустил Ternary Bonsai 2 27B, второе поколение своей линейки сжатых ИИ-моделей, рассчитанных на локальный запуск. Два месяца назад PrismML показала, что 27-миллиардную мультимодальную модель можно сжать настолько, чтобы она эффективно работала на локальных устройствах; новая версия построена на более сильной базовой модели Qwen3.8 27B и добавляет более сильные способности к рассуждению, работе с кодом, зрению и агентным задачам, сохраняя тот же профиль развёртывания.
Модель использует тернарные веса {−1, 0, +1} с групповым масштабированием в формате FP16, в среднем 1,76 эффективного бита на вес, а весь файл модели занимает 5,9 гигабайта. Такое представление применяется сквозным образом по всей языковой модели. Ternary Bonsai 2 27B поддерживает контекстное окно на 262 тысячи токенов, принимает на вход текст и изображения и распространяется под лицензией Apache 2.0.
По сравнению с полноразмерным аналогом модель более чем в 9 раз меньше, но сохраняет 98,2% совокупной производительности по набору бенчмарков на рассуждение, математику, код, следование инструкциям, зрение и агентное использование инструментов, в этом наборе Ternary Bonsai 2 27B набирает 83,9 балла в режиме рассуждений (thinking mode). Для сравнения: у первого поколения, Ternary Bonsai 27B, сохранение качества относительно полноразмерной модели составляло 95%; во втором поколении PrismML этот разрыв практически закрыла и называет результат «почти без потерь».
По заявлению компании, на видеокарте NVIDIA GeForce RTX 5090 модель выдаёт до 143 токенов в секунду, на чипе Apple M5 Max, 46,8 токена в секунду. На RTX 4090 расход энергии составляет 0,714 мВт·ч на токен, что на 40% эффективнее полноразмерной модели с 8 миллиардами параметров. Модель работает на видеокартах NVIDIA через CUDA и на устройствах Apple, Mac, iPhone, iPad, через MLX, с помощью собственных низкобитных вычислительных ядер PrismML.
PrismML выросла из команды исследователей Caltech и была основана при поддержке Khosla Ventures, Cerberus и Google; дальнейшую поддержку компании оказывает Samsung. Все приведённые показатели, из собственных измерений и отчётности PrismML; независимая проверка в исходном материале не упоминается.
Ключевые факты
- PrismML выпустила Ternary Bonsai 2 27B, вторую версию сжатой 27-миллиардной модели на базе Qwen3.8 27B
- Модель использует тернарные веса (1,76 эффективного бита на вес), весит 5,9 ГБ, более чем в 9 раз меньше полноразмерного аналога и сохраняет 98,2% его качества (83,9 балла по бенчмаркам)
- Поддерживает контекст на 262 тысячи токенов, ввод текста и изображений, распространяется под лицензией Apache 2.0
- Скорость, до 143 токенов/с на RTX 5090 и 46,8 токена/с на Apple M5 Max; на RTX 4090 энергопотребление 0,714 мВт·ч на токен, на 40% эффективнее 8-миллиардной модели в полной точности
- У первого поколения сохранение качества было 95%, теперь, свыше 98%; PrismML основана командой из Caltech при поддержке Khosla Ventures, Cerberus, Google и Samsung
Почему это важно
PrismML выпустила Ternary Bonsai 2 27B, второе поколение своих сжатых моделей, и оно резко сокращает разрыв с полноразмерными версиями. Веса модели представлены в тернарном виде {−1, 0, +1} с масштабированием FP16 по группам, в среднем 1,76 эффективного бита на вес, а весь файл модели занимает 5,9 гигабайта. По сравнению с полноразмерным аналогом на базе Qwen3.8 27B модель более чем в 9 раз меньше, но сохраняет 98,2% совокупной производительности по бенчмаркам. У первого поколения, Ternary Bonsai 27B, этот показатель был 95%; во втором поколении PrismML называет результат «практически без потерь». Компания считает, что такой уровень сжатия делает низкобитные модели одним из лучших способов развёртывания ИИ вообще, не только на локальных устройствах, но и в дата-центрах, где та же экономия памяти позволяет обслуживать больше пользователей на том же оборудовании.
Кому это важно
Разработчикам, которые строят локальные ИИ-продукты с жёсткими ограничениями по памяти, задержке или энергопотреблению: агентам для кодинга с циклом правка-отладка, мультимодальным агентам, работающим со скриншотами и документами, системам приватного анализа документов и гибридным схемам, где часть задач обрабатывается локально, а часть эскалируется в облако. Также это важно всем, кто планирует развёртывание на потребительском железе или edge-устройствах (устройствах на краю сети): модель поддерживает мультимодальный ввод текста и изображений и контекстное окно на 262 тысячи токенов.
Как это применить
Веса Ternary Bonsai 2 27B доступны уже сейчас под лицензией Apache 2.0. Модель работает на видеокартах NVIDIA через CUDA и на устройствах Apple (Mac, iPhone, iPad) через MLX, в обоих случаях с помощью собственных низкобитных вычислительных ядер PrismML. По заявленным цифрам, на NVIDIA GeForce RTX 5090 модель выдаёт до 143 токенов в секунду, на Apple M5 Max, 46,8 токена в секунду; на RTX 4090 расход энергии составляет 0,714 мВт·ч на токен, что на 40% эффективнее полноразмерной модели с 8 миллиардами параметров. PrismML также работает с командами точечно, дообучает Bonsai под конкретные задачи и оптимизирует инференс под целевое железо; связаться с компанией предлагается через контактный адрес на её сайте.
Можно ли доверять
Все цифры, 98,2% сохранённого качества, оценка 83,9 балла по набору бенчмарков на рассуждение, математику, код, следование инструкциям, зрение и агентные задачи, показатели скорости и энергопотребления, получены из собственных измерений PrismML, а не из независимой проверки; сравнение с «другими низкобитными альтернативами» приводится без указания конкретных моделей. При этом за PrismML стоит команда исследователей из Caltech, а среди инвесторов и партнёров компании названы Khosla Ventures, Cerberus, Google и Samsung. Полная методология сравнения вынесена в отдельный технический отчёт (whitepaper), который не входит в исходный материал.
Риски и подводные камни
Источник не называет точную дату релиза, только то, что предыдущее поколение вышло «два месяца назад»; не даёт архитектурных подробностей базовой модели Qwen3.8 27B за пределами названия и не раскрывает условия коммерческого использования или доступа по API, сказано лишь, что веса модели открыты. Заявленное сохранение 98,2% качества и показатели энергоэффективности нельзя проверить независимо по этому тексту: все цифры, из собственной отчётности PrismML.
«Это ещё раз подтверждает: низкобитные модели могут быть лучшим способом развёртывания ИИ.»
— PrismML