Meta выпустила Muse Glimmer, открытую модель на 30 млрд параметров для локальных агентов

Meta Superintelligence Labs представила Muse Glimmer, следующую модель линейки Muse, и открыла её веса на Hugging Face по лицензии Apache 2.0. Это модель на 30 млрд параметров, рассчитанная на постоянно включённых локальных агентов: она работает на Mac или PC с одной потребительской видеокартой и охватывает локальных агентов, вызов функций, локальный кодинг и оценку моделью-судьёй (LLM-as-a-judge).
Обучение прошло в три этапа. На пре-тренинге Muse Glimmer обучалась на выходах модели-учителя Muse Spark через дистилляцию логитов, используя похожий на учительский микс данных. На mid-тренинге модель дообучали на более длинном контексте и более насыщенных агентными сценариями данных с развёрнутыми цепочками рассуждений вперемешку с органическими данными. На пост-тренинге объединили supervised fine-tuning (SFT) с on-policy дистилляцией и обучением с подкреплением по общим, рассуждательным, кодинговым и агентным доменам. Перед открытым релизом модель оценили по стандартам Advanced AI Scaling Framework, методики Meta для оценки моделей перед публикацией весов.
По заявлению Meta, Muse Glimmer обучена и проверена по нескольким агентным способностям: сквозное выполнение задач (бенчмарки DeepSearch QA, MCP-Atlas, τ-Bench, SWE-Bench), надёжный вызов инструментов с точными схемами, многошаговое рассуждение на длинных горизонтах, восстановление после сбоя вызова инструмента (диагностика ошибки и повтор вместо остановки), приём текста и изображений через отдельный кодировщик восприятия (скриншоты, графики, документы), совместимость с оркестрационными схемами вроде OpenClaw, регулируемый уровень усилий (баланс качества и скорости) и мультиязычность, данные для обучения охватывают более 100 языков. В сравнении с Gemma4-31B и Qwen3.6-27B, по словам Meta, Muse Glimmer показывает сильные результаты для своего размерного класса на нескольких широко используемых бенчмарках LLM; точных числовых оценок в материале не приведено.
Основная работа была проделана над оптимизацией под локальный запуск. При полной точности модель на 30 млрд параметров потребовала бы свыше 55 ГБ памяти, больше, чем даёт любой потребительский GPU. Meta квантовала веса примерно до 4 бит, сократив размер языковой модели до менее 20 ГБ, это оставляет запас памяти для KV-кэша, кодировщика восприятия и модели-черновика для ускоренной генерации, чтобы всё вместе уместилось в 24 или 32 ГБ видеопамяти. Компания утверждает, что такое сжатие почти не ухудшает результаты на агентных задачах. Для ускорения генерации Muse Glimmer поставляется с лёгкой моделью-черновиком на основе DFlash: она сразу предлагает блоки токенов, а основная модель параллельно проверяет их, принимая верные и исправляя неверные. По заявлению Meta, это заметно ускоряет генерацию текста без потери качества по сравнению со стандартной генерацией токен за токеном; для экономии памяти доступны и квантованные версии черновика. Скорость квантованной версии K-Quant-17GB вместе с квантованным черновиком DFlash измеряли на MacBook M4-Max, M5-Max и RTX-5090, Meta говорит, что модель достаточно быстра для живого диалога и работы агента в реальном времени полностью на устройстве, но точных цифр скорости в материале нет.
Веса Muse Glimmer уже доступны на Hugging Face. В ближайшие дни должны выйти оптимизированные интеграции для llama.cpp, MLX и ExecuTorch. В ближайшие дни локально модель можно будет запускать через Ollama, LM Studio и Unsloth, разворачивать через edge-фреймворки llama.cpp, ExecuTorch и MLX, обслуживать в масштабе через vLLM и SGLang либо быстро подключить через Together AI, Fireworks AI и OpenRouter. Дообучить модель под свою задачу можно через функцию TorchTitan в PyTorch. Meta также работает с AMD, Arm, Dell, Intel и NVIDIA над оптимизацией производительности на разных устройствах и публикует документацию для разработчиков, включая настройку собственных оркестрационных каркасов (scaffolds) для агентов.
Ключевые факты
- Muse Glimmer, модель на 30 млрд параметров с открытыми весами по лицензии Apache 2.0, выложена на Hugging Face.
- Веса квантованы примерно до 4 бит: языковая модель занимает менее 20 ГБ и вместе с KV-кэшем, кодировщиком восприятия и моделью-черновиком укладывается в 24 или 32 ГБ видеопамяти.
- Для ускорения генерации используется спекулятивное декодирование с лёгкой моделью-черновиком на основе DFlash.
- Обучение прошло в три этапа: дистилляция логитов от модели-учителя Muse Spark, дообучение на длинных агентных данных, затем SFT и обучение с подкреплением по агентным и кодинговым доменам.
- По заявлению Meta, в своём размерном классе модель показывает сильные результаты на ряде бенчмарков в сравнении с Gemma4-31B и Qwen3.6-27B; точных цифр компания не привела.
Почему это важно
Открытый релиз модели, рассчитанной именно на локальный запуск на потребительском железе, один GPU, 24, 32 ГБ памяти, это ответ на спрос на ИИ-агентов, которые работают без постоянного подключения к сети и без отправки личных данных пользователя в облако. Meta делает ставку на то, что компактная модель при правильном обучении (дистилляция от крупного учителя, квантование, спекулятивное декодирование) подходит по качеству к куда более крупным моделям на прицельных агентных задачах.
Кому это важно
Разработчикам локальных агентов и инструментов на function calling, компаниям и энтузиастам, которым нужен ИИ-агент без постоянного облачного доступа или с требованиями к приватности данных, владельцам потребительских GPU и Mac с 24, 32 ГБ памяти, а также тем, кто интегрирует модели через llama.cpp, MLX, ExecuTorch, vLLM, SGLang, Ollama, LM Studio, Unsloth или через API-платформы Together AI, Fireworks AI и OpenRouter.
Как это применить
Веса Muse Glimmer уже можно скачать на Hugging Face. В ближайшие дни выйдут оптимизированные интеграции для llama.cpp, MLX и ExecuTorch, локально модель заработает через Ollama, LM Studio и Unsloth, для развёртывания в масштабе, через vLLM и SGLang, для быстрого старта, через API Together AI, Fireworks AI и OpenRouter. Дообучить модель под свою задачу можно через функцию TorchTitan в PyTorch. Для запуска на потребительском железе достаточно GPU с 24 или 32 ГБ видеопамяти, квантованная примерно до 4 бит версия языковой модели занимает менее 20 ГБ, оставляя место под KV-кэш, кодировщик восприятия для изображений и модель-черновик для ускоренной генерации.
Можно ли доверять
Все заявления о результатах исходят от самой Meta, независимой проверки в материале нет. Компания говорит о «сильных результатах» на бенчмарках DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench и о хороших показателях по сравнению с Gemma4-31B и Qwen3.6-27B в своём размерном классе, но точных числовых оценок не приводит. Скорость на MacBook M4-Max, M5-Max и RTX-5090 названа «достаточной для живого диалога и работы в реальном времени», но без цифр в токенах в секунду. Конкретные авторы или исследователи по именам в материале не указаны, релиз подписан от лица Meta Superintelligence Labs.
Риски и подводные камни
В материале нет ни точных числовых результатов бенчмарков, ни цифр скорости генерации, заявления о «сильной производительности» и «беглости» нельзя проверить по самому анонсу. Сроки выхода обещанных интеграций для llama.cpp, MLX и ExecuTorch названы только как «в ближайшие дни», без конкретной даты. Стоимость использования или развёртывания модели в материале не указана.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.