Meta выпустила Muse Code, ИИ-агента на базе Muse Spark 1.2

Meta выпустила бета-версию Muse Code, терминального ИИ-агента для сложных задач разработки в больших репозиториях: он планирует изменения, пишет код и проверяет результат. Вместе с ним вышла модель Muse Spark 1.2, на которой Muse Code работает. Компания называет релиз ранним шагом к переднему краю технологий и обещает более крупные и мощные модели в будущем. Агент умеет координировать несколько постоянных субагентов на одну задачу, по словам авторов, это позволяет решать сложные проблемы быстрее, точнее и с меньшим вмешательством человека. Muse Code устанавливается на macOS и Linux.
Отдельная особенность архитектуры, асинхронные фоновые агенты: специализированные помощники, которые не создаются заново под каждую задачу, а остаются активными на протяжении всего сеанса, что избавляет от повторного сбора одной и той же информации. Они сами выполняют очередные шаги и решают, когда сообщить о результатах основному агенту; благодаря этой устойчивости снижаются задержки и необходимость постоянно направлять агента вручную на сложных многошаговых задачах.
Среда выполнения Muse Code построена вокруг локального журнала событий, куда добавляется запись о каждом вызове модели, запуске инструмента, подтверждении и правке кода. Этот единый источник истины делает работу воспроизводимой и устойчивой к сбоям: после сбоя агент возобновляет работу ровно с той точки, где остановился. Поэтому он способен браться за длительные задачи, не теряя прогресс из-за случайных сбоев. По умолчанию Muse Code поставляется с несколькими встроенными командами-навыками: /plan превращает задачу в план, который нужно подтвердить, прежде чем агент начнёт работу; /grill проверяет этот план на прочность, пока он не станет надёжным; /goal доводит агента до успешного завершения указанной цели.
Сама модель Muse Spark 1.2, это обновление Muse Spark 1.1 с упором на код: улучшения касаются генерации кода, сложной отладки, понимания кодовой базы и сквозных процессов разработки. Meta существенно увеличила вычислительные ресурсы, направленные на обучение кодовым задачам, и расширила разнообразие обучающих сред, при этом модель сохранила прежнюю силу и в других направлениях, например, в задачах общего назначения для агентов. Muse Spark 1.2 обучали в паре с Muse Code, чтобы модель показывала максимум производительности и удобства именно в этой связке: в обучение вошли траектории работы агента, отобранные методом rejection sampling, доработка рецептов для целей, сжатия контекста и субагентов, а также встраивание набора инструментов Muse Code в обучение, ради совместимости с его агентским каркасом.
Muse Spark 1.2 также прицельно обучали на «длинных» задачах: генерация кода для целого репозитория, крупные сквозные проекты, автоматизированные исследования. Для этого используются планирование, чтобы выстраивать порядок работ, удержание цели, чтобы не терять направление, и сжатие контекста, чтобы сохранять сведения, нужные для дальнейшего прогресса. Отдельный приём, самообучение: модель Muse Spark 1.1 сама генерировала сложные учебные кодовые среды и шаблоны с инструкциями, а затем оценивала предложенные решения по тому, насколько точно они этим инструкциям соответствуют, так получился масштабируемый обучающий набор данных для Muse Spark 1.2. По словам Meta, этот цикл самообучения помог Muse Spark 1.2 точнее, чем Muse Spark 1.1, следовать сложным инструкциям.
В отдельном практическом примере Meta проверила, как агент справляется с итеративной оптимизацией GPU-ядер: тест занимал более 1000 вызовов инструментов, а сессии растягивались вплоть до 24 часов. Внутри агентской среды Muse Code модель сама пишет код ядра, компилирует его, профилирует и постепенно улучшает производительность относительно заданной базовой реализации. Тестировали на ядрах с именами KDA и MLA для GPU NVIDIA Hopper (расшифровка этих сокращений в посте не приводится); по данным Meta, агент продолжает добиваться существенного прироста производительности над базовой реализацией, но конкретных цифр или процентов прироста в тексте нет. За базовую реализацию KDA взяли версию на Triton из библиотеки FLA; моделям запрещалось напрямую импортировать сторонние библиотеки вроде FLA, вместо этого нужно было реализовать алгоритм в Triton самостоятельно, опираясь на собственные знания по оптимизации ядер, а не оборачивать готовый чужой код. Решение Muse Spark 1.2 объединило ядро подготовки, распараллеленное по чанкам, с последовательным сканированием между чанками, сочетая стандартные приёмы слияния и тайлинга с оптимизациями, специфичными для KDA, например, сдвигом gated cumulative decay к середине чанка.
Muse Spark 1.2 уже доступна и внутри Muse Code, и напрямую через Meta Model API, где Meta сообщает о расширенном глобальном доступе, не уточняя, для каких регионов и с какой даты. Компания говорит, что дальше будет больше: новые функции агентского каркаса и более мощные модели, а за подробностями замеров качества отсылает к отдельному отчёту, которого сам этот текст не содержит.
Ключевые факты
- Meta выпустила бета-версию Muse Code, терминального ИИ-агента для разработки в больших репозиториях, вместе с новой моделью Muse Spark 1.2, обученной работать с ним в паре.
- Muse Code координирует несколько постоянных субагентов на задачу и держит специализированные фоновые агенты активными весь сеанс, а не создаёт их заново под каждую задачу, это снижает задержки и необходимость ручного управления.
- Среда выполнения ведёт локальный журнал каждого вызова модели, запуска инструмента, подтверждения и правки кода, работа становится воспроизводимой и устойчивой к сбоям: после сбоя агент продолжает ровно с той точки, где остановился.
- В практическом тесте на оптимизацию GPU-ядер агент работал до суток (до 24 часов, свыше 1000 вызовов инструментов), не имея права напрямую импортировать сторонние библиотеки вроде FLA, и добился существенного прироста производительности над базовой реализацией, точных цифр Meta не приводит.
- Muse Spark 1.2 уже доступна в Muse Code и в Meta Model API с расширенным глобальным доступом; компания обещает новые функции агентского каркаса и более мощные модели впереди.
Почему это важно
Meta с самого начала связала модель и инструмент в одну систему: Muse Spark 1.2 обучали не отдельно, а вместе с самим Muse Code, включая то, как агент работает с целями, сжатием контекста и субагентами, чтобы модель и агент были настроены друг под друга. Сама компания называет этот релиз ранним шагом к переднему краю технологий: более крупные и мощные модели впереди. В источнике выделены два архитектурных решения, фоновые агенты, которые не создаются заново под каждую задачу, а живут весь сеанс, и полный журнал событий, который позволяет продолжить сеанс ровно с той точки, где его прервал сбой. Оба решения, по описанию Meta, нацелены на проблему задержек и постоянного ручного управления, которая возникает, когда агент берётся не за один запрос, а за длинную многошаговую работу по всему репозиторию.
Кому это важно
Разработчикам и инженерным командам, которые работают с большими многофайловыми кодовыми базами и хотят, чтобы агент планировал, писал и проверял изменения с меньшим ручным контролем, особенно на длинных задачах вроде генерации кода для целого репозитория или крупных сквозных проектов. Практический пример с оптимизацией ядер указывает и на более узкую аудиторию, инженеров, которые оптимизируют низкоуровневый GPU-код: тест целенаправленно проводился на ядрах KDA и MLA для GPU NVIDIA Hopper. Тем, кто уже пользуется Meta Model API, модель Muse Spark 1.2 доступна напрямую там же, с доступом, который Meta называет расширенным глобально.
Как это применить
Muse Code устанавливается на macOS или Linux и работает как терминальное приложение. Несколько встроенных команд задают базовый сценарий работы: /plan превращает задачу в план, который нужно подтвердить, прежде чем агент начнёт действовать; /grill проверяет этот план на прочность до того, как в коде что-то поменяется; /goal доводит агента до завершения указанной цели целиком. Саму модель Muse Spark 1.2 можно получить и напрямую, через Meta Model API, доступ к которому Meta называет расширенным глобально, хотя не уточняет, какие именно регионы его получили и когда.
Можно ли доверять
Это полностью собственный рассказ Meta, опубликованный на её исследовательском блоге, без внешнего бенчмарка или независимой проверки. Единственный подробный практический пример (агент до суток оптимизирует GPU-ядра за 1000+ вызовов инструментов) сообщает, что Muse Spark 1.2 продолжает добиваться существенного улучшения над фиксированной базовой реализацией, но не называет ни процента, ни другой цифры, которая показала бы масштаб этого улучшения. Заявленный прогресс по сравнению с Muse Spark 1.1, лучшая генерация кода, отладка, понимание кодовой базы, описан только качественно, а обещанные цифры вынесены в отдельный отчёт по замерам качества, которого в самом тексте нет. Ни один конкретный исследователь или инженер по имени не назван, весь текст ведётся от неперсонифицированного «мы».
Риски и подводные камни
Многие детали, которые позволили бы проверить заявления самостоятельно, в посте не раскрыты: какие именно регионы получили расширенный доступ к Meta Model API, насколько велик прирост производительности от оптимизации ядер в абсолютных цифрах и что означают сокращения FLA, KDA и MLA, всё это остаётся за кадром. Meta также не называет ни цену, ни системные требования, ни размер дистрибутива для Muse Code. При этом функции, которые должны снижать потребность в контроле человека, постоянные фоновые агенты и планы с подтверждением, по описанию всё равно проводят каждый план через шаг одобрения человеком: агент нигде не описан как работающий полностью без присмотра.
«Это наш следующий шаг к переднему краю технологий, впереди более крупные и значительно более мощные модели.»
— Meta, в анонсе Muse Code
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.