Macaron-V1: архитектура ИИ-агентов, которые дообучаются после запуска
Отчёт описывает Macaron-V1, семейство агентных моделей для «интеллекта, основанного на опыте»: система учится на опыте в реальных средах и продолжает обучение уже после развёртывания. Архитектура построена вокруг двух целей, адаптации и совместной работы нескольких специализаций внутри одной модели.
Адаптация реализована через рекурсивное самоулучшение версионированных пар «модель плюс среда исполнения» (harness): опыт, накопленный одной версией связки, оценивается по внешнему версионируемому контракту (HCP) и используется для построения следующей версии-преемника.
Совместная работа специализаций реализована через архитектуру Mixture-of-LoRA (MoL): базовая модель замораживается, поверх неё собираются специализированные LoRA-адаптеры, и на каждый ход пользователя система выбирает ровно один подходящий адаптер, вместо того чтобы держать несколько отдельных моделей или переобучать всю сеть целиком.
Представлены два варианта. Флагманский Macaron-V1-Venti сочетает базовую модель GLM-5.2 на 744 млрд параметров с четырьмя LoRA-адаптерами, для чата, работы агентом, кодинга и генеративного интерфейса (GenUI). Облегчённый Macaron-V1-Tall на базе Qwen3.6 (50 млрд параметров) использует ту же архитектуру, но рассчитан на локальный запуск.
В отчёт также входит описание вспомогательных компонентов: алгоритмическая часть, совместное проектирование модели и среды исполнения (Model-Harness Co-design) с циклом рекурсивного самоулучшения, компонентно-ориентированная GenUI-оболочка UI4A, стейтфул-подложка для действий агента и агентный RL-фреймворк MindForge; инфраструктурная часть, платформа пост-обучения MinT, метод RL для длинного контекста LongStraw и техники стабилизации для разреженных MoE- и DSA-базовых моделей.
Авторы оценивали Macaron-V1 на бенчмарках Personal Intelligence, GenUI и общих бенчмарках способностей в сравнении с передовыми базовыми моделями. По их словам, результаты подтверждают работоспособность текущей системы, а вопрос о том, накапливается ли выигрыш от непрерывного обучения и коллективного интеллекта со временем, остаётся открытым. Конкретных цифр по бенчмаркам в доступном тексте отчёта не приведено.
Ключевые факты
- Macaron-V1 сочетает рекурсивное самоулучшение версионированных пар «модель + среда исполнения» с архитектурой Mixture-of-LoRA, вместо переобучения всей модели обновляется набор LoRA-адаптеров поверх замороженной базы
- Флагман Macaron-V1-Venti: база GLM-5.2 на 744 млрд параметров плюс четыре LoRA-адаптера (чат, агент, кодинг, GenUI)
- Облегчённая версия Macaron-V1-Tall на базе Qwen3.6 (50 млрд параметров), та же архитектура для локального запуска
- В систему входят собственные компоненты: агентный RL-фреймворк MindForge, платформа пост-обучения MinT, метод RL для длинного контекста LongStraw, GenUI-оболочка UI4A
- Модель протестирована против передовых базовых моделей на бенчмарках Personal Intelligence, GenUI и общих способностей, но конкретные цифры результатов в тексте отчёта не приведены
Почему это важно
Macaron-V1 предлагает архитектурный ответ на задачу непрерывного обучения агентов уже после развёртывания: вместо переобучения всей модели система обновляет только набор LoRA-адаптеров поверх замороженной базы, а версии связки «модель плюс среда исполнения» улучшаются рекурсивно, опыт одной версии оценивается по внешнему контракту и используется для построения следующей. Это путь к агентам, которых дешевле адаптировать под новые задачи и обновлять без переобучения десятков-сотен миллиардов параметров.
Кому это важно
Инженерам и исследователям, которые строят агентные системы на больших языковых моделях и упираются в проблему обучения после развёртывания; командам, работающим над инфраструктурой пост-обучения, RL-фреймворками, длинным контекстом, стабилизацией MoE; тем, кто проектирует агентов с несколькими специализациями (диалог, кодинг, генеративный интерфейс) внутри одной системы вместо набора отдельных моделей.
Как это применить
В доступном тексте отчёта не указано, открыты ли веса моделей, код или под какой лицензией распространяется система, напрямую воспользоваться Macaron-V1 сейчас нельзя. Но описание архитектуры, Mixture-of-LoRA поверх замороженной базы, версионируемый HCP-контракт, RL-фреймворк MindForge, может служить чертежом для тех, кто проектирует собственную агентную систему с непрерывным обучением.
Можно ли доверять
Текст отчёта прочитан полностью, но сам он не называет авторов или организацию-разработчика, метка «Mind Lab» встречается только в метаданных страницы, а не в тексте статьи, поэтому авторство нельзя подтвердить напрямую источником. Отчёт заявляет об оценке против передовых базовых моделей на нескольких бенчмарках, но конкретных цифр результатов в доступном тексте нет, проверить масштаб заявленного превосходства по самому отчёту невозможно.
Риски и подводные камни
Сами авторы отмечают, что вопрос о накопительном эффекте непрерывного обучения и коллективного интеллекта со временем остаётся открытым, то есть выигрыш от архитектуры на длинной дистанции не доказан. Отсутствие конкретных цифр бенчмарков в тексте не позволяет независимо оценить заявленное превосходство над базовыми моделями. Многокомпонентная архитектура, несколько LoRA-адаптеров, отдельный RL-фреймворк, своя инфраструктура пост-обучения, повышает инженерную сложность при попытке воспроизвести систему.