Motif 3: представлена MoE-модель на 314 млрд параметров с вниманием GDLA

Motif 3: представлена MoE-модель на 314 млрд параметров с вниманием GDLA

Исследователи представили технический отчёт о Motif 3, декодер-only языковой модели с архитектурой Mixture-of-Experts (MoE). Всего в модели 314 млрд параметров, но на каждый токен активируется только 13,2 млрд: каждый разреженный MoE-слой содержит 384 «маршрутизируемых» эксперта, из которых на каждый токен выбираются восемь. Такая мелкозернистая разреженность даёт большую суммарную ёмкость модели при ограниченном объёме вычислений на шаг.

В основе Motif 3, новый механизм внимания Grouped Differential Latent Attention (GDLA), который совмещает групповое дифференциальное внимание со сжатым представлением ключей и значений из Multi-head Latent Attention (MLA). Дополнительно архитектура использует модифицированные гиперсвязи с ограничением на многообразии (manifold-constrained hyper-connections), активации Expert Specific PolyNorm и предсказание сразу нескольких токенов за шаг (multi-token prediction), это должно повышать стабильность обучения, специализацию экспертов и эффективность вывода.

Модель предобучили примерно на 12,5 трлн токенов: веб-документы, материалы по естественным наукам, код, математика, многоязычные и узкоспециализированные корпуса. Устойчивость обучения на таком масштабе обеспечили техники балансировки нагрузки между экспертами и численной стабилизации, а выборочные вычисления и коммуникация в формате MXFP8, эффективные по памяти слитые (fused) вычислительные ядра и оконно-ориентированный параллелизм по контексту (window-aware context parallelism) позволили обучать модель с длиной контекста до 256 тысяч токенов.

Постобучение включает несколько этапов: общее контролируемое дообучение (SFT), шесть специализированных «учителей», обученных с подкреплением (RL), отдельный «учитель» по инженерии ПО, обученный через SFT, и финальную стадию Multi-teacher On-Policy Distillation, дистилляцию знаний от нескольких учителей одновременно. В результате получилась единая модель, объединяющая рассуждения, программирование, использование инструментов, работу над профессиональными задачами, понимание длинного контекста, калиброванный отказ от ответа при неуверенности и следование инструкциям.

По словам авторов, на широком наборе оценок Motif 3 показывает результаты, сопоставимые с ведущими открытыми моделями, включая сильные результаты в длинных агентных задачах, математических рассуждениях, научных знаниях и оценках на устойчивость к галлюцинациям. При этом в самом отчёте не приведены конкретные числовые результаты бенчмарков, названия моделей-конкурентов из сравнения, а также сведения о дате релиза, лицензии, доступности весов, стоимости или требованиях к оборудованию.

Ключевые факты

  • Motif 3, decoder-only MoE-модель: 314 млрд параметров всего, 13,2 млрд активируются на токен; в каждом слое 384 эксперта, из которых на токен выбираются восемь
  • Новый механизм внимания GDLA сочетает групповое дифференциальное внимание со сжатым представлением ключей-значений из Multi-head Latent Attention (MLA)
  • Модель предобучена на ~12,5 трлн токенов и поддерживает обучение с контекстом до 256 тысяч токенов благодаря вычислениям в MXFP8 и оконному параллелизму по контексту
  • Постобучение объединяет SFT, шесть RL-«учителей»-специалистов, отдельного «учителя» по инженерии ПО и дистилляцию от нескольких учителей сразу (Multi-teacher On-Policy Distillation)
  • Авторы заявляют результаты на уровне ведущих открытых моделей, но конкретные баллы бенчмарков, названия моделей-конкурентов и данные о лицензии/доступности весов в отчёте не приведены

Почему это важно

Motif 3, попытка одновременно продвинуть несколько узких мест в обучении больших MoE-моделей: новый механизм внимания GDLA, сочетающий групповое дифференциальное внимание со сжатым латентным представлением ключей-значений MLA, модифицированные гиперсвязи с ограничением на многообразии, специализированные для экспертов активации PolyNorm и предсказание нескольких токенов за шаг. Каждый из этих элементов по отдельности встречался в других работах; здесь они собраны в одной модели вместе с обучением на длинном контексте (до 256 тысяч токенов) и предобучением на 12,5 трлн токенов, то есть отчёт демонстрирует, что такая комбинация архитектурных приёмов масштабируется и обучается стабильно.

Кому это важно

Инженерам и исследователям, которые проектируют или дообучают крупные MoE-модели: отчёт даёт конкретные архитектурные решения (GDLA, разреженность 384/8, гиперсвязи, PolyNorm, multi-token prediction) и техники обучения на масштабе (балансировка экспертов, MXFP8, слитые ядра, оконный параллелизм по контексту). Также полезно тем, кто строит длинноконтекстные и агентные системы, модель заявлена как ориентированная на длинные агентные задачи и работу с большим контекстом.

Как это применить

В самом техническом отчёте нет ни даты релиза, ни условий лицензии, ни сведений о доступности весов модели, ни цены или требований к оборудованию для инференса, эти детали не раскрыты. Практически применимы описанные технические приёмы (архитектура GDLA, схема разреженности MoE, пайплайн постобучения с несколькими RL-«учителями» и дистилляцией), их можно использовать как ориентир при проектировании собственных моделей, но саму Motif 3 по этому отчёту развернуть или протестировать нельзя.

Можно ли доверять

Источник, технический отчёт самих авторов модели, а не независимый бенчмарк или сторонняя проверка. Утверждение о «результатах на уровне ведущих открытых моделей», это самооценка авторов; в тексте отчёта нет ни конкретных числовых баллов бенчмарков, ни названий моделей, с которыми сравнивали Motif 3, ни сведений об авторской организации или аффилиации. Судить о реальном качестве модели по этому фрагменту текста нельзя, нужны опубликованные таблицы результатов и независимая проверка.

Риски и подводные камни

Главный риск, доверие на слово: заявление о конкурентоспособности с «ведущими открытыми моделями» не подкреплено ни одной цифрой в доступном тексте, а сами модели-конкуренты не названы. Отдельно отмечена оценка на «устойчивость к галлюцинациям» (hallucination-sensitive evaluation), но и здесь конкретных результатов не приведено. Наконец, отсутствие информации о лицензии и доступности весов означает, что пока неясно, станет ли Motif 3 действительно открытой моделью или доступ будет ограничен.