LLaDA MoE v2 приблизилась к Qwen3, обучившись на 65% токенов предобучения

LLaDA MoE v2 приблизилась к Qwen3, обучившись на 65% токенов предобучения

Диффузионные языковые модели (diffusion language models, dLLM), альтернатива авторегрессионным (AR) языковым моделям, но то, как в архитектуре mixture-of-experts (MoE, «смесь экспертов») масштабируются именно диффузионные модели, до этой работы было изучено плохо. Авторы систематически исследовали, как для MoE-диффузионных моделей масштабируются гиперпараметры оптимизации, распределение вычислительного бюджета между данными и моделью и параметры архитектуры, и обнаружили количественные отличия от трендов масштабирования, ранее описанных для авторегрессионных моделей.

По оптимизации: с ростом объёма вычислений оптимальный номинальный размер батча растёт быстрее, а оптимальная скорость обучения (learning rate) снижается быстрее, точных числовых коэффициентов этих трендов авторы не приводят, только их направление. По распределению бюджета между данными и моделью: анализ IsoFLOP (сравнение моделей при одинаковом вычислительном бюджете) показал лёгкий перекос в сторону данных, оптимальный бюджет токенов растёт быстрее, чем оптимальный объём активируемых вычислений модели. По архитектуре MoE: на больших масштабах выгоднее становится увеличивать пул экспертов при фиксированной активируемой ёмкости, умеренная гранулярность экспертов остаётся стабильно эффективной, а предпочтительная доля активируемой ёмкости, отводимая под общие (shared) эксперты, остаётся стабильной на разных масштабах.

Опираясь на эти выводы, авторы с нуля обучили LLaDA MoE v2, диффузионную MoE-модель формата 30B-A3B (около 30 млрд параметров суммарно, из них порядка 3 млрд активны за один проход), на 23,5 трлн токенов. Использовав примерно 65% от числа токенов предобучения Qwen3, LLaDA MoE v2 приблизилась к результатам Qwen3 на нескольких тестах на знания, рассуждения и код, какие именно это бенчмарки, в тексте не указано. После одного лишь дообучения с учителем (supervised fine-tuning, без дополнительных этапов) модель обошла SDAR Chat на семи из восьми тестов на рассуждения и код и осталась близка к результатам Qwen3 по ряду других задач.

Авторы описывают эти результаты как практические законы масштабирования и принципы проектирования для MoE-диффузионных языковых моделей.

Ключевые факты

  • Систематическое исследование законов масштабирования MoE-диффузионных языковых моделей: найдены количественные отличия от трендов, известных для авторегрессионных моделей, по батчу, скорости обучения, балансу данных/вычислений и архитектуре экспертов.
  • По итогам исследования с нуля обучена LLaDA MoE v2, диффузионная MoE-модель формата 30B-A3B (около 30 млрд параметров, из них порядка 3 млрд активных), на 23,5 трлн токенов.
  • Использовав лишь около 65% числа токенов предобучения Qwen3, LLaDA MoE v2 приблизилась к результатам Qwen3 на нескольких тестах на знания, рассуждения и код.
  • После одного лишь дообучения с учителем (SFT) модель обошла SDAR Chat на семи из восьми тестов на рассуждения и код и осталась близка к Qwen3 по ряду других задач.
  • По архитектуре: на больших масштабах выгоднее увеличивать пул экспертов при фиксированной активируемой ёмкости, а доля ёмкости под общие эксперты остаётся стабильной на разных масштабах.

Почему это важно

До этой работы поведение MoE-диффузионных моделей при масштабировании было изучено плохо, стандартные рецепты (расписания батча и скорости обучения, баланс данных и вычислений на модель, размер пула экспертов), выведенные для авторегрессионных моделей, не обязательно переносятся на диффузионные архитектуры без проверки. Авторы систематически проверили это на MoE-диффузионных моделях и нашли количественные отличия от трендов, известных для авторегрессионных моделей, по оптимизации, распределению вычислений и архитектуре. Практическая ценность подтверждена не только на бумаге: обученная по этим принципам LLaDA MoE v2 (30B-A3B, 23,5 трлн токенов) приблизилась к результатам Qwen3, потратив на предобучение заметно меньше токенов (около 65% от объёма Qwen3), то есть найденные принципы масштабирования, судя по всему, дают реальный выигрыш в эффективности обучения, а не только теоретический интерес.

Кому это важно

Прежде всего, исследователям и инженерам, которые обучают диффузионные языковые модели или проектируют MoE-архитектуры: работа даёт конкретные направления (не точные коэффициенты) для расписания батча и скорости обучения, для баланса данных и вычислений на модель, для размера пула экспертов и доли общих экспертов. Также это важно командам, которые ищут более дешёвые по числу токенов альтернативы авторегрессионным моделям уровня Qwen3, LLaDA MoE v2 показывает, что диффузионный MoE-подход способен приближаться к таким моделям при заметно меньшем бюджете предобучения.

Как это применить

Из статьи можно забрать прикладные принципы проектирования: с ростом вычислительного бюджета увеличивать номинальный размер батча быстрее, а скорость обучения снижать быстрее, чем подсказывают рецепты для авторегрессионных моделей; при выборе баланса данные/модель немного смещать бюджет в сторону токенов, а не только в сторону активируемых вычислений; на больших масштабах наращивать пул экспертов, удерживая умеренную гранулярность и стабильную долю ёмкости под общие эксперты. В тексте не указаны ни точные числовые коэффициенты этих трендов, ни конкретные бенчмарки, ни доступность весов, лицензия или сроки релиза самой LLaDA MoE v2.

Можно ли доверять

Это не рекламный анонс, а результат систематического эмпирического исследования: авторы ставят IsoFLOP-эксперименты и доводят выводы до практики, полноценного обучения модели на 23,5 трлн токенов и сравнения с двумя названными ориентирами, Qwen3 и SDAR Chat. Формулировки при этом сдержанные: «приблизилась», «осталась близка», то есть авторы сами не заявляют, что LLaDA MoE v2 превосходит или сравнялась с Qwen3, только что подошла близко на части задач. Ограничение: у нас есть только аннотация статьи, а не полный текст, конкретные бенчмарки, точные числовые коэффициенты трендов и данные об авторах или их аффилиациях в аннотации не приведены, так что часть деталей для независимой проверки взять неоткуда.

Риски и подводные камни

«Приблизилась к Qwen3» и «осталась близка», это не «сравнялась» и не «превзошла»: по знаниям, рассуждениям и коду LLaDA MoE v2, судя по всему, всё ещё уступает Qwen3 на части тестов, а какие именно это бенчмарки, не сказано. Победу над SDAR Chat (семь из восьми тестов) тоже сложно откалибровать, потому что эта модель менее известна как ориентир, чем Qwen3. Числовые тренды по батчу и скорости обучения даны только качественно («растёт быстрее», «снижается быстрее»), без точных коэффициентов, напрямую перенести их в свой процесс обучения не получится. Наконец, у диффузионных языковых моделей другая механика вывода, чем у авторегрессионных, а вопросы скорости вывода, задержки и стоимости обслуживания такой модели в проде статья не затрагивает.