Qwen3.6-35B-A3B: поздние слои MoE-архитектуры выдерживают агрессивное отключение экспертов

Исследователи провели систематический анализ чувствительности слоёв модели Qwen3.6-35B-A3B (архитектура Mixture-of-Experts, MoE) к отключению отдельных экспертов. Модель содержит 40 MoE-слоёв по 256 экспертов в каждом, базовая маршрутизация, top-8 (на каждый токен активируются 8 из 256 экспертов слоя). Эксперты отключались по величине весов (magnitude-based masking): маскировались эксперты с наименьшей величиной весов. Качество проверялось на бенчмарке кросс-языкового перевода кода XLCoST, эксперимент прошёл в несколько этапов, на выборках 100, 300 и 500 промптов, вычисления выполнялись на трёх серверах с GPU H100.

Центральный вывод работы: чувствительность слоёв к отключению экспертов сильно зависит от их глубины в сети. Ранние слои (0-9) и средние слои (10-29) хрупкие, маскирование в них быстро портит качество. Поздние слои (30-39), и особенно самые поздние (35-39), напротив, выдерживают агрессивное маскирование экспертов с низкой величиной весов без сильной потери качества.

Разница в цифрах заметна. Сплошное маскирование 30% экспертов по всем слоям на выборке из 300 промптов сохраняет только 150 из 300 ответов, оценённых как «хорошие» или «похожие» на эталон (категория Good+Similar). Политики, нацеленные на поздние слои, при этом сохраняют 249-255 из 300 таких ответов, отключая от 640 до 1145 экспертов. На отдельной, более поздней проверочной выборке из 500 промптов лучший баланс качества и числа отключённых экспертов показала узкая политика «слои 35-39, маскирование 50%»: она сохранила 419 из 500 хороших/похожих ответов, отключив всего 640 экспертов из 10 240 во всей модели.

Отдельно авторы протестировали снижение ширины маршрутизации top-k с 8 до 6 активных экспертов на токен: на пробе из 100 промптов это дало заметное ускорение по времени выполнения без потери качества (Good+Similar), но метод пока не сочетается чисто с агрессивным маскированием экспертов, совмещать оба приёма одновременно не получается.

Авторы называют результаты эмпирической основой для глубинно-зависимого (depth-aware) маскирования экспертов MoE и практическим шагом к трём будущим направлениям: физическому «хирургическому» удалению весов, оценке экспертов по активациям и восстановлению качества через дообучение.

Ключевые факты

  • Модель Qwen3.6-35B-A3B: 40 MoE-слоёв, по 256 экспертов на слой, базовая маршрутизация top-8; проверка, на бенчмарке перевода кода XLCoST, три этапа (100, 300, 500 промптов) на трёх серверах с GPU H100
  • Главный вывод: чувствительность слоёв к отключению экспертов зависит от глубины, ранние (0-9) и средние (10-29) слои хрупкие, поздние (30-39), особенно самые поздние (35-39), выдерживают агрессивное маскирование
  • Сплошное маскирование 30% экспертов по всем слоям сохраняет лишь 150 из 300 хороших/похожих ответов; политики, нацеленные на поздние слои, сохраняют 249-255 из 300, отключая 640-1145 экспертов
  • На проверочной выборке из 500 промптов лучший баланс дала узкая политика «слои 35-39, маскирование 50%»: 419 из 500 хороших/похожих ответов при отключении всего 640 из 10 240 экспертов модели
  • Снижение ширины маршрутизации top-k с 8 до 6 экспертов на токен ускоряет выполнение без потери качества на пробе из 100 промптов, но пока не сочетается чисто с агрессивным маскированием экспертов

Почему это важно

MoE-архитектуры позволяют масштабировать языковые модели при разреженной активации, но насколько вклад отдельных слоёв в качество ответов неравномерен, было изучено слабо, особенно применительно к сжатию моделей. Работа впервые системно показывает, что чувствительность экспертов к отключению зависит от глубины слоя, а не одинакова по всей сети: это меняет подход к прунингу MoE, вместо равномерного отключения экспертов по всем слоям эффективнее целенаправленно урезать поздние слои.

Кому это важно

Инженерам, которые сжимают и оптимизируют большие MoE-модели (такие как Qwen) для инференса на ограниченном железе; исследователям в области прунинга и квантования LLM; командам, эксплуатирующим модели с MoE-архитектурой и ищущим способ снизить вычислительные затраты без переобучения модели.

Как это применить

Практический рецепт из статьи, маскировать эксперты по величине весов избирательно в поздних слоях, а не равномерно по всей модели. Узкая политика «слои 35-39, маскирование 50%» отключает всего 640 из 10 240 экспертов модели Qwen3.6-35B-A3B и сохраняет 419 из 500 хороших/похожих ответов на бенчмарке XLCoST, заметно лучше, чем сплошное 30%-е маскирование по всем слоям (150 из 300). Отдельно проверено снижение ширины маршрутизации top-k с 8 до 6 активных экспертов на токен: на пробе из 100 промптов это дало заметное ускорение по времени без потери качества, но пока не сочетается чисто с агрессивным маскированием экспертов.

Можно ли доверять

Методика прозрачная: эксперимент прошёл в несколько этапов (100, 300 и 500 промптов) на трёх серверах с GPU H100, а лучшая политика отдельно провалидирована на более поздней выборке из 500 промптов. При этом в доступном тексте статьи не указаны имена авторов и организация, а величина ускорения от снижения ширины маршрутизации не приведена численно, сказано лишь, что оно «большое».

Риски и подводные камни

Результаты получены на одной конкретной модели (Qwen3.6-35B-A3B) и одном бенчмарке (перевод кода XLCoST), перенос выводов на другие MoE-архитектуры или задачи не гарантирован. Авторы прямо отмечают, что снижение ширины маршрутизации (top-k с 8 до 6) пока не сочетается чисто с агрессивным маскированием экспертов, совмещать оба приёма одновременно не готово. Статья описывает только эмпирическую диагностику и намечает будущие направления (физическое удаление весов, оценка экспертов по активациям, восстановление через дообучение), сами эти методы ещё не реализованы и не проверены.