Маршрутизация MoE-моделей оказалась кодированием Хаффмана

Архитектуры Mixture-of-Experts (MoE, «смесь экспертов») стали стандартным способом масштабировать большие языковые модели, но логика, по которой встроенный маршрутизатор выбирает экспертов для конкретного токена, до сих пор оставалась «чёрным ящиком». Авторы статьи утверждают, что обнаружили управляющий принцип: маршрутизация в MoE, это не просто отбор, а по сути реализация кодирования Хаффмана, классического алгоритма сжатия, где часто встречающимся символам присваиваются более короткие коды, а редким, более длинные. Открытие получило название «закон частоты и разнообразия» (Frequency-Diversity Law).

На практике это выглядит так: современные модели, например Phi-3.5-MoE и Gemma-4-27B-A4B, самопроизвольно ведут себя как информационно-теоретические механизмы. Для частых, простых токенов они задействуют минимальный, разреженный набор экспертов, а для редких и сложных задач, в первую очередь тех, что возникают внутри цепочек рассуждений (chain-of-thought), подключают крупные и разнородные по составу «комитеты» экспертов. Чем сложнее и реже задача, тем больше и разнообразнее набор экспертов, который модель на неё выделяет, ровно так же, как в коде Хаффмана длина кода растёт для более редких символов.

Но у модели Qwen3.5-35B-A3B авторы нашли исключение, они называют его «ловушкой избыточности». Когда эффективная разреженность (соотношение числа активных экспертов k к эффективному числу экспертов E_eff) оказывается достаточно низкой, механизм балансировки нагрузки между экспертами непреднамеренно создаёт функциональную избыточность: часть экспертов начинает дублировать друг друга, и это маскирует лежащий в основе сигнал хаффмановской эффективности.

Чтобы устранить эту избыточность, авторы предлагают метод Subset Difference Pruning («прунинг по разности подмножеств»), точечную процедуру, которая находит и удаляет функциональных дублей среди экспертов. Эксперименты показывают, что такое прореживание не ухудшает качество рассуждений модели, напротив, оно высвобождает скрытую хаффмановскую эффективность и заставляет логику маршрутизации схлопнуться в более компактные, плотные пути.

Вывод авторов: следующее поколение MoE-архитектур должно отойти от принудительной балансировки нагрузки в пользу оптимальности по принципу минимальной длины описания (Minimum Description Length, MDL), присваивать более короткие маршрутные коды часто встречающейся информации и более длинные, разнообразные коды, редкой. Тогда маршрутизация перестанет быть просто эвристикой и станет осознанным механизмом сжатия информации.

Ключевые факты

  • Маршрутизация в MoE-моделях (проверено на Phi-3.5-MoE и Gemma-4-27B-A4B) спонтанно повторяет принцип кодирования Хаффмана, авторы назвали это «законом частоты и разнообразия» (Frequency-Diversity Law).
  • Частым и простым токенам модели выделяют минимальный, разреженный набор экспертов; редким и сложным задачам в цепочках рассуждений, крупные и разнородные «комитеты» экспертов.
  • У Qwen3.5-35B-A3B при низкой эффективной разреженности (k/E_eff) обнаружена «ловушка избыточности»: балансировка нагрузки создаёт функционально избыточных, дублирующих друг друга экспертов.
  • Метод Subset Difference Pruning точечно удаляет функциональных дублей среди экспертов, не снижая качество рассуждений модели, маршрутизация становится компактнее и плотнее.
  • Авторы призывают перейти от принудительной балансировки нагрузки к оптимальности по принципу минимальной длины описания (MDL), где длина маршрутного кода эксперта зависит от частоты информации.

Почему это важно

До этой работы маршрутизация в MoE считалась во многом чёрным ящиком: было непонятно, какая логика стоит за выбором экспертов для конкретного токена. Авторы показывают, что за этим выбором стоит не случайность и не голая эвристика, а закономерность из теории информации, сходная с классическим кодированием Хаффмана: модели выгодно тратить меньше вычислительных ресурсов на частое и простое и больше, на редкое и сложное. Это переводит устройство MoE-моделей из области чисто инженерных практик в область принципов теории информации и открывает путь к более осознанному, а не чисто эмпирическому, проектированию будущих архитектур.

Кому это важно

В первую очередь, разработчикам и исследователям, которые проектируют и обучают MoE-модели (в статье в качестве примеров фигурируют Phi-3.5-MoE, Gemma-4-27B-A4B, Qwen3.5-35B-A3B): понимание того, что маршрутизация подчиняется закону частоты и разнообразия, помогает диагностировать проблемы вроде избыточности экспертов. Работа также полезна инфраструктурным инженерам, которые ищут способы снизить вычислительные затраты на инференс больших MoE-моделей, и исследователям интерпретируемости, изучающим внутреннее устройство языковых моделей.

Как это применить

Практический выход статьи, метод Subset Difference Pruning: он находит и удаляет экспертов, которые функционально дублируют друг друга, не трогая при этом качество рассуждений модели. Инженерам, которые обучают или дообучают собственные MoE-модели, авторы советуют сначала проверить эффективную разреженность (k/E_eff), низкое значение сигнализирует о риске «ловушки избыточности» из-за принудительной балансировки нагрузки. Более общий совет, проектировать маршрутизацию не вокруг равномерной балансировки нагрузки, а вокруг принципа минимальной длины описания (MDL): сознательно давать частой информации короткие маршрутные коды, а редкой, длинные.

Можно ли доверять

Это препринт с arXiv: доступный текст читается как аннотация работы, без полных методологических деталей (объём данных, бенчмарки, статус независимой проверки) и без указания имён авторов или организации в переданных метаданных. Выводы опираются на анализ трёх конкретных MoE-моделей (Phi-3.5-MoE, Gemma-4-27B-A4B, Qwen3.5-35B-A3B), а не на исчерпывающий обзор всех архитектур такого типа. Формулировка «закон», авторская, для теории, которая пока не прошла рецензирование и независимое воспроизведение; к выводам стоит относиться как к обоснованной, но пока не подтверждённой другими группами гипотезе.

Риски и подводные камни

Главный риск, переобобщение: результаты получены на небольшом наборе конкретных моделей, и неизвестно, распространяется ли «закон частоты и разнообразия» на все архитектуры MoE или только на часть из них. Метафора кодирования Хаффмана, убедительная аналогия, но она остаётся аналогией: в доступном тексте нет данных о том, что она проверена количественно, а не просто похожа качественно. Отказ от принудительной балансировки нагрузки ради хаффмановской маршрутизации несёт и инженерный риск: если экспертам будет доставаться неравномерная нагрузка, это способно ухудшить утилизацию GPU и эффективность инференса на практике, выигрыш в теоретическом сжатии может обернуться проигрышем в реальной пропускной способности.

«Маршрутизация в MoE, это не просто отбор, а проявление кодирования Хаффмана.»

— авторы статьи