AMap подняла CTR рекомендаций на 2,4% архитектурой MoE IntBMoE

AMap подняла CTR рекомендаций на 2,4% архитектурой MoE IntBMoE

В существующих архитектурах Mixture-of-Experts (MoE, «смесь экспертов») нельзя независимо задать три величины: участие, сколько экспертов вносят вклад в ответ на один токен; исполнение, сколько экспертов реально считается (вычислительная стоимость); материализацию, сколько наборов параметров размером с эксперта нужно построить и хранить (стоимость памяти). Разреженная маршрутизация держит исполнение и материализацию низкими, но урезает участие: на каждый токен работает лишь несколько экспертов. Плотное смешивание выходов возвращает полное участие, но исполнение растёт вместе с числом экспертов. Слияние параметров держит исполнение на уровне одного эксперта, но материализация растёт вместе с числом маршрутных решений.

Авторы предлагают IntBMoE, MoE с блочным кондиционированием, которая разводит все три величины, совмещая плотную композицию экспертов с разреженным исполнением блоков. Блоки берутся из небольшого обучаемого кодбука (словаря блоков), по одному на запись. На каждом внутреннем слое лёгкая гиперсеть сливает все базовые экспертные блоки из пула этого слоя в один составной («композитный») эксперт. Участие получается полным, потому что каждый составной эксперт опирается на весь пул. Исполнение остаётся разреженным, потому что маршрутизатор отправляет каждый токен лишь на несколько блоков. Материализация ограничена, потому что число блоков задаёт кодбук, а не входные данные. Отдельный механизм, Dual-Path Residual Gating (DPRG, «остаточное шлюзование по двум путям»), дополнительно связывает два независимо составленных пути мультипликативным шлюзованием.

В экспериментах по классификации изображений IntBMoE стабильно превосходит представительные разреженные и плотные MoE-базовые модели (какие именно, в тексте не названо). Дополнительные эксперименты на языковом моделировании и последовательных рекомендациях показывают, что метод обобщается за пределы задач компьютерного зрения.

IntBMoE уже полностью развёрнута в генеративной рекомендательной системе AMap, обслуживающей сотни миллионов пользователей при бюджете задержки в 60 мс. В онлайн-A/B-тестировании это дало относительный прирост UVCTR (доли уникальных пользователей, кликнувших по рекомендации) на 2,4%. Код опубликован на GitHub, в репозитории AMAP-ML/DreamX-Rec.

Ключевые факты

  • IntBMoE разводит участие, исполнение и материализацию экспертов, совмещая плотную композицию блоков с их разреженным исполнением
  • Блоки берутся из небольшого обучаемого кодбука; на каждом слое гиперсеть сливает базовые экспертные блоки пула в один составной эксперт
  • Dual-Path Residual Gating (DPRG) связывает два независимо составленных пути мультипликативным шлюзованием
  • Прирост подтверждён на классификации изображений, языковом моделировании и последовательных рекомендациях
  • Развёрнута в продакшене AMap: сотни миллионов пользователей, бюджет задержки 60 мс, прирост UVCTR 2,4% в онлайн-A/B-тесте

Почему это важно

Существующие MoE-архитектуры вынуждали выбирать: либо держать вычисления и память дешёвыми ценой узкого участия экспертов (разреженная маршрутизация), либо расширять участие ценой роста вычислений (плотное смешивание), либо экономить на вычислениях ценой роста памяти (слияние параметров). IntBMoE предлагает архитектурный приём, который разводит все три величины одновременно: полное участие экспертов при разреженном исполнении и ограниченной памяти, за счёт того что число блоков задаёт фиксированный кодбук, а не число экспертов или маршрутных решений.

Кому это важно

Инженерам и исследователям, которые строят или обслуживают крупные MoE-модели, как в исследовательских, так и в промышленных системах с жёстким бюджетом задержки, включая рекомендательные системы с большим числом пользователей, где рост вычислений или памяти на эксперта напрямую бьёт по себестоимости обслуживания.

Как это применить

Код IntBMoE опубликован на GitHub (AMAP-ML/DreamX-Rec), архитектуру можно изучить и адаптировать напрямую. Метод уже проверен не только на бенчмарках классификации изображений, языкового моделирования и последовательных рекомендаций, но и в реальном продакшене, рекомендательной системе AMap с бюджетом задержки 60 мс, что даёт ориентир для переноса в похожие системы.

Можно ли доверять

Источник, страница статьи на Hugging Face Papers, качество источника отмечено как полное. Утверждение о приросте подкреплено не только лабораторными экспериментами, но и результатом реального онлайн-A/B-теста на продакшен-трафике AMap (прирост UVCTR на 2,4%), что заметно повышает доверие по сравнению с чисто бенчмарочными заявлениями.

Риски и подводные камни

В тексте не названы конкретные разреженные и плотные MoE-базовые модели, с которыми сравнивался IntBMoE, не указан размер кодбука (число блоков) и не сказано, как долго архитектура уже работает в AMap, это ограничивает независимую проверку масштаба улучшения. Прирост UVCTR на 2,4% в одном A/B-тесте на одной системе не гарантирует такого же эффекта в других доменах; сами авторы характеризуют вклад как решение конкретного архитектурного компромисса, а не прорыв.