MoE-ViE: визуальный энкодер сравнялся с SOTA-моделью при меньшей задержке

MoE-ViE: визуальный энкодер сравнялся с SOTA-моделью при меньшей задержке

Визуальный энкодер, компонент визуально-языковой модели (VLM), который превращает изображение в представление, понятное языковой части системы: чем выше его ёмкость, тем обычно выше качество распознавания. Но «плотное» масштабирование, рост размера всей сети целиком, увеличивает и вычислительные затраты, и задержку на инференсе (выполнении уже обученной модели). В больших языковых моделях похожую проблему давно решает архитектура Mixture-of-Experts (MoE, «смесь экспертов»): вместо того чтобы прогонять каждый вход через всю сеть, модель на лету задействует лишь часть специализированных «экспертов», так ёмкость растёт быстрее, чем реальные вычисления. Для визуальных энкодеров в стиле CLIP пространство MoE-архитектур на уровне современных передовых моделей (SOTA) до этой работы системно почти не исследовали.

Работу выполнила группа исследователей, её первый автор по данным страницы публикации, Бонань Чжан (Bonan Zhang); полный состав авторов и организация в тексте аннотации не названы. Авторы систематически изучили варианты MoE для визуальных энкодеров и обнаружили, что мелкозернистые (fine-grained) MoE-топологии, много небольших специализированных экспертов вместо нескольких крупных, дают существенный прирост качества и над плотными энкодерами, и над стандартным MoE. Поверх этого они предложили способ балансировки нагрузки между экспертами без отдельной вспомогательной функции потерь, чтобы эксперты использовались более равномерно, и разработали специализированное вычислительное MoE-ядро, которое снижает задержку на инференсе. Чтобы добавить моделям понимание видео и не потерять при этом уже выученные знания об изображениях, авторы ввели дистилляцию на уровне отдельных кадров в паре с новым механизмом заморозки части сети.

На этой основе исследователи предобучили целое семейство визуальных энкодеров MoE-ViE (Mixture-of-Experts Vision Encoders) разных размеров, все они стабильно превосходят по качеству свои плотные аналоги того же класса. Старшая модель семейства по качеству в режиме zero-shot (без дообучения под конкретную задачу) сравнялась с SOTA-энкодером, который в 1,7 раза крупнее её по размеру, но при этом работает с задержкой всего в 76% от задержки этого более крупного энкодера, то есть заметно быстрее при равном качестве. А когда MoE-ViE используют в связке с языковой моделью, она превосходит по качеству все энкодеры, с которыми её сравнивали, на тестах по изображениям и видео, включая модели, у которых задействовано до 5 раз больше активных параметров.

Код семейства MoE-ViE авторы выложили в открытый доступ на GitHub, репозиторий facebookresearch/moe_vie. При этом в тексте аннотации не назван ни конкретный SOTA-энкодер, с которым сравнивали старшую модель, ни энкодеры с 5-кратно большим числом активных параметров, ни конкретные тесты (бенчмарки), ни абсолютные цифры точности и задержки, приведены только относительные сравнения (1,7 раза, 76%, 5 раз); не указаны также организация авторов и точная дата публикации.

Ключевые факты

  • MoE-ViE, семейство визуальных энкодеров для изображений и видео на архитектуре Mixture-of-Experts (MoE); все размеры семейства стабильно превосходят по качеству свои плотные (dense) аналоги.
  • Главный источник прироста, мелкозернистая (fine-grained) топология MoE: много небольших специализированных экспертов вместо нескольких крупных дают больше качества, чем и dense-энкодеры, и стандартный MoE.
  • Дополнительно предложены балансировка нагрузки экспертов без вспомогательной функции потерь и специализированное вычислительное MoE-ядро, снижающее задержку на инференсе.
  • Видео добавили без потери качества на изображениях, через дистилляцию на уровне кадров в паре с новым механизмом заморозки части сети.
  • Старшая модель MoE-ViE в zero-shot сравнялась по качеству с SOTA-энкодером, который в 1,7 раза крупнее, при задержке всего 76% от его задержки; в связке с языковой моделью MoE-ViE превосходит все сравниваемые энкодеры, включая модели с активными параметрами до 5 раз больше. Код открыт на GitHub (facebookresearch/moe_vie).

Почему это важно

Визуальный энкодер, это часть визуально-языковой модели, которая отвечает за «зрение»: от его качества и скорости зависит, насколько хорошо и быстро система понимает изображения и видео. До сих пор основной способ поднять его качество, сделать сеть плотнее, а это напрямую увеличивает стоимость вычислений и задержку на инференсе. Архитектура MoE уже решила похожую задачу для языковых моделей, конкретный вход обрабатывает не вся сеть, а только несколько «экспертов», так что ёмкость растёт быстрее реальных вычислений, но для визуальных энкодеров в стиле CLIP на уровне современных лучших моделей (SOTA) это пространство решений системно почти не изучали. Работа показывает: дело не просто в переносе идеи MoE на зрение, а в конкретной топологии, мелкозернистые варианты с множеством небольших экспертов дают заметно больше качества, чем и плотные энкодеры, и обычный MoE, а старшая модель серии обходит по эффективности энкодер, который крупнее её в 1,7 раза.

Кому это важно

Прежде всего, командам, которые обучают или дообучают визуально-языковые модели и мультимодальных ассистентов: MoE-ViE предлагает визуальный энкодер, который можно поставить вместо плотного аналога и рассчитывать на то же или лучшее качество при заметно меньшей задержке. Отдельно это касается тех, кто добавляет в такие модели понимание видео, приём с дистилляцией по кадрам и заморозкой части сети даёт конкретный способ научить готовый энкодер изображений понимать видео, не потеряв уже выученное про картинки. Инженерам инференс-инфраструктуры полезно специализированное MoE-ядро, это попытка снять типичный для MoE штраф по задержке. И тем, кто выбирает визуальный энкодер под ограничения по бюджету или скорости, семейство MoE-ViE выпущено в нескольких размерах.

Как это применить

Это не готовый продукт, а исследовательская работа с открытым кодом: авторы выложили код семейства MoE-ViE на GitHub (репозиторий facebookresearch/moe_vie), так что реализацию можно изучить и попробовать напрямую. Для тех, кто обучает свои визуальные энкодеры, практический вывод, не просто взять MoE, а взять именно мелкозернистую топологию: по данным авторов, именно она даёт основной прирост качества. Отдельно можно позаимствовать два приёма независимо от архитектуры целиком: балансировку нагрузки экспертов без вспомогательной функции потерь, для более равномерной загрузки экспертов, и связку «дистилляция по кадрам плюс заморозка части сети», как способ дообучить готовый энкодер изображений под видео, не переобучая его с нуля. Семейство выпущено в нескольких размерах, что оставляет выбор конкретной модели под бюджет и задержку конечного применения.

Можно ли доверять

Источник, карточка препринта на Hugging Face Papers (arXiv, номер 2608.17402); статус независимого рецензирования (peer review) в источнике не указан, как и организация авторов и точная дата публикации. Первым автором на странице указан Бонань Чжан (Bonan Zhang) с соавторами, полный список участников в тексте аннотации не приведён. Обсуждение на Hugging Face пока небольшое: 12 отметок и 2 комментария. Плюс для доверия, код проекта открыт (GitHub, facebookresearch/moe_vie), что допускает стороннюю проверку результатов, в отличие от чисто теоретических заявлений без кода. Минус, все числовые результаты относительные (во сколько раз больше или меньше, какой процент задержки), а конкретные модели, с которыми сравнивали MoE-ViE, включая тот самый более крупный SOTA-энкодер и энкодеры с 5-кратно большим числом активных параметров, как и конкретные тесты (бенчмарки), поимённо не названы; это не позволяет независимо сверить, насколько репрезентативно выбраны точки сравнения.

Риски и подводные камни

Все ключевые цифры статьи, относительные показатели по данным самих авторов (SOTA-энкодер крупнее в 1,7 раза, задержка MoE-ViE, 76% от его задержки, у части конкурентов до 5 раз больше активных параметров): абсолютных чисел точности, задержки или размера моделей для сверки нет, а сами модели-конкуренты и бенчмарки поимённо не названы. Аннотация также не сообщает, на каких данных, с каким вычислительным бюджетом и на каком оборудовании обучали и тестировали модели серии, включая специализированное MoE-ядро, значит, воспроизвести результаты по одной аннотации не получится, даже при открытом коде. Наконец, это препринт arXiv, и в источнике не указано, прошла ли работа независимое рецензирование, соответствие заявленному уровню SOTA стоит считать предварительным до независимой проверки.