Метод MAP ускорил мультимодальные нейросети в 3,09 раза

Мультимодальные большие языковые модели (MLLM) хорошо справляются с задачами, где нужно сопоставлять текст и изображение, но обработка большого числа визуальных токенов обходится дорого по вычислениям. Чтобы ускорить инференс, применяют обрезку визуальных токенов, отбрасывание тех, что модели не понадобятся для ответа на конкретный вопрос. Недавние работы для этого используют attention (внимание) от текста к изображению из среднего слоя языковой модели: по нему выбирают, какие токены оставить, обычно беря внимание из заранее фиксированного среднего слоя.

У такого подхода, по анализу авторов работы, есть два пробела. Во-первых, слой, чьё внимание точнее всего откликается на конкретный вопрос, у разных примеров разный, единый фиксированный слой оказывается не оптимален. Во-вторых, чтобы вообще получить внимание из подходящего среднего слоя, нужно прогнать визуальные токены через несколько слоёв языковой модели, а к этому моменту уже потрачена значительная часть вычислений, которые обрезка должна была сэкономить.

Чтобы решить обе проблемы, авторы предлагают метод MAP (Middle-layer Attention Prediction, предсказание внимания среднего слоя). Он использует технику Question Contrastive Teacher Selection: для каждого примера сравнивается внимание модели при исходном и при референсном (эталонном) вопросе, и по этому сравнению выбирается свой слой-«учитель» именно для этого образца. Внимание из выбранного слоя дистиллируется (передаётся через обучение) в лёгкий предсказатель, который оценивает важность визуальных токенов прямо по мультимодальным входным признакам, ещё до того, как модель начала обрабатывать их по слоям.

Во время инференса MAP объединяет предсказанные оценки важности с критерием разнообразия и обрезает визуальные токены ещё перед первым слоем языковой модели. Поэтому методу не нужны карты внимания на этапе вывода, и он совместим с другими техниками ускорения инференса.

На десяти бенчмарках для модели LLaVA-NeXT-7B метод MAP сохраняет 97,5% производительности неподрезанной модели, оставляя лишь 5,56% визуальных токенов, и даёт ускорение инференса «от начала до конца» в 3,09 раза.

Ключевые факты

  • MAP предсказывает важность визуальных токенов до их обработки моделью и обрезает лишние ещё до первого слоя языковой модели.
  • Решает две проблемы прежних методов: слой внимания выбирается индивидуально для каждого примера (Question Contrastive Teacher Selection), а не фиксируется заранее.
  • На десяти бенчмарках LLaVA-NeXT-7B: 97,5% сохранённого качества при всего 5,56% визуальных токенов.
  • Ускорение инференса «от начала до конца», в 3,09 раза.
  • Метод не использует карты внимания на инференсе и совместим с другими техниками ускорения.

Почему это важно

Обработка изображений в мультимодальных моделях, дорогая по вычислениям часть инференса: каждое изображение превращается в десятки-сотни визуальных токенов, которые модель обрабатывает наравне с текстом. MAP предлагает точнее выбирать, какие токены выбросить, и делает это до того, как основная часть вычислений уже потрачена, то есть экономит именно там, где обрезка у прежних методов теряла смысл.

Кому это важно

Разработчикам и исследователям мультимодальных моделей, которым нужно снижать стоимость и задержку инференса без переобучения самой модели с нуля: метод дообучает только лёгкий предсказатель поверх уже готовой MLLM.

Как это применить

Работа описывает метод обрезки визуальных токенов, применённый к модели LLaVA-NeXT-7B и проверенный на десяти бенчмарках. По утверждению авторов, метод не требует карт внимания на этапе вывода и совместим с другими техниками ускорения инференса, то есть его можно сочетать с уже применяемыми оптимизациями.

Можно ли доверять

Это препринт на arXiv с описанием метода и числовыми результатами на десяти бенчмарках для одной модели (LLaVA-NeXT-7B), но текст не называет авторов работы, их организацию и дату публикации, а также не приводит сравнения с конкретными альтернативными методами обрезки токенов, только собственные показатели MAP.

Риски и подводные камни

Результаты показаны только для одной архитектуры и одного размера модели, LLaVA-NeXT-7B; источник не описывает, распространяются ли те же 97,5% качества и 3,09-кратное ускорение на другие MLLM или более крупные модели. Также нет разбивки итоговых цифр по отдельным бенчмаркам, только усреднённые показатели по всем десяти.