OmniPack сокращает вычисления в омни-моделях до 16,7% при 98,0% качества

Омни-модальные большие языковые модели (в источниках, Omni-LLM, далее в тексте, омни-модели) одновременно понимают текст, аудио и видео и уже показывают сильные результаты в задачах аудиовизуального понимания. Но обработка длинных и сильно избыточных последовательностей визуальных и аудиотокенов резко увеличивает вычислительные затраты, и для эффективного развёртывания таких моделей нужно агрессивно сжимать токены.
По словам авторов работы, у существующих способов сжатия токенов есть системный изъян. Сжатие до подачи данных в языковую модель рискует отбросить структурно важные сведения, «размазанные» по всему входу, а не сосредоточенные в одном месте. Сжатие внутри языковой модели, наоборот, часто недоиспользует связь между аудио- и видеоданными, которая зависит от конкретного запроса пользователя.
Чтобы устранить оба изъяна разом, авторы предложили OmniPack, фреймворк, не требующий обучения, который сочетает оба этапа сжатия. До подачи в языковую модель OmniPack убирает структурную избыточность за счёт трёх механизмов: оценки важности с учётом модальности, учёта глобального покрытия входа и слияния похожих токенов. Уже внутри модели, после того как между модальностями произошло достаточное взаимодействие, OmniPack дополнительно консолидирует разнородные, но релевантные запросу представления, опираясь на текстовый запрос и совместную обработку аудио и видео.
Метод проверили на пяти бенчмарках и трёх омни-моделях; по имени в тексте абстракта названа только Qwen2.5-Omni-7B, две другие модели не раскрыты. По утверждению авторов, при разных уровнях сжатия OmniPack стабильно даёт лучший баланс между качеством и вычислительными затратами, опережая все существующие методы. На Qwen2.5-Omni-7B при менее агрессивном сжатии OmniPack сохраняет 98,0% исходного качества, сократив вычисления (FLOPs) до 16,7% от изначальных; при более агрессивном сжатии, 92,9% качества при всего 6,8% исходных FLOPs.
Ключевые факты
- OmniPack, фреймворк для сжатия аудио- и видеотокенов в омни-моделях, не требующий обучения: сочетает сжатие до подачи в языковую модель и доработку представлений внутри неё.
- На Qwen2.5-Omni-7B при менее агрессивном сжатии метод сохраняет 98,0% исходного качества, сократив вычисления (FLOPs) до 16,7% от изначальных.
- При более агрессивном сжатии, 92,9% качества при всего 6,8% исходных FLOPs.
- Метод проверен на пяти бенчмарках и трёх омни-моделях; по имени в источнике названа только Qwen2.5-Omni-7B.
- По утверждению авторов, OmniPack стабильно превосходит все существующие методы сжатия по балансу «качество / вычисления»; источник называет авторов и их институцию, а также даёт ссылку на репозиторий с кодом модели.
Почему это важно
Омни-модели, системы, которые одновременно понимают текст, аудио и видео, упираются именно в стоимость обработки длинных аудио- и видеопоследовательностей: это одно из главных препятствий для их массового практического использования. OmniPack показывает, что вычисления можно сократить в разы, до 16,7% или даже 6,8% от исходных, почти без потери качества (98,0% и 92,9% соответственно), причём без дополнительного обучения модели, то есть метод в принципе можно накладывать на уже готовую модель.
Кому это важно
Разработчикам и исследователям, которые строят или развёртывают омни-модели и упираются в стоимость и задержку инференса; командам, которым нужно уместить уже обученную модель в ограниченный вычислительный бюджет без потери качества; в более широком смысле, всем, кто следит за тем, как индустрия решает проблему дороговизны мультимодального ИИ.
Как это применить
Поскольку OmniPack не требует обучения, метод теоретически можно применить к уже готовой омни-модели как отдельный слой сжатия токенов: сначала убрать структурную избыточность до подачи в языковую модель, затем доуплотнить представления внутри модели по мере обработки запроса. Источник даёт ссылку на репозиторий с кодом реализации на GitHub, поэтому стороннее применение метода на практике уже возможно.
Можно ли доверять
Источник, страница статьи на huggingface.co/papers; в опубликованном тексте названы и авторы работы, и их институция. Утверждение «превосходит все существующие методы», самостоятельная оценка авторов: какие именно методы сравнивались и что за две из трёх протестированных омни-моделей, кроме Qwen2.5-Omni-7B, из текста не ясно. Абсолютные цифры, задержка ответа, расход памяти, реальное время инференса, в источнике тоже не приводятся, только относительные проценты качества и FLOPs.
Риски и подводные камни
Цифры 98,0% и 92,9% относятся к одной модели (Qwen2.5-Omni-7B) при двух разных уровнях сжатия, а не к гарантии для конкретной задачи: как метод ведёт себя на каждом из пяти бенчмарков по отдельности, источник не раскрывает. Экономия FLOPs не равна экономии реального времени ответа или памяти на практике, соотношение зависит от оборудования. А поскольку источник даёт ссылку на репозиторий с кодом, независимая проверка результатов возможна.