GeoPair: метод сжатия трансформеров без дообучения с сохранением геометрии слоёв

GeoPair: метод сжатия трансформеров без дообучения с сохранением геометрии слоёв

Авторы работы отмечают, что архитектуры трансформеров содержат избыточность между слоями, но существующие конвейеры пост-обучающего сжатия обычно оптимизируют слои по отдельности или используют эвристические стратегии группировки, которые не учитывают специфическую для каждого слоя геометрию активаций.

В ответ на это предложен GeoPair, принципиальный фреймворк, не требующий дообучения (training-free), который последовательно оптимизирует попарные сопоставления весов между слоями и факторизации с общим словарём (shared-dictionary factorization). Вместо того чтобы заставлять веса соседних слоёв делить общий базис или механически объединять статистику активаций, метод ищет структурно совместимые проекции и обучает общее представление, которое лучше сохраняет индивидуальную калибровочную геометрию каждого слоя.

В сочетании со структурированной разреженностью (structured sparsity) это, по утверждению авторов, даёт весьма эффективные разложения весов без потери функциональной точности модели. По их словам, на разных архитектурах, масштабах и модальностях метод показывает результаты уровня state-of-the-art, стабильно превосходя как независимые структурированные разложения весов, так и альтернативные попарные факторизации весов, работающие по эвристическим схемам группировки.

Авторы позиционируют работу как замену инженерных эвристик сходящимся, оптимизационным конвейером и как теоретически обоснованную основу для масштабируемого сжатия трансформеров в разных модальностях.

Ключевые факты

  • Представлен GeoPair, training-free (без дообучения) метод сжатия трансформеров
  • Вместо эвристической группировки слоёв метод подбирает структурно совместимые проекции для пар слоёв и обучает общее представление, сохраняющее геометрию активаций каждого слоя
  • Метод сочетается со структурированной разреженностью весов для повышения эффективности без потери функциональной точности
  • По заявлению авторов, метод показывает результаты уровня state-of-the-art на разных архитектурах, масштабах и модальностях, превосходя независимые и эвристические попарные разложения весов
  • Конкретные численные результаты, названия моделей, наборов данных, авторы и дата публикации в источнике не указаны

Почему это важно

Сжатие больших трансформерных моделей без потери качества, одна из ключевых задач для их развёртывания. Большинство существующих методов используют эвристическую группировку слоёв, которая может искажать внутреннюю геометрию активаций и терять точность. GeoPair предлагает более принципиальный, оптимизационный подход к подбору пар слоёв и факторизации весов, что, по описанию авторов, позволяет сохранить работу модели точнее при сопоставимом или большем сжатии.

Кому это важно

Материал адресован исследователям и инженерам, занимающимся сжатием и оптимизацией трансформеров (в том числе для мультимодальных моделей), а также командам, которым нужно развёртывать большие модели с ограничениями по памяти и вычислениям.

Как это применить

В открытом тексте не указаны конкретные архитектуры, наборы данных, коэффициенты сжатия или ссылки на код, поэтому оценить применимость метода на практике по имеющемуся описанию нельзя. Метод заявлен как training-free, то есть не требующий дополнительного обучения после применения к готовой модели, что теоретически упрощает интеграцию в существующие пайплайны сжатия.

Можно ли доверять

Материал представляет собой описание (аннотацию) научной работы на HuggingFace Papers. В доступном тексте отсутствуют имена авторов, аффилиации, дата публикации, названия использованных моделей и конкретные числовые результаты, все содержательные утверждения об эффективности метода даны в общих формулировках самих авторов, без независимой проверки или ссылок на бенчмарки в приведённом отрывке.

Риски и подводные камни

Заявления о результатах уровня state-of-the-art пока не подкреплены в тексте конкретными цифрами, поэтому судить о реальном выигрыше в сжатии или скорости по сравнению с альтернативами нельзя. Как и с любой новой методикой сжатия, остаётся открытым вопрос устойчивости результатов на моделях и модальностях, не упомянутых в описании.

«Наш подход выявляет структурно совместимые проекции и обучает общее представление, которое лучше сохраняет индивидуальную калибровочную геометрию каждого слоя.»

— авторы работы