Предложен reViT: один рекуррентный блок трансформера для зрения не уступает полной глубине

Предложен reViT: один рекуррентный блок трансформера для зрения не уступает полной глубине

В статье на Hugging Face Papers (2610.12448) описан reViT, зрительный трансформер, в котором вместо стопки разных слоёв один блок применяется рекуррентно, то есть многократно подряд. Авторы утверждают, что такой единственный блок может сравняться по точности с энкодером полной глубины при сопоставимых вычислительных затратах на инференс (FLOPs) и без дистилляции промежуточных признаков.

Чтобы «один и тот же» блок не делал на каждой глубине одно и то же, в reViT восстанавливаются преобразования, специфичные для глубины: полносвязная часть (FFN) на каждом рекуррентном шаге представлена как выпуклая комбинация небольшого общего банка экспертов. Смесь задаётся непрерывной нормированной координатой глубины, которая определяет траекторию в пространстве параметров FFN, допускающую повторную дискретизацию.

Метод проверен в двух режимах: обучение с учителем на ImageNet-1k и дистилляция из учителя DINOv2. В обоих режимах контролируемые эксперименты по адаптации показали, что слияние в пространстве весов (weight-space merging), самое сильное из протестированных семейств MoE при бюджете в один FFN на глубину, впереди вариантов с диспетчеризацией токенов и смешиванием выходов.

Конкретные результаты. При обучении с нуля reViT-B/16 достигает точности DeiT III примерно с 70% меньшим числом хранимых параметров. Модель с 8 экспертами, дистиллированная из DINOv2 только по выходным признакам учителя, сохраняет почти всю его точность линейного зондирования (linear probe) и переносится на классификацию, сегментацию и предсказание глубины.

Ещё два свойства. Обучение с эластичной глубиной позволяет одной обученной модели работать на нескольких протестированных глубинах за счёт повторной дискретизации того же интервала нормированной координаты. А для развёртывания с фиксированной глубиной рекуррентный блок можно материализовать в обычный плотный граф: онлайн-маршрутизация и слияние исчезают, вычисления на глубину (один FFN) не меняются, но объём хранения при развёртывании растёт.

Ключевые факты

  • reViT применяет один трансформерный блок рекуррентно; FFN на каждой глубине, выпуклая комбинация малого общего банка экспертов, заданная непрерывной нормированной координатой глубины.
  • По заявлению авторов, такая схема сравнивается по точности с энкодером полной глубины при сопоставимых FLOPs на инференсе и без дистилляции промежуточных признаков.
  • Обученный с нуля reViT-B/16 достигает точности DeiT III примерно с 70% меньшим числом хранимых параметров.
  • Модель с 8 экспертами, дистиллированная из DINOv2 только по выходным признакам, сохраняет почти всю точность линейного зондирования учителя и переносится на классификацию, сегментацию и предсказание глубины.
  • Из протестированных семейств MoE лучшим при бюджете в один FFN оказалось слияние в пространстве весов; при развёртывании с фиксированной глубиной блок разворачивается в плотный граф ценой роста хранилища.

Почему это важно

Обычные зрительные трансформеры наращивают качество глубиной: каждый слой имеет свои параметры, и все они хранятся. reViT проверяет другой путь, переиспользовать один блок и возвращать ему разнообразие через смесь экспертов, зависящую от глубины. По данным авторов, при обучении с нуля это даёт точность DeiT III примерно с 70% меньшим числом хранимых параметров. Важно, что это экономия именно хранимых параметров: по вычислениям (FLOPs на инференсе) заявлено лишь сопоставимое значение, а не выигрыш.

Кому это важно

Исследователям архитектур зрения, дистилляции и смесей экспертов (MoE): работа сравнивает семейства MoE при одинаковом бюджете в один FFN и называет сильнейшим слияние в пространстве весов. Также она интересна тем, кто упирается в объём хранимых параметров или хочет иметь одну модель, работающую на нескольких глубинах.

Как это применить

В аннотации не упоминаются код, веса или релиз, поэтому готового инструмента для использования нет. Практически описаны две идеи. Первая: обучение с эластичной глубиной, когда одна обученная модель работает на нескольких протестированных глубинах за счёт повторной дискретизации координаты глубины. Вторая: для развёртывания с фиксированной глубиной рекуррентный блок материализуется в обычный плотный граф, онлайн-маршрутизация и слияние исчезают, вычисления на глубину не меняются, но хранилище растёт; насколько именно, в аннотации количественно не указано.

Можно ли доверять

Это препринт, и все утверждения приведены по тексту самой аннотации и принадлежат авторам: сторонней проверки или независимого воспроизведения в материале нет. В аннотации не названы авторы и организации, не приведены абсолютные цифры точности, значения FLOPs и числа параметров, только относительное «примерно на 70% меньше хранимых параметров» против DeiT III. Формулировки вроде «почти вся точность» линейного зондирования не расшифрованы числом. Вывод о слиянии в пространстве весов ограничен протестированными семействами MoE.

Риски и подводные камни

Экономия в 70% относится к обученному с нуля reViT-B/16 в сравнении с DeiT III и хранимым параметрам; на дистиллированную модель с 8 экспертами и на вычисления она не распространяется. При материализации в плотный граф для фиксированной глубины хранилище, наоборот, растёт, и масштаб роста не указан. Эластичная глубина проверена только на протестированных глубинах, их перечень в аннотации не приведён. Оценка сделана на ImageNet-1k и при дистилляции из DINOv2; перенос на другие задачи и масштабы из текста не следует.