Диффузионные трансформеры (DiT): дальние связи между слоями сократили обучение до 1,73 раза

Диффузионные трансформеры (DiT): дальние связи между слоями сократили обучение до 1,73 раза

В статье пересматривается устройство остаточных связей в диффузионных трансформерах (DiT), архитектуре, которая стала масштабируемой основой для генерации изображений высокой точности. В отличие от диффузионных моделей на базе U-Net с жёстко заданными вручную skip-связями (пропускающими соединениями), DiT в основном используют единый остаточный поток, который сводит все предыдущие слои в одно монолитное состояние. Авторы предлагают превратить остаточные связи из пассивного суммирования в активный механизм извлечения информации, оптимизированный под удаление шума с изображения.

Сначала авторы провели систематический анализ внутренних представлений DiT и обнаружили скрытую склонность модели к повторному использованию признаков ранних слоёв и к симметричному «руководству» между слоями. Исходя из этого они разработали структурированную схему связей, которая явно объединяет локальные остаточные связи с дальними путями. Вместо статичных skip-связей или плотной маршрутизации между всеми слоями каждый блок трансформера может выборочно «обращаться» (attend) к важным более ранним представлениям и динамически извлекать из них пространственные и семантические подсказки по прямым дифференцируемым путям через глубину сети.

Результаты, о которых сообщают авторы: адаптивная связность ускоряет сходимость, до 1,73 раза меньше итераций обучения, и заметно улучшает FID и визуальное качество, добавляя менее 0,1% параметров. Сильную модель REPA-XL/2 метод улучшил с 5,9 до 4,34 FID без guidance (управляющего сигнала), а с classifier-free guidance удалось достичь 1,39 FID (чем ниже FID, тем лучше). Авторы делают вывод, что адаптивная связность между слоями, важный, но малоисследованный фактор в диффузионных трансформерах, а структурированные информационные пути, простой и эффективный способ улучшать масштабируемые генеративные модели.

Ключевые факты

  • DiT обычно используют единый остаточный поток, сводящий все предыдущие слои в одно монолитное состояние, в отличие от U-Net с ручными skip-связями.
  • Анализ внутренних представлений DiT выявил склонность к повторному использованию признаков ранних слоёв и симметричному руководству между слоями.
  • Предложенная схема сочетает локальные остаточные связи с дальними путями: каждый блок выборочно «обращается» к нужным более ранним представлениям.
  • Обучение требует до 1,73 раза меньше итераций, добавка, менее 0,1% параметров.
  • REPA-XL/2 улучшена с 5,9 до 4,34 FID без guidance; с classifier-free guidance достигнут FID 1,39.

Почему это важно

Диффузионные трансформеры стали одной из основных архитектур для генерации изображений, а обучение таких моделей дорого. Работа указывает на малоисследованный рычаг: не наращивать размер модели, а изменить схему связей между слоями. По заявлению авторов, это ускоряет сходимость (до 1,73 раза меньше итераций обучения) и улучшает качество при добавке менее 0,1% параметров.

Кому это важно

Исследователям и инженерам, которые обучают или дорабатывают диффузионные трансформеры для генерации изображений, особенно на базе REPA-XL/2. Также тем, кто изучает архитектуры остаточных связей и внутренние представления трансформеров.

Как это применить

Идея сводится к замене единого остаточного потока на сочетание локальных остаточных связей с дальними путями, по которым блок выборочно обращается к более ранним представлениям. Как именно реализовать схему, в тексте аннотации не описано; для практического применения нужно смотреть полную статью.

Можно ли доверять

Все цифры, заявления самих авторов из аннотации статьи. В тексте не указаны набор данных, разрешение изображений и протокол оценки FID, а также то, с каким базовым вариантом и при каком целевом FID сравнивается ускорение в 1,73 раза. Сравнение дано только с REPA-XL/2. Сами авторы формулируют вывод осторожно: результаты «позволяют предположить» важность адаптивной связности.

Риски и подводные камни

Ускорение обучения дано как максимум («до 1,73 раза»), а не как типичное значение. Не приведены затраты вычислений, реальное время обучения и влияние на скорость генерации. Упоминания о выпуске кода или моделей в тексте нет, поэтому независимая проверка результатов пока затруднена.