Диффузионные трансформеры (DiT): дальние связи между слоями сократили обучение до 1,73 раза

В статье пересматривается устройство остаточных связей в диффузионных трансформерах (DiT), архитектуре, которая стала масштабируемой основой для генерации изображений высокой точности. В отличие от диффузионных моделей на базе U-Net с жёстко заданными вручную skip-связями (пропускающими соединениями), DiT в основном используют единый остаточный поток, который сводит все предыдущие слои в одно монолитное состояние. Авторы предлагают превратить остаточные связи из пассивного суммирования в активный механизм извлечения информации, оптимизированный под удаление шума с изображения.
Сначала авторы провели систематический анализ внутренних представлений DiT и обнаружили скрытую склонность модели к повторному использованию признаков ранних слоёв и к симметричному «руководству» между слоями. Исходя из этого они разработали структурированную схему связей, которая явно объединяет локальные остаточные связи с дальними путями. Вместо статичных skip-связей или плотной маршрутизации между всеми слоями каждый блок трансформера может выборочно «обращаться» (attend) к важным более ранним представлениям и динамически извлекать из них пространственные и семантические подсказки по прямым дифференцируемым путям через глубину сети.
Результаты, о которых сообщают авторы: адаптивная связность ускоряет сходимость, до 1,73 раза меньше итераций обучения, и заметно улучшает FID и визуальное качество, добавляя менее 0,1% параметров. Сильную модель REPA-XL/2 метод улучшил с 5,9 до 4,34 FID без guidance (управляющего сигнала), а с classifier-free guidance удалось достичь 1,39 FID (чем ниже FID, тем лучше). Авторы делают вывод, что адаптивная связность между слоями, важный, но малоисследованный фактор в диффузионных трансформерах, а структурированные информационные пути, простой и эффективный способ улучшать масштабируемые генеративные модели.
Ключевые факты
- DiT обычно используют единый остаточный поток, сводящий все предыдущие слои в одно монолитное состояние, в отличие от U-Net с ручными skip-связями.
- Анализ внутренних представлений DiT выявил склонность к повторному использованию признаков ранних слоёв и симметричному руководству между слоями.
- Предложенная схема сочетает локальные остаточные связи с дальними путями: каждый блок выборочно «обращается» к нужным более ранним представлениям.
- Обучение требует до 1,73 раза меньше итераций, добавка, менее 0,1% параметров.
- REPA-XL/2 улучшена с 5,9 до 4,34 FID без guidance; с classifier-free guidance достигнут FID 1,39.
Почему это важно
Диффузионные трансформеры стали одной из основных архитектур для генерации изображений, а обучение таких моделей дорого. Работа указывает на малоисследованный рычаг: не наращивать размер модели, а изменить схему связей между слоями. По заявлению авторов, это ускоряет сходимость (до 1,73 раза меньше итераций обучения) и улучшает качество при добавке менее 0,1% параметров.
Кому это важно
Исследователям и инженерам, которые обучают или дорабатывают диффузионные трансформеры для генерации изображений, особенно на базе REPA-XL/2. Также тем, кто изучает архитектуры остаточных связей и внутренние представления трансформеров.
Как это применить
Идея сводится к замене единого остаточного потока на сочетание локальных остаточных связей с дальними путями, по которым блок выборочно обращается к более ранним представлениям. Как именно реализовать схему, в тексте аннотации не описано; для практического применения нужно смотреть полную статью.
Можно ли доверять
Все цифры, заявления самих авторов из аннотации статьи. В тексте не указаны набор данных, разрешение изображений и протокол оценки FID, а также то, с каким базовым вариантом и при каком целевом FID сравнивается ускорение в 1,73 раза. Сравнение дано только с REPA-XL/2. Сами авторы формулируют вывод осторожно: результаты «позволяют предположить» важность адаптивной связности.
Риски и подводные камни
Ускорение обучения дано как максимум («до 1,73 раза»), а не как типичное значение. Не приведены затраты вычислений, реальное время обучения и влияние на скорость генерации. Упоминания о выпуске кода или моделей в тексте нет, поэтому независимая проверка результатов пока затруднена.