SANA-Video 2.0 ускорила генерацию видео в 120 раз с гибридным вниманием

Исследователи (первый автор, Junsong Chen с соавторами) представили SANA-Video 2.0, диффузионный трансформер (DiT) для генерации видео, доступный в двух версиях: на 5 и 14 миллиардов параметров, построенных на единой архитектуре. Модель генерирует видео в разрешении до 720p на одной видеокарте и по качеству не уступает моделям с полным softmax-вниманием, но при этом сохраняет выгодное масштабирование линейного внимания на длинных последовательностях кадров.
Ключевая идея, гибридное линейно-softmax внимание (Hybrid Linear-Softmax Attention): основную часть вычислений выполняет линейное внимание со сложностью O(N), а через равные промежутки, в соотношении 3:1, вставляются слои с полным softmax-вниманием, «якоря», которые восстанавливают полноранговые взаимодействия между токенами, недоступные чистому линейному вниманию.
Чтобы эти «освежённые» представления распространялись по всей глубине сети, авторы добавили остаточные связи между блоками внимания (Block Attention Residuals, AttnRes): сводки уже обработанных блоков передаются в последующие линейные слои, что позволяет повторно использовать признаки якорных слоёв и повышает эффективный ранг в глубоких слоях примерно на 12%.
Модель обучали с нуля, а не путём линеаризации уже готовой предобученной модели. Эксперименты на уменьшенном разрешении показали, что оптимальное соотношение, 25% слоёв с softmax-вниманием.
По метрикам: при 40 шагах сэмплирования SANA-Video 2.0 получает оценку 84.30 по бенчмарку VBench, генерируя видео в разрешении 480p за 13,2 секунды на одной видеокарте H100, сопоставимо с гораздо более крупными моделями с полным softmax-вниманием, но при значительно меньшей задержке. Скомпилированный прямой проход модели (forward pass) в 3,2 раза быстрее аналогичной модели с полным softmax-вниманием при генерации 60-секундного видео в 720p, причём с ростом длительности видео разрыв в скорости увеличивается.
Дополнительная оптимизация всего стека, Sol-Engine (объединение вычислительных ядер, кеширование и разреженное внимание), ускоряет работу ещё в 3,58 раза: версия модели на 5 миллиардов параметров генерирует 5-секундное видео в разрешении 720p за 13,06 секунды. В итоге при таком сочетании оптимизаций SANA-Video 2.0 работает в 120 раз быстрее модели Wan 2.2-A14B на одной видеокарте H100.
Ключевые факты
- SANA-Video 2.0, диффузионный трансформер для генерации видео на 5 и 14 млрд параметров, видео до 720p на одной видеокарте
- Гибридное линейно-softmax внимание (соотношение 3:1) плюс остаточные связи AttnRes, прирост эффективного ранга в глубоких слоях около 12%
- Модель обучена с нуля; оптимальная доля softmax-слоёв, 25%
- VBench 84.30 при генерации видео 480p за 13,2 секунды на одной видеокарте H100
- С учётом дополнительной оптимизации Sol-Engine, в 120 раз быстрее модели Wan 2.2-A14B на одной H100
Почему это важно
Генерация видео, одна из самых ресурсоёмких задач в области ИИ: классическое softmax-внимание в диффузионных трансформерах требует вычислений, растущих квадратично с длиной последовательности кадров, поэтому длинные и высококачественные видео обходятся очень дорого по времени и по GPU-ресурсам. Чистое линейное внимание снимает эту проблему, но обычно теряет в качестве, потому что не может восстанавливать полноранговые взаимодействия между токенами. SANA-Video 2.0 предлагает компромисс: сочетание редких softmax-слоёв-якорей с в основном линейным вниманием и остаточными связями AttnRes позволяет почти сохранить качество полного softmax-внимания при существенно меньшей вычислительной стоимости.
Кому это важно
В первую очередь, исследователям и инженерам, которые строят или встраивают модели генерации видео: команды, работающие над продуктами вроде текст-в-видео, получают конкретную архитектуру и обучающий рецепт, снижающие требования к GPU-инфраструктуре. Также это важно для исследователей в области механизмов внимания и эффективных трансформеров, работа даёт измеримые данные о том, какая доля softmax-слоёв оптимальна и как остаточные связи влияют на выразительность линейного внимания.
Как это применить
В тексте публикации не указаны условия лицензирования, доступность весов модели или исходного кода, это описание архитектуры и результатов экспериментов, а не готовый к использованию продукт с ценой или подпиской. Практическая ценность работы для сторонних команд, в самом архитектурном подходе (соотношение линейных и softmax-слоёв 3:1, остаточные связи между блоками, обучение с нуля вместо линеаризации готовой модели), который можно воспроизводить и адаптировать в собственных пайплайнах генерации видео.
Можно ли доверять
Работа опубликована на странице статей Hugging Face, авторы, команда с Junsong Chen во главе, ранее связанная с линейкой моделей SANA. Результаты приводятся как конкретные измеримые цифры (оценка VBench, время генерации на видеокарте H100, множители ускорения относительно softmax-базовой модели и модели Wan 2.2-A14B), что повышает проверяемость по сравнению с общими заявлениями. При этом все приведённые в тексте показатели, самоотчёт авторов, независимая проверка третьей стороной в источнике не упоминается.
Риски и подводные камни
Заявленные цифры ускорения и качества (в том числе кратность 120x относительно Wan 2.2-A14B) получены самими авторами и не подтверждены независимыми тестами. Результаты по гибридному вниманию и подбору доли softmax-слоёв основаны на экспериментах с уменьшенным разрешением, что может не полностью переноситься на другие сценарии использования. Также неясно, как архитектура ведёт себя на видео другой длительности и содержания за пределами протестированных 5- и 60-секундных клипов в 480p и 720p.