Kandinsky выпустила KVAE, семейство токенизаторов для аудио, видео и изображений

Kandinsky выпустила KVAE, семейство токенизаторов для аудио, видео и изображений

Команда Kandinsky (судя по названию репозиториев на GitHub, kandinskylab) выпустила технический отчёт о KVAE, семействе токенизаторов для латентной диффузионной генерации (LDM). Токенизатор в такой схеме сжимает исходный сигнал, звук, изображение, видео, в компактное латентное представление, на котором затем обучается генеративная модель; от качества токенизатора напрямую зависят скорость обучения, качество результатов и то, какие приложения можно построить поверх модели. Авторы представили три модели. KVAE-Audio, непрерывный полнополосный (full-band) аудио-токенизатор на 48 кГц с латентным представлением частотой 50 Гц и 64 каналами. KVAE-3D, два каузальных видео-токенизатора со сжатием 4×16×16 и 4×8×8. KVAE-2D, токенизатор изображений, сжимающий вход в 8 раз, с латентом в 32 канала. Авторы заявляют, что по метрикам реконструкции (PSNR, LPIPS, PESQ и другие) и метрикам генерации, как объективным (Frechet Distance, CLIP score, CLAP score), так и субъективным (сравнение бок о бок), KVAE не уступает или превосходит ведущие открытые токенизаторы, использованные в Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio и MMAudio; конкретных числовых значений сравнения в аннотации не приведено, названы только метрики и список моделей-ориентиров. Учитывая сложность разработки таких токенизаторов, авторы дополнительно поделились с сообществом деталями обучения, методом выбора итоговой модели и результатами абляционных экспериментов по архитектурным решениям. Код опубликован в открытом доступе на GitHub, в двух репозиториях, kandinskylab/kvae и kandinskylab/kvae-audio.

Ключевые факты

  • KVAE, семейство из трёх токенизаторов для диффузионной генерации: KVAE-Audio (аудио), KVAE-3D (видео, две версии) и KVAE-2D (изображения)
  • KVAE-Audio: непрерывный полнополосный токенизатор на 48 кГц, латент, 50 Гц, 64 канала
  • KVAE-3D: два каузальных видео-токенизатора со сжатием 4×16×16 и 4×8×8
  • KVAE-2D: сжимает изображение в 8 раз, латентное представление, 32 канала
  • Авторы утверждают паритет или превосходство над открытыми токенизаторами Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio и MMAudio по метрикам реконструкции и генерации; код открыт на GitHub в двух репозиториях

Почему это важно

Токенизатор, узкое место любой диффузионной генеративной модели: он задаёт, насколько плотно и без потерь сигнал сжимается перед генерацией, и напрямую влияет на скорость обучения и качество результата. KVAE, редкий случай, когда одна команда выпускает согласованное семейство токенизаторов сразу для трёх модальностей (аудио, изображение, видео) с общим отчётом, деталями обучения и абляционными экспериментами, а не одну изолированную модель без объяснения решений.

Кому это важно

Исследователям и инженерам, которые строят или дообучают собственные диффузионные пайплайны генерации изображений, видео или звука и подбирают токенизатор как компонент такой системы, а также командам, сравнивающим открытые VAE-токенизаторы между собой.

Как это применить

Код KVAE выложен в открытом доступе на GitHub в двух репозиториях, kandinskylab/kvae и kandinskylab/kvae-audio, его можно встроить в собственный пайплайн генерации. Отчёт содержит детали обучения, метод выбора итоговой модели и результаты абляционных экспериментов, что позволяет не просто использовать готовые веса, а воспроизвести или адаптировать архитектурные решения под свою задачу.

Можно ли доверять

Заявления о превосходстве над Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio и MMAudio, это самоотчёт авторов: в аннотации названы метрики и список моделей-ориентиров, но конкретные числовые значения сравнения не приведены. Независимой проверки результатов на момент публикации нет. В самой аннотации отчёта не названы ни авторы, ни организация, ни дата публикации, принадлежность к Kandinsky следует только из имени репозиториев на GitHub.

Риски и подводные камни

В аннотации нет ни точных цифр по итоговому сравнению метрик, ни данных о размере моделей, объёме вычислений на обучение или составе обучающих датасетов, оценить воспроизводимость результатов без обращения к коду и весам напрямую нельзя.