DLLM-TTS: блочная диффузия ускорила синтез речи до RTF 0.15

Современные системы синтеза речи (TTS) сталкиваются с компромиссом. Авторегрессионные кодек-языковые модели, те, что кодируют звук в дискретные токены и затем порождают речь, дают высокую разборчивость, но требуют больших моделей и объёмов обучающих данных и декодируют токены последовательно, один за другим. Неавторегрессионные подходы ускоряют генерацию, но жертвуют лингвистической точностью.

Wasim Madha с шестью соавторами (Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath) предложили DLLM-TTS, фреймворк, который формулирует синтез речи как условную блочную дискретную диффузию поверх токенов нейросетевого аудиокодека X-Codec2. Модель разбивает последовательность токенов на блоки, внутри каждого блока применяет маскированную диффузию (постепенно восстанавливает замаскированные токены), а сами блоки обрабатывает последовательно один за другим. За счёт этого модель учится одновременно локальной акустической связности внутри блока и глобальному согласованию текста и речи между блоками.

На этапе генерации параллельное предсказание токенов внутри блока даёт эффективность: коэффициент реального времени (RTF, отношение времени генерации к длительности получившегося аудио) составил 0.15. Модель размером 0.6 млрд параметров, обученная на 20 тысячах часов аудио, показывает, по словам авторов, «конкурентоспособные результаты» на бенчмарке SeedTTS-eval. Конкретных числовых значений метрик качества (WER, MOS и подобных) или прямого сравнения с определёнными базовыми системами в статье не приводится.

Авторы делают вывод, что блочные дискретные диффузионные языковые модели дают практичный и экономичный по объёму данных способ синтеза речи с параллельной генерацией.

Ключевые факты

  • Проблема: авторегрессионные TTS-модели разборчивы, но медленные из-за последовательного декодирования и требуют больших моделей и датасетов; неавторегрессионные, быстрее, но менее точны лингвистически.
  • DLLM-TTS формулирует синтез речи как блочную дискретную диффузию поверх токенов аудиокодека X-Codec2: маскированная диффузия внутри блока плюс последовательная обработка блоков.
  • Параллельное предсказание токенов внутри блока на этапе инференса даёт коэффициент реального времени (RTF) 0.15.
  • Модель на 0.6 млрд параметров, обученная на 20 тысячах часов аудио, показывает «конкурентоспособные результаты» на бенчмарке SeedTTS-eval, без конкретных числовых метрик и без сравнения с названными базовыми системами.
  • Авторы не публикуют в статье ни код, ни веса модели, ни демо, ни институциональную принадлежность.

Почему это важно

Синтез речи долго был компромиссом между двумя лагерями: авторегрессионные кодек-модели звучат разборчиво, но генерируют токен за токеном, медленно и с большими требованиями к модели и данным; неавторегрессионные модели быстрые, но теряют в лингвистической точности. DLLM-TTS предлагает третий путь, блочную дискретную диффузию, которая внутри блока параллелит генерацию (как неавторегрессионные методы), а между блоками сохраняет последовательную обработку (как авторегрессионные), пытаясь взять от обоих подходов лучшее.

Кому это важно

Работа адресована исследователям и инженерам, разрабатывающим системы синтеза речи и голосовые интерфейсы, где важна скорость генерации без потери разборчивости, например, для приложений с откликом в реальном времени. Это исследовательская статья на arXiv, а не готовый продукт, поэтому ценность пока в самой архитектурной идее, а не в готовом к использованию инструменте.

Как это применить

Практический смысл метода, в архитектуре: последовательность токенов аудиокодека делится на блоки, внутри блока запускается маскированная диффузия, блоки обрабатываются друг за другом, а при генерации токены внутри блока предсказываются параллельно. Это и даёт заявленный RTF 0.15, генерация занимает заметно меньше времени, чем звучит получившееся аудио. Модель компактная (0.6 млрд параметров) и обучена на сравнительно небольшом по меркам индустрии объёме данных, 20 тысяч часов. Авторы не сообщают о выпуске кода, весов модели или демо, так что воспроизвести или применить решение напрямую пока нельзя, доступно только описание подхода в статье.

Можно ли доверять

Источник, сама статья на arXiv, текст прочитан полностью. Но заявление о «конкурентоспособных результатах» на бенчмарке SeedTTS-eval носит качественный характер: конкретных числовых значений метрик и прямого сравнения с определёнными базовыми системами (авторегрессионными или неавторегрессионными) в статье нет. Институциональная принадлежность ни одного из семи авторов не указана, а сама публикация, препринт, не прошедший рецензирование.

Риски и подводные камни

RTF 0.15 характеризует только скорость, а не качество: без метрик разборчивости и естественности речи (WER, MOS и подобных) и без сравнения с конкретными конкурирующими системами судить, насколько DLLM-TTS реально лучше или хуже существующих решений, преждевременно. Формулировка «конкурентоспособные результаты» без цифр, типичная для препринтов осторожная оценка, которую стоит воспринимать именно как предварительную. Неизвестно также, на каких языках модель обучалась и оценивалась, и планируют ли авторы публиковать код, веса или демо.