NVIDIA обновила Magpie TTS: открытые веса для 12 языков и задержка от 32 мс

NVIDIA обновила Magpie TTS: открытые веса для 12 языков и задержка от 32 мс

NVIDIA обновила Magpie TTS Multilingual, открытую модель синтеза речи (text-to-speech, TTS) на 364 млн параметров, которая теперь поддерживает 12 языков. В новом выпуске добавлены современный стандартный арабский, корейский и бразильский португальский, а качество синтеза улучшено на нескольких уже имевшихся языках за счёт обновлённых обучающих данных. Для каждого языка доступны мужской и женский голос через общее многоязычное представление голоса; расширена поддержка переключения между языками внутри фразы (code-switching) для хинди и японского, за счёт IPA-транскрипции произношения и словарей пользовательских произношений, что помогает точнее озвучивать имена и техническую терминологию.

Ключевая метрика для голосовых агентов, время до первого звука (TTFA, time to first audio): именно синтез речи становится финальным и самым заметным для пользователя звеном в цепочке распознавание речи → LLM → синтез речи. По данным документации NVIDIA TTS NIM (версия v26.07, среднее по трём прогонам, замер на собственном оборудовании), на GPU B200 Magpie выдаёт первый звук за 32 мс в однопотоковом режиме; на разных GPU NVIDIA этот показатель, от 32 до 79 мс. При 64 параллельных потоках на B200 TTFA растёт до 239 мс, при этом модель обрабатывает аудио в 320 раз быстрее реального времени воспроизведения даже под такой нагрузкой. Низкая задержка синтеза речи, по данным NVIDIA, оставляет запас в бюджете задержки для распознавания речи и работы языковой модели, так, чтобы сквозная задержка всего диалога укладывалась в целевые для естественного разговора менее 200 мс.

Низкая задержка достигнута за счёт двух архитектурных изменений. Первое, «стекирование кадров» (frame stacking): декодер предсказывает не один, а два аудиокадра за шаг, что вдвое сокращает число итераций декодера и ускоряет генерацию. Второе, «локальный трансформер» (local transformer): само по себе стекирование кадров ухудшило бы качество звука из-за зависимостей между одновременно генерируемыми токенами кодбука, и локальный трансформер моделирует эти зависимости и «дочищает» сгенерированный звук, возвращая качество. Архитектура описана в статье «Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation», представленной на конференции ICASSP 2026.

По сравнению с предыдущим выпуском на нескольких языках снизилась доля ошибок по символам (CER) и выросло сходство синтезированного голоса с эталонным (SSIM); наибольший прирост качества NVIDIA отмечает для французского и испанского. У трёх новых языков базовый уровень CER такой: у арабского, 1,62%, у корейского, 2,69%, у бразильского португальского, 2,91%.

Веса модели открыты по лицензии NVIDIA Open Model License; помимо открытого чекпоинта на Hugging Face, доступен готовый к продакшену контейнер NVIDIA NIM, именно на нём и получены приведённые цифры задержки. Модель можно дообучать под свой домен через NVIDIA NeMo. Magpie TTS, часть эталонной архитектуры NVIDIA Nemotron Voice Agent Developer Example, которая объединяет распознавание речи Nemotron Speech, синтез речи Magpie TTS, языковые и мультимодальные модели Nemotron для рассуждений и вызова инструментов, инференс-контейнеры NVIDIA NIM и инструменты дообучения NeMo, как референс для сборки голосовых агентов с прерываемым диалогом (barge-in), мультимодальным пониманием и многоагентной оркестрацией.

Ключевые факты

  • Magpie TTS Multilingual, открытая модель синтеза речи на 364 млн параметров, поддерживает 12 языков; в новом выпуске добавлены арабский (совр. стандартный), корейский и бразильский португальский
  • Время до первого звука (TTFA), 32, 79 мс в однопотоковом режиме на разных GPU NVIDIA; на B200 при 64 параллельных потоках, 239 мс при пропускной способности в 320 раз выше реального времени
  • Ошибки по символам (CER) у новых языков: арабский, 1,62%, корейский, 2,69%, бразильский португальский, 2,91%
  • Низкая задержка достигнута за счёт «стекирования кадров» (декодер предсказывает два аудиокадра за шаг вместо одного) и «локального трансформера», компенсирующего потерю качества
  • Веса открыты по лицензии NVIDIA Open Model License; модель, часть эталонной архитектуры NVIDIA Nemotron Voice Agent Developer Example вместе с Nemotron Speech, NIM и NeMo

Почему это важно

Речь остаётся последним и самым заметным пользователю звеном голосового диалога: если синтез речи медленный, весь ответ ассистента кажется медленным. NVIDIA даёт открытую модель, которую можно развернуть в своей инфраструктуре и полностью контролировать задержку, вместо того чтобы зависеть от закрытого API с непредсказуемым временем ответа.

Кому это важно

Разработчикам голосовых агентов, служб поддержки, корпоративных помощников, систем в здравоохранении, переводческих сервисов, которым нужны низкая задержка, поддержка нескольких языков одновременно и контроль над тем, где хранятся и обрабатываются данные пользователей (в том числе в изолированных от интернета контурах).

Как это применить

Открытый чекпоинт модели доступен на Hugging Face для исследований и дообучения; для продакшена NVIDIA предлагает оптимизированный контейнер NIM, показывающий приведённые цифры задержки. Дообучение под собственные голоса, произношение и терминологию, через NVIDIA NeMo. Рекомендованные параметры инференса из документации: cfg_scale = 2.5, temperature = 0.6, top_k = 80, с включённым attention prior (prior_epsilon = 0.1). Модель также встроена в референс-архитектуру NVIDIA Nemotron Voice Agent Developer Example, которую можно клонировать и адаптировать под свой сценарий.

Можно ли доверять

Материал, официальный пост NVIDIA на блоге Hugging Face, автор в источнике не указан. Цифры задержки и качества синтеза взяты из собственной документации NVIDIA (NVIDIA TTS NIM Performance documentation, версия v26.07) и карточки модели, независимой проверки этих цифр в источнике нет. Дата конкретного релиза в тексте не названа, а полные таблицы по всем GPU и языкам представлены как изображения, в тексте приведены только отдельные упомянутые значения.

Риски и подводные камни

Все данные о задержке и качестве, от самого производителя модели, без сравнения с конкурирующими TTS-решениями по названию и без независимого бенчмарка. Заявленные цифры задержки получены на GPU NVIDIA B200 и других картах NVIDIA, на другом оборудовании результат может отличаться. Стоимость развёртывания NIM или использования модели в источнике не указана.