Hugging Face запустила Open TTS Leaderboard: рейтинг открытых моделей озвучки

Hugging Face опубликовала в блоге описание Open TTS Leaderboard: рейтинга моделей синтеза речи (TTS), ориентированного на открытые и многоязычные модели. Поводом авторы называют темп выхода моделей: по состоянию на 30 сентября 2026 года на Hugging Face Hub доступно более 8 тысяч TTS-моделей, а оценка качества, по их словам, остаётся разрозненной и нестандартизированной.
Золотым стандартом авторы считают оценки человеческих предпочтений (MOS, MUSHRA), а на практике опорными точками служат рейтинги-арены, где пользователям предъявляют звучание двух моделей и просят выбрать лучшую; по набранным голосам считается рейтинг Эло, обычно по модели Брэдли, Терри. Недостатки арен, по мнению авторов: они не масштабируются вслед за выходом новых моделей, а согласованность голосующих не гарантирована (предпочтения меняются со временем, авторы приводят афоризм Гераклита о реке). Возможно, отчасти поэтому открытые модели там недопредставлены: на 30 сентября 2026 года только 16 из 92 моделей на Artificial Analysis имеют открытые веса, на Voice Arena перекос похожий. Авторы считают, что это, вероятно, отражает практические причины: для API-модели достаточно ключа, а открытую модель организатор арены должен сам развернуть, к тому же у коммерческих поставщиков больше стимулов добиваться места в рейтинге.
Open TTS Leaderboard оценивает модели объективными метриками. Разборчивость: доля ошибочных слов или символов (WER и CER) между исходным текстом и расшифровкой сгенерированного звука; расшифровку делает Qwen3 ASR, названная лучшей открытой моделью в Open ASR Leaderboard. Скорость: обратный коэффициент реального времени (RTFx) при пакетной офлайн-генерации на GPU H200 и время до первого звука (TTFA) для потоковой генерации с размером пакета 1 на H200 и на CPU. Сходство голоса: косинусное сходство (SIM) между эмбеддингами диктора WavLM у сгенерированного и эталонного фрагментов. По словам авторов, оценка модели сокращается с пары недель сбора голосов до пары часов.
Авторы подчёркивают: рейтинг не заменяет ранжирование по предпочтениям людей. WER служит заменителем разборчивости, сходство голоса оценивает сохранение тембра и манеры, но ни то ни другое напрямую не измеряет естественность, выразительность или предпочтения слушателей. Зато метрики могут подсказывать рейтингам с голосованием, какие модели включать в оценку.
В стандартном виде модели ранжируются по усреднённому WER на английских частях наборов Seed TTS Eval и CV3 Eval (zero shot). Лидерами по английскому WER при усреднении по этим двум наборам названы hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro. Графики Парето показывают баланс между WER, скоростью пакетной генерации (RTFx) и размером модели. Для других языков можно переключать ранжирование: Seed TTS Eval содержит аудио только для английского и китайского, поэтому для остальных языков берётся результат CV3 Eval. Для китайского, японского и корейского, где письмо знаковое, приводится CER, а «средний WER» по языкам, макроусреднение. Сильными многоязычными моделями названы k2-fsa/OmniVoice, fishaudio/s2-pro и FunAudioLLM/Fun-CosyVoice3-0.5B-2512.
Переключатель «Voice cloning» оставляет модели с клонированием голоса (на выбранных языках) и добавляет столбец SIM и ещё два графика Парето (сходство голоса, скорость пакетной генерации, размер). Средний WER у ряда моделей, например bosonai/higgs-tts-3-4b и openbmb/VoxCPM2, при клонировании улучшается, то есть когда дано эталонное аудио.
Вкладка «Listen» позволяет сравнивать сами сгенерированные записи, выбирая язык, набор данных, режим клонирования и модели или случайную выборку, и оставлять отзывы. Голоса сообщества авторы, возможно, позже добавят в рейтинг; для голосования нужна учётная запись Hugging Face, чтобы отсеивать спам и ботов.
Вкладка «Streaming» ранжирует модели по TTFA: сколько пользователь ждёт, пока появится воспроизводимый звук; это важно для голосовых агентов и интерактивных приложений. Для потоковых моделей это время до первого фрагмента звука, для непотоковых, до готовности всей реплики. Каждая модель запускается по одной записи (размер пакета 1) на одних и тех же 50 английских фразах из CV3-Eval, на одном оборудовании и с голосом по умолчанию; первые 3 запуска отбрасываются как прогрев, берётся медиана TTFA по остальным. По умолчанию показан H200, для небольшого, но растущего числа моделей есть результаты на CPU. Как отличную для потоковой работы и на GPU, и на CPU авторы отметили kyutai/pocket-tts.
Пока рейтинг сосредоточен на открытых моделях и на многоязычности (английский, по словам авторов, плохо подходит как показатель для других языков). Скрипты оценки обещают вскоре открыть, по образцу репозитория Open ASR Leaderboard, чтобы принимать замечания через GitHub Issues и PR.
Ключевые факты
- Open TTS Leaderboard от Hugging Face ранжирует открытые и многоязычные TTS-модели по объективным метрикам: WER/CER через Qwen3 ASR, скорость (RTFx и TTFA на H200 и CPU) и сходство голоса (SIM, эмбеддинги WavLM).
- Мотив авторов: на Hub более 8 тысяч TTS-моделей (на 30.09.2026), а на арене Artificial Analysis только 16 из 92 моделей с открытыми весами; оценка модели сокращается с пары недель до пары часов.
- По английскому WER на Seed TTS Eval и CV3 Eval лидируют hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro; сильные многоязычные: k2-fsa/OmniVoice, fishaudio/s2-pro, FunAudioLLM/Fun-CosyVoice3-0.5B-2512.
- Потоковый тест TTFA: 50 английских фраз из CV3-Eval, размер пакета 1, первые 3 запуска отброшены, берётся медиана; kyutai/pocket-tts отмечена как отличная на GPU и CPU.
- Рейтинг не заменяет оценку по предпочтениям людей: WER и сходство голоса не измеряют естественность и выразительность. Скрипты оценки обещают открыть вскоре.
Почему это важно
Число TTS-моделей растёт быстрее, чем их успевают оценивать: на Hugging Face Hub их более 8 тысяч (на 30 сентября 2026 года), а рейтинги на голосовании людей, по словам авторов, не поспевают и недопредставляют открытые модели (16 из 92 на Artificial Analysis). Единый набор воспроизводимых метрик по открытым и многоязычным моделям заполняет эту нишу. Сравнение в часах, а не в неделях, упрощает и ускоряет выбор.
Кому это важно
Разработчикам голосовых агентов и интерактивных приложений, которым важны задержка до первого звука и работа на CPU; командам, выбирающим открытую модель озвучки или клонирования голоса; авторам открытых TTS-моделей, которым сложно попасть на арены; исследователям многоязычного синтеза речи.
Как это применить
Выберите язык и режим (обычный синтез или «Voice cloning»), отсортируйте модели по WER/CER и посмотрите графики Парето, чтобы найти баланс между точностью, скоростью пакетной генерации и размером. Для голосовых агентов откройте вкладку «Streaming» и сравнивайте TTFA на H200 или CPU. Во вкладке «Listen» послушайте записи, стоящие за цифрами, и при желании проголосуйте (нужна учётная запись Hugging Face). Цены и лицензии в материале не обсуждаются.
Можно ли доверять
Материал написан самим разработчиком рейтинга, это описание его замысла, а не независимая проверка. В тексте нет числовых значений WER, CER, SIM, RTFx и TTFA по моделям, нет числа оцениваемых моделей; ссылки на открытые скрипты ещё нет, авторы лишь обещают открыть их вскоре. Утверждения о причинах недопредставленности открытых моделей на аренах авторы сами подают с оговорками («может», «вероятно»).
Риски и подводные камни
Авторы прямо отмечают: WER и сходство голоса не измеряют естественность, выразительность и предпочтения слушателей, поэтому рейтинг не заменяет оценку людьми. Основной зачёт идёт по английским частям наборов, а для языков без аудио в Seed TTS Eval используется только CV3 Eval. Потоковый тест идёт на 50 английских фразах с голосом по умолчанию; результаты на CPU есть лишь для небольшого числа моделей. Для непотоковых моделей TTFA равно времени генерации всей реплики, что надо учитывать при сравнении.