Nari Labs разогнала Qwen3-TTS до задержки менее 50 мс и цены в 50 раз ниже ElevenLabs

Стартап Nari Labs (резидент Y Combinator) выпустил и открыл исходники серверной реализации для модели синтеза речи (TTS) Qwen3-TTS CustomVoice на 1,7 млрд параметров. На одной видеокарте NVIDIA H100 SXM система держит 10 запросов в секунду при p95-задержке до первого звука (TTFA) менее 50 миллисекунд, а при росте нагрузки до 20 запросов в секунду задержка остаётся ниже 100 миллисекунд. Пропускная способность при 10 запросах в секунду, около 630 символов в секунду.
Авторы сравнили свою реализацию с четырьмя другими серверными движками для той же модели, vLLM-Omni, SGLang-Omni, VoxServe и M*, на одинаковой синтетической нагрузке (пуассоновский поток запросов, каждый прогон по пять минут). После настройки всех движков под низкую задержку только VoxServe тоже уложился в 50 мс при 1 запросе в секунду; при 1 запросе в секунду остальные три этого не показали. При нагрузке около 6 запросов в секунду задержка всех сравниваемых движков поднимается примерно до 100 мс и выше, тогда как реализация Nari Labs держит порог ниже 100 мс вплоть до 20 запросов в секунду.
При аренде одной видеокарты H100 SXM за $4,29 в час и полной загрузке система Nari Labs даёт оценочную стоимость около $2 за миллион символов синтезированной речи (оценка не учитывает сеть, простой оборудования и эксплуатационные расходы). Для сравнения авторы приводят цены конкурентов: ElevenLabs V3, $100 за миллион символов, Cartesia Sonic 3.5, $49 за миллион символов при более высокой задержке первого звука, чем у Nari Labs. То есть по заявленным цифрам решение Nari Labs выходит примерно в 50 раз дешевле ElevenLabs V3 и почти в 25 раз дешевле Cartesia Sonic 3.5.
Технически модель Qwen3-TTS состоит из трёх модулей: Talker генерирует первый токен кодовой книги для каждого аудиокадра, Code Predictor достраивает оставшиеся 15 токенов кадра (фиксированное число шагов), а каузальный Codec превращает токены в аудиоволну. Большинство существующих реализаций разделяют обработку на два этапа, Talker с Code Predictor вместе и отдельно Codec. Nari Labs пошла дальше: все три модуля работают как независимо планируемые задачи под одним общим планировщиком (идея частично вдохновлена системой M*, описанной в статье на arXiv). Это позволяет планировщику на лету решать, что выполнить следующим, Talker, шаг Code Predictor или задачу Codec, у которой подходит дедлайн воспроизведения, и группировать в один пакет запросы, ожидающие одного и того же модуля.
Среди отдельных оптимизаций: обрезка ведущей тишины в начале аудио (даёт около 80 мс выигрыша по задержке), настройка размера аудиочанков (маленькие чанки ускоряют первый звук, крупные, облегчают пакетную обработку), фиксация цикла генерации Code Predictor в единый CUDA-граф с заранее выделенным KV-кэшем и Triton-ядром внимания под короткий контекст, а также кэширование состояния Codec, чтобы не пересчитывать всю историю кадров заново при каждом новом чанке. Отдельно система поддерживает потоковую подачу входного текста, синтез речи может начаться до того, как апстрим-LLM закончила генерировать полный ответ.
Nari Labs позиционирует Qwen3-TTS как первый шаг в более широкой работе над мультимодальным инференсом, компания заявляет о планах распространить подход на изображения, видео и world-модели. Ранее выпущенная открытая TTS-модель компании, Dia, была скачана более двух миллионов раз и занимала первое место на Hugging Face. Команда описывает себя как выходцев из Y Combinator, KRAFTON и NAVER с публикациями на NeurIPS и ICLR и тремя золотыми медалями IOI и ICPC.
Ключевые факты
- Реализация сервера для Qwen3-TTS 1.7B от Nari Labs держит p95-задержку первого звука ниже 50 мс при 10 запросах в секунду и ниже 100 мс при 20 запросах в секунду на одной H100 SXM.
- Оценочная стоимость, около $2 за миллион символов при полной загрузке против $100 у ElevenLabs V3 и $49 у Cartesia Sonic 3.5 (при более высокой задержке у последней).
- Из пяти сравненных движков (свой, vLLM-Omni, SGLang-Omni, VoxServe, M*) при 1 запросе в секунду порог 50 мс держали только реализация Nari Labs и VoxServe; при 6 запросах в секунду все остальные поднимаются до ~100 мс и выше.
- Ключевое архитектурное решение, объединить три модуля модели (Talker, Code Predictor, Codec) под одним общим планировщиком вместо раздельной обработки в два этапа.
- Код реализации и методика бенчмарка выложены в открытый доступ; у Nari Labs уже есть открытая TTS-модель Dia с более чем двумя миллионами скачиваний и первым местом на Hugging Face.
Почему это важно
Низкая задержка синтеза речи, узкое место любого голосового ИИ-агента: пока система молчит дольше нескольких десятков миллисекунд, разговор ощущается как звонок с человеком-роботом, а не как живой диалог. Nari Labs показывает, что с открытой моделью Qwen3-TTS и собственной серверной обвязкой можно на одной видеокарте держать задержку ниже 50 мс, то есть на уровне или лучше закрытых коммерческих сервисов вроде ElevenLabs, и при этом кратно снизить стоимость синтеза.
Кому это важно
В первую очередь, разработчикам голосовых агентов и продуктов реального времени (колл-центры, ассистенты, речь-в-речь пайплайны), которым нужна и низкая задержка, и предсказуемая цена при масштабировании. Также релевантно инженерам инференс-инфраструктуры, которые проектируют серверы для мультимодальных моделей: сама методика, единый планировщик для разнородных модулей одной модели, переносима за пределы конкретно TTS.
Как это применить
Реализация и бенчмарк открыты, так что команду можно развернуть на собственной видеокарте H100 (или аналогичной) и получить сопоставимые по духу цифры задержки и пропускной способности вместо аренды закрытого API. Указанная стоимость ($4,29 в час за инстанс H100 SXM, ~$2 за миллион символов), это оценка при полной загрузке одной карты и без учёта сети, простоя и эксплуатационных расходов, так что для реальной эксплуатации нужно закладывать запас поверх этой цифры.
Можно ли доверять
Бенчмарк и его интерпретацию публикует сама компания-разработчик реализации, сравнивая себя с чужими открытыми движками (vLLM-Omni, SGLang-Omni, VoxServe) и системой M*, независимой верификации цифр в источнике нет. Сами авторы делают оговорку в сноске: несмотря на приложенные усилия по настройке конкурентов, не исключено, что для какого-то из них найдётся конфигурация, которая слегка обгонит результат Nari Labs.
Риски и подводные камни
В источнике нет ни одной метрики качества звука (например, MOS-оценки), сравнение идёт только по задержке, пропускной способности и цене, так что более быстрый и дешёвый вариант не обязательно звучит так же хорошо, как альтернативы. Также не сказано, работает ли эта реализация уже в продакшене с платящими клиентами, речь идёт именно об открытом коде и бенчмарке, а не о готовом коммерческом сервисе.