Inflect-Micro-v2 выпустили как локальный TTS на 9,36 млн параметров
Owen Song независимо разработал и выпустил Inflect-Micro-v2, компактную модель синтеза английской речи из текста с открытыми весами. В развёртываемом виде у неё 9 356 513 параметров и размер 37,53 МБ в FP32; результат, монофонический аудиосигнал 24 кГц. Модель использует один фиксированный синтетический мужской голос, поддерживает детерминированные seed-значения, обработку длинных текстов и запуск на CPU либо CUDA. Это не система клонирования голоса и не многоязычный сервис.
Автор позиционирует Micro как вариант семейства Inflect v2, ориентированный на качество при бюджете менее 10 млн параметров; Nano предназначен для размера менее 4 млн. В карточке модели приведены собственные оценки: в анонимном пользовательском сравнении Micro получил 66,2% предпочтений (21 победа, 10 поражений и 3 ничьи). Для 500 одинаковых невиданных запросов указана оценка UTMOS22 4,395 с 95-процентным бутстреп-доверительным интервалом 4,381, 4,408. Для разборчивости на новых текстах приведены 2,52% WER у Qwen3-ASR, 5,45% у Nemotron 3.5 и 2,73% у Whisper large-v3; среднее первых двух распознавателей используется как основной показатель.
Эти бенчмарки сопровождаются оговорками автора: UTMOS22, обученный предиктор, а не человеческая MOS-оценка; результаты пользовательского сравнения являются описательным свидетельством, а не формальным MOS. Скорость на CPU измерялась отдельно на инстансе Hugging Face с 8 vCPU и 32 ГБ памяти, а сравнение с другими компактными TTS не является полностью сопоставимым рейтингом из-за разных длины прогона и сред выполнения. Пакет включает код инференса, веса, тестовые запросы и отчёты, но не раскрывает конвейер формирования обучающего корпуса, приватную инфраструктуру фильтрации и полный рецепт оптимизации.
Ключевые факты
- Inflect-Micro-v2, локальный англоязычный TTS с 9 356 513 параметрами, размером 37,53 МБ в FP32 и выходом 24 кГц в моно.
- Модель запускается на CPU или CUDA, поддерживает фиксированный seed и разбивает длинный текст на фрагменты по пунктуации.
- Автор сообщил о 66,2% предпочтений в анонимном сравнении: 21 победа, 10 поражений и 3 ничьи.
- В опубликованной оценке разборчивости указаны WER 2,52% для Qwen3-ASR, 5,45% для Nemotron 3.5 и 2,73% для Whisper large-v3.
- Релиз доступен с открытыми весами и кодом под Apache-2.0, но детали подготовки данных и полного обучения не опубликованы.
Почему это важно
Это компактный локальный пакет синтеза речи: весь путь от текста до звуковой волны входит в поставку, а размер Micro остаётся ниже 10 млн параметров. Автор также выложил протоколы, запросы и отчёты оценки, а не только сводные числа.
Кому это важно
Разработчикам, которым нужен фиксированный английский синтетический голос без обращения к внешнему сервису, а также тем, кто запускает TTS на CPU или CUDA. Для задач с несколькими языками, несколькими голосами или клонированием голоса этот релиз не предназначен.
Как это применить
Репозиторий можно скачать через Hugging Face, установить зависимости и вызвать InflectTTS с устройством CPU или CUDA. Длинный ввод автоматически делится по пунктуации, а seed позволяет повторять результат; отдельно опубликован экспорт для ONNX Runtime с выбором CPU, CUDA или DirectML.
Можно ли доверять
Веса, код инференса, запросы для оценки и отчёты доступны публично, однако заявленные сравнения подготовлены автором релиза. Он прямо указывает, что UTMOS22 не заменяет человеческую MOS-оценку, а пользовательское сравнение не является формальным MOS; оценка скорости и сравнение с конкурентами также имеют оговорённые методические ограничения.
Риски и подводные камни
Поддерживается только один фиксированный синтетический мужской голос на английском языке. Незнакомые формулировки могут звучать менее выразительно или нестабильно, числа, сокращения, омографы и редкие имена зависят от контекста, а стыки длинных фрагментов могут отличаться от единого прохода. Автор не считает модель проверенной для медицинских, юридических, экстренных или критичных для доступности сообщений.
«Ни одна метрика не описывает качество синтеза речи полностью.»
— Owen Song, карточка модели Inflect-Micro-v2