Speko запустил роутер для голосовых ИИ-моделей по образцу OpenRouter

Speko, стартап, получивший поддержку Y Combinator (батч S26), запустил на Hacker News сервис-роутер для голосового ИИ: он объединяет модели распознавания речи (speech-to-text) разных провайдеров под одним API и сам решает, какую модель вызвать, исходя из опубликованных измерений по конкретному языку и задаче, а не из общего рейтинга вендора на английском языке. Сам сервис описывает себя как аналог OpenRouter, но для голосового ИИ.
На сайте опубликована таблица точности (word error rate, WER, доля ошибочно распознанных слов) и цены за минуту для полутора десятков моделей. Лидер по точности, Universal-3.5 Pro от AssemblyAI: 2,0% WER при цене $0,0075 за минуту. Дальше идут GPT-4o Transcribe от OpenAI (2,3% WER, $0,0060/мин), GPT-4o-mini Transcribe (2,7% WER, $0,0030/мин) и Qwen3-ASR от Alibaba (2,8% WER, $0,0054/мин). Самая дешёвая модель в таблице, Velma 2 от Modulate: $0,0010 за минуту при WER 4,4%. Ещё несколько моделей, Realtime STT-1 от Inworld (3,3% WER, $0,0025/мин) и Chirp 3 от Google (3,9% WER, $0,0160/мин), занимают промежуточное положение по соотношению цены и точности. Для трёх моделей, Flux от Deepgram, Scribe v2 Realtime от ElevenLabs и GPT Live Transcribe от OpenAI, в таблице указана только цена ($0,0065, $0,0065 и $0,0170 за минуту соответственно), а показатель WER не приведён.
API у Speko совместим по формату с API OpenAI: чтобы подключить уже используемый фреймворк, достаточно заменить базовый URL на https://api.speko.ai/v1 и указать ключ Speko. В примере на сайте показано подключение через фреймворк LiveKit Agents, где сервисы распознавания речи (STT), языковой модели (LLM) и синтеза речи (TTS) настраиваются через один и тот же OpenAI-совместимый клиент с параметром model: 'auto', то есть выбор конкретной модели Speko берёт на себя. Отдельно указана команда для подключения Speko как MCP-сервера к AI-агентам: claude mcp add --transport http speko https://mcp.speko.ai/mcp.
На момент публикации пост набрал 95 очков и 54 комментария на Hacker News.
Ключевые факты
- Speko, стартап из батча Y Combinator S26, запустил единый API-роутер, который объединяет модели распознавания речи разных провайдеров под одним ключом.
- Роутер выбирает модель по опубликованным бенчмаркам WER (доля ошибок распознавания) для конкретного языка и задачи, а не по общему рейтингу вендора на английском.
- Лидер по точности, Universal-3.5 Pro от AssemblyAI: 2,0% WER при $0,0075/мин; следом GPT-4o Transcribe (2,3%, $0,0060/мин) и GPT-4o-mini Transcribe (2,7%, $0,0030/мин) от OpenAI.
- Самая дешёвая модель в таблице, Velma 2 от Modulate: $0,0010 за минуту при WER 4,4%.
- API совместим по формату с OpenAI: существующие фреймворки (пример, LiveKit Agents) подключаются заменой базового URL и ключа; есть также вариант подключения как MCP-сервера к AI-агентам.
Почему это важно
Рынок распознавания речи раздроблен: у каждого провайдера, Deepgram, AssemblyAI, OpenAI, Google, ElevenLabs и других, свой API и своя точность, которая к тому же сильно различается по языкам. Вендоры обычно публикуют показатели на английском, а для других языков данных почти нет. Speko предлагает решить это единой точкой входа: один API, а выбор конкретной модели под язык и задачу берёт на себя роутер, опираясь на собственные измерения.
Кому это важно
В первую очередь, разработчикам голосовых ИИ-агентов и продуктов на базе распознавания речи: им не нужно самим тестировать и переключать между собой десятки провайдеров STT под разные языки и бюджеты. Полезно и командам, которые уже строят голосовые пайплайны на фреймворках вроде LiveKit Agents и хотят добавить многоязычность без переписывания интеграции под каждого вендора.
Как это применить
Подключение, замена базового URL на https://api.speko.ai/v1 и ключа Speko в уже используемом клиенте OpenAI-совместимого API; параметр модели можно задать как auto, и тогда выбор конкретной STT-, LLM- или TTS-модели берёт на себя роутер. Для AI-агентов Speko также доступен как MCP-сервер через команду claude mcp add --transport http speko https://mcp.speko.ai/mcp. Условия тарификации самого Speko (есть ли наценка сверх цены провайдера) на сайте не раскрыты, указана только цена за минуту у каждой из подключённых моделей.
Можно ли доверять
Источник, собственная лендинг-страница Speko и её Launch HN-пост, набравший 95 очков и 54 комментария на Hacker News; независимого подтверждения цифр из бенчмарка нет. Поддержка Speko со стороны Y Combinator (батч S26), подтверждённый факт из текста, но состав команды, число сотрудников и локация компании в источнике не указаны. Сами цифры точности и цены, измерения самой Speko, а не независимой лаборатории, и относиться к ним стоит с поправкой на то, что публикует их заинтересованная сторона.
Риски и подводные камни
Бенчмарк точности и цены опубликован самим Speko, компанией, заинтересованной показать выгоду своего сервиса, независимой проверки в источнике нет. В таблице для трёх моделей (Flux, GPT Live Transcribe, Scribe v2 Realtime) не указан WER, сравнить их точность с остальными по этим данным нельзя. Наличие и размер собственной наценки Speko поверх цены провайдеров в тексте не раскрыты. Данные о финансировании ограничены формулировкой «поддержан Y Combinator», конкретная сумма раунда, команда и локация компании в источнике не приведены.
«Какую модель вызывать, для каждого языка и каждой задачи, определяется по опубликованным измерениям, а не по англоязычному рейтингу вендора.»
— Speko