Стартап Tokenless (YC S26) запустил роутер, который срезает счёт за LLM вдвое

Стартап Tokenless (батч Y Combinator S26) выпустил на Hacker News («Launch HN») продукт-роутер для запросов к языковым моделям. Идея: сервис ставится вместо прямого обращения к API модели (совместим с форматами OpenAI и Anthropic, то есть подключается заменой пары строк конфигурации, без переписывания кода) и для каждого запроса параллельно опрашивает сразу группу моделей, следя за ходом их рассуждения. Как только одна из моделей явно выходит на правильный путь, Tokenless выбирает её ответ и отменяет остальные, клиент платит только за фактически использованную модель, а не за весь параллельный прогон.

На лендинге приведены собственные бенчмарки на публичных агентных тестах в сравнении с лучшими опубликованными результатами моделей-конкурентов. По доле решённых задач (solve rate): Tokenless Pro, 40,2%, GPT-5.6 Sol, 33,0%, Claude Opus 5, 32,8%, Tokenless Ultra Saver, 30,9%, Claude Fable 5, 26,8%, Gemini 3.6 Flash, 24,5%. По средней цене за задачу: Gemini 3.6 Flash, $0,57, Claude Opus 5, $1,50, Tokenless Ultra Saver, $1,64, Tokenless Pro, $2,25, GPT-5.6 Sol, $2,58, Claude Fable 5, $3,32. То есть по заявлению компании старший тариф Tokenless Pro решает больше задач, чем любая из перечисленных фронтир-моделей, и при этом стоит дешевле GPT-5.6 Sol и Claude Fable 5 (хотя дороже Claude Opus 5 и Gemini 3.6 Flash); младший тариф Ultra Saver держится в той же ценовой зоне, что Claude Opus 5, с чуть более низкой долей решённых задач.

На странице также встроен калькулятор-пример: компания с текущим счётом за LLM $40 тыс./мес после подключения Tokenless получила бы новый счёт около $26 тыс./мес, экономия $14 тыс./мес, то есть 34% при переброске 42% запросов на более дешёвые модели. Это иллюстративный расчёт на редактируемых предположениях о маршрутизации и опубликованных ценах за токены, а не раскрытый результат конкретного клиента. Отдельно на странице указан тренд роста расходов компаний на ИИ (индекс Ramp AI Index, +11% в месяц) как обоснование, почему экономия на инференсе становится всё актуальнее.

Основатели описывают себя как исследователей ИИ из Google DeepMind, Принстона и Калифорнийского университета в Беркли; проект поддержан Y Combinator. На момент сбора данных пост на Hacker News набрал 56 очков и 50 комментариев примерно за 13 часов.

Ключевые факты

  • Tokenless (YC S26) запустил роутер запросов к LLM: один запрос параллельно уходит нескольким моделям, отслеживается ход их рассуждения, выбирается та, что явно на верном пути, остальные отменяются, платить нужно только за выбранную модель
  • Сервис совместим с форматами API OpenAI и Anthropic, подключается заменой адреса эндпоинта, без переписывания интеграции
  • По собственным бенчмаркам на публичных агентных тестах тариф Tokenless Pro решает 40,2% задач против 33,0% у GPT-5.6 Sol и 32,8% у Claude Opus 5, при цене $2,25 за задачу, дешевле GPT-5.6 Sol ($2,58) и Claude Fable 5 ($3,32)
  • Пример-калькулятор на лендинге: счёт $40 тыс./мес превращается в $26 тыс./мес (экономия $14 тыс., 34%) при переброске 42% запросов на другие модели, это иллюстрация на редактируемых допущениях, а не раскрытый результат реального клиента
  • Основатели, по их описанию, исследователи из Google DeepMind, Принстона и UC Berkeley; проект из батча Y Combinator S26

Почему это важно

Счета за обращения к языковым моделям становятся заметной статьёй бюджета у компаний, которые строят продукты на ИИ: расходы растут (на лендинге упомянут тренд Ramp AI Index, плюс около 11% в месяц), а большая часть реальных запросов не требует самой мощной и самой дорогой модели. Идея разделить трафик между несколькими моделями и платить только за фактически подошедшую отвечает на этот запрос напрямую, а не абстрактно.

Кому это важно

В первую очередь, командам, у которых инференс LLM это заметная статья расходов: продукты с ИИ-агентами, высоконагруженные API-интеграции, инфраструктурные и платформенные инженеры, выбирающие между прямой привязкой к одному провайдеру модели и прослойкой-роутером поверх нескольких.

Как это применить

Интеграция описана как замена адреса эндпоинта на совместимый с OpenAI или Anthropic, без переписывания кода. У сервиса заявлено два тарифных режима: Tokenless Pro (акцент на качество и максимальную долю решённых задач) и Tokenless Ultra Saver (акцент на минимальную цену). Компания предлагает демонстрацию с расчётом экономии на реальном трафике клиента.

Можно ли доверять

Все цифры, бенчмарки solve rate, цена за задачу и пример экономии $40 тыс. → $26 тыс., опубликованы самой компанией на собственном лендинге; методология сравнения с «лучшим опубликованным результатом» каждой модели-конкурента не раскрыта подробно, а расчёт экономии прямо описан как оценка на редактируемых допущениях о маршрутизации и опубликованных ценах, а не как аудированный результат клиента. Независимого подтверждения цифр на момент публикации нет.

Риски и подводные камни

Параллельный опрос нескольких моделей на каждый запрос с последующей отменой части из них добавляет сложность и потенциальную задержку по сравнению с прямым обращением к одной модели; итоговая экономия сильно зависит от структуры трафика конкретной компании, а не гарантирована для любого профиля запросов; переход на роутер меняет точку зависимости, вместо привязки к одному провайдеру модели появляется зависимость от прослойки-маршрутизатора; заявленные показатели, самостоятельно опубликованные бенчмарки без независимого аудита.

«Большинству запросов не нужна флагманская модель.»

— Tokenless, с лендинга продукта