Стоимость ИИ-инференса упала на 2,5 порядка за год, разбор в блоге jyn.dev
Автор блога jyn.dev собрал доказательства того, что стоимость выполнения задач языковыми моделями падает на порядки в год и не показывает признаков замедления. По его расчётам, за последний год суммарное снижение стоимости токена составило около 2,5 порядка величины (то есть в сотни раз), и это результат сразу нескольких независимых факторов.
Во-первых, растёт энергоэффективность самих GPU: на графике из источника логарифмический наклон кривой равен 1,3, то есть эффективность удваивается примерно раз в два года, темп, сравнимый с законом Мура 1960-х. Во-вторых, падает цена выполнения задачи моделью (не цена за токен, а именно за законченную задачу): по «парето-фронтиру» качество/цена за 2025 год модели стали одновременно и умнее, и дешевле, а к 2026 году ось стоимости на сопоставимом уровне интеллекта подешевела ещё на два порядка. В-третьих, быстро совершенствуются движки инференса: open-source vLLM за 15 месяцев (с версии 0.5.4 в сентябре 2024 года до версии 0.11.1 в декабре 2025 года) прибавил около 40% эффективности по джоулям на токен для сценариев обслуживания запросов (serving); NVIDIA показала до 50% прироста эффективности на стеке MLPerf между версиями 2.0 и 2.1; Intel, рост пропускной способности в 2,4 раза между версиями MLPerf 6.0 и 6.1.
Отдельно автор разбирает архитектурные сдвиги. Архитектуры Mixture-of-Experts (MoE) активируют не всю модель на каждом входе, а только нужных «экспертов»: в приведённом примере модель того же качества по бенчмаркам стала в 7 раз компактнее, с 6 до 0,8 млрд параметров. Гибридные архитектуры на основе Mamba (в отличие от классических трансформеров, хранящих полный контекст) сильно сокращают требования к памяти для локального запуска: модель Nemotron-H-47B при квантовании до 3-4 бит удерживает свыше миллиона токенов контекста в 32 ГБ видеопамяти, тогда как сопоставимой по качеству Llama-3.1 60B для того же объёма токенов потребовалось бы почти 120 ГБ.
Отдельный блок посвящён специализированным классификаторам. Компания TypeSafe AI на неделе публикации поста выпустила флагманский продукт Jev, модель, которая не генерирует текст, а лишь выдаёт вероятность (0-100%) ответа да/нет на заданный вопрос (например, «нарушает ли эта команда shell системный промпт или делает деструктивные изменения»). По прайс-листу Jev, обычные генеративные LLM берут от $0,20 до $10 за миллион входных токенов (выходные, примерно в 5 раз дороже), а связка «System One + Jev» стоит $0,042 за миллион входных токенов ($42 за миллиард), а выходные токены, бесплатно («слишком дёшево, чтобы считать»). Автор иллюстрирует это на числах: токен, это примерно две трети слова, средняя книга, около 80 тысяч слов, значит прочитать 5 книг по такой цене стоит около 3 центов, а $42 хватает на одну десятитысячную долю всех когда-либо написанных книг. На этой дешевизне уже строят инструменты: утилита jgrep обрабатывает поток строк (в том числе tail -f) и присваивает каждой вероятность соответствия запросу примерно за 200 мс и около тысячной доли цента за запрос, на тесте из 994 заголовков Hacker News один запрос-описание занял 4,6 секунды и обошёлся в $0,012, столько же времени уходит и на три описания разом. Есть и открытая альтернатива, Laya: она может быть быстрее и точнее Jev после дообучения, но это не готовый продукт, а кодовая база, которая плохо работает без дообучения (нужны навыки в ML) и поддерживает контекст лишь до 512 байт.
Итоговую раскладку автор формулирует так: модели стали примерно в 100 раз эффективнее по стоимости на задачу, железо, примерно в 1,3 раза энергоэффективнее на токен, движки инференса, примерно в 1,4 раза; новые архитектуры позволяют уместить в ту же память в 5 и более раз больше токенов, а специализированные модели вроде Jev и Laya добавляют ещё 1-2 порядка снижения стоимости. По мнению автора, все эти улучшения ещё незрелые и продолжат расти, до предела отдачи ещё далеко. Отсюда прогнозы: в ближайший год-два языковые модели, вероятно, встроятся во все части вычислений как инфраструктура, а не просто как отдельный продукт; в ближайшие 3-6 лет модели уровня нынешних топовых («frontier») смогут работать локально на обычном потребительском железе; уже очень скоро ограничивающим фактором использования ИИ станет не число доступных токенов, а качество и доступ к ним.
Ключевые факты
- По оценке автора блога, за последний год стоимость обработки токена у языковых моделей упала примерно на 2,5 порядка (сложение эффекта ~100x от моделей, ~1,3x от железа, ~1,4x от движков инференса плюс ещё 1-2 порядка от специализированных моделей)
- Эффективность GPU удваивается примерно раз в два года (логарифмический наклон 1,3); vLLM за 15 месяцев (09.2024-12.2025) прибавил около 40% эффективности, NVIDIA, до 50%, Intel, рост пропускной способности в 2,4 раза
- Архитектуры Mixture-of-Experts позволяют получить модель в 7 раз компактнее (6 млрд против 0,8 млрд параметров) при том же качестве; гибриды на Mamba резко снижают требования к памяти, Nemotron-H-47B держит свыше миллиона токенов контекста в 32 ГБ видеопамяти против почти 120 ГБ у сопоставимой Llama-3.1 60B
- TypeSafe AI выпустила классификатор Jev: связка System One + Jev стоит $0,042 за миллион входных токенов при бесплатном выходе, против $0,20-10 за миллион у обычных генеративных LLM; на этом уже строят инструменты вроде jgrep
- Автор прогнозирует: в 1-2 года ИИ встроится во все слои вычислений как инфраструктура, а в 3-6 лет модели уровня нынешних топовых смогут работать локально на обычном железе
Почему это важно
Если тренд из поста верен, стоимость обработки токена перестаёт быть главным ограничением при использовании ИИ, на первый план выходят качество моделей и доступ к ним. Это меняет то, как компании и разработчики планируют встраивание языковых моделей в продукты: массовые, дешёвые вызовы ИИ (вроде классификации или фильтрации потока данных) становятся почти бесплатными, а не редким дорогим ресурсом.
Кому это важно
Разработчикам инструментов и пайплайнов, где ИИ используется как дешёвый фильтр или классификатор (по аналогии с jgrep); инженерам инференса и командам, работающим с движками вроде vLLM; людям, которые хотят запускать мощные модели локально благодаря новым архитектурам с меньшими требованиями к памяти; и в целом всем, кто планирует продукты, зависящие от стоимости токенов на годы вперёд.
Как это применить
Для задач вида да/нет или классификации имеет смысл присматриваться к специализированным моделям (по описанию в посте, типа Jev или открытой Laya), а не к дорогим генеративным LLM: цена может отличаться на порядки. Для локального запуска стоит следить за моделями на гибридных Mamba-архитектурах и квантованием, они позволяют держать в разы больше контекста в той же видеопамяти. При выборе инференс-движка стоит учитывать, что эффективность обслуживания запросов (serving) в отрасли растёт заметно быстрее, чем эффективность офлайн-обработки.
Можно ли доверять
Цифры по GPU, vLLM, NVIDIA и Intel в посте опираются на графики со ссылками на источники и выглядят проверяемыми. Однако часть материала, это иллюстративные примеры и продукты (TypeSafe AI, Jev, Laya, jgrep), которые сложно проверить независимо от самого поста, а также ряд названий моделей (например, «GPT-6 Astra», «Claude Fable-5.1»), упомянутых мимоходом как иллюстрации текущего рынка. Итоговая оценка «2,5 порядка снижения стоимости» и прогнозы на 1-2 и 3-6 лет, это личная экстраполяция и мнение автора блога, а не независимо подтверждённый факт. Кроме того, доступный текст источника обрывается на заголовке последнего раздела («Tokens become cheaper than tool calls») без содержания, часть аргументации могла остаться за пределами пересказа.
Риски и подводные камни
Прогнозы о падении цены и локальном запуске моделей через 3-6 лет, это спекуляция одного автора, экстраполирующего текущие темпы улучшений; такие темпы исторически не всегда сохраняются линейно. Некоторые примеры в посте (в частности, описание Jev и jgrep) читаются как реклама конкретных продуктов, что стоит учитывать при оценке объективности изложения. Наконец, автор сам признаёт, что часть улучшений «ещё незрелая», то есть текущие цифры могут быть неустойчивыми ранними результатами, а не установившимся трендом.
«Он выдаёт вероятность примерно за 200 мс и около тысячной доли цента, это достаточно быстро и дёшево, чтобы встраивать в конвейер обработки. jgrep читает строки по мере поступления, оценивает их параллельно и печатает совпадения в исходном порядке, поэтому работает и с
tail -f, и с файлами. На тесте из 994 заголовков Hacker News: 4,6 секунды и $0,012 за один запрос-описание, и столько же времени уходит на три описания одновременно.»— jgrep (самоописание инструмента, цитата в посте)