Stratechery: почему китайская Kimi K3 не угрожает Anthropic и OpenAI

Поводом для колонки стал спор в X о модели Kimi K3, очередной открытой китайской модели, приближающейся к уровню лучших закрытых аналогов. Автор Stratechery утверждает: реакция на китайские модели сильно преувеличена, если смотреть на неё через экономику, а не через хайп.

Ключевое разграничение, R&D против COGS (себестоимости обслуживания). R&D, фиксированные расходы на разработку модели: потратили миллион долларов, он потрачен независимо от выручки. COGS, расходы на инференс (генерацию токенов), и они прямо пропорциональны выручке: если генерация токенов на 1 доллар выручки стоит 50 центов, то при выручке в 100 млн долларов COGS составит 50 млн, а при 100 тысячах, 50 тысяч. Отсюда вывод: открытые веса не означают бесплатное обслуживание. Kimi K3 стоит 3 доллара за миллион входных токенов и 15 долларов за миллион выходных, дешевле условной модели "Sol" (5 и 30 долларов соответственно), но это может быть неправильной метрикой сравнения.

Глава Nvidia Дженсен Хуанг называет чипы компании "фабриками токенов" и предлагает мерить всё в токенах в секунду и стоимости токена, логика, которая работала в первую эру ИИ (ChatGPT), когда токены шли напрямую пользователю. Во вторую эру, эру рассуждающих моделей, это ломается: модели тратят разное число токенов на цепочки рассуждений, чтобы прийти к одному и тому же ответу. По данным автора, Kimi якобы тратит заметно больше токенов, чем Sol, что нивелирует её ценовое преимущество. Товар в этой логике, не токен, а интеллект (правильный ответ): если и Kimi, и Sol дают верный ответ, этот ответ взаимозаменяем, а разница в токенах, это разница в себестоимости.

Себестоимость интеллекта складывается из пяти факторов: размер модели (сколько памяти и ускорителей нужно на одну реплику), эффективность вычислений (архитектурные решения вроде mixture-of-experts), эффективность памяти (сокращение KV-кэша), эффективность обслуживания (батчинг, планирование, кэширование префиксов) и эффективность токенов (сколько токенов нужно на верный ответ). Для многих практических задач, например, простого CRUD-приложения, интеллект уже становится товаром: несколько провайдеров решают её одинаково хорошо, и прибыль в такой ситуации определяется не ценой, а структурой издержек.

Автор поясняет механику товарных рынков на примере трёх поставщиков с себестоимостью 10, 15 и 20 долларов за единицу: при спросе на 25 единиц по цене 20 долларов первый поставщик зарабатывает 10 долларов с единицы, второй, 5, третий, 0 и рискует банкротством. Рыночная цена определяется себестоимостью самого дорогого поставщика, необходимого для покрытия спроса.

Сейчас, однако, эта логика к рынку ИИ-моделей не применяется: спрос превышает предложение из-за нехватки вычислительных мощностей. Nvidia получает высокую маржу, её клиенты вроде SpaceXAI перепродают вычисления с наценкой Anthropic, а та платит наценку, потому что сама продаёт токены ещё дороже. При этом у Anthropic и OpenAI, по мнению автора, вероятно, одна из самых низких себестоимостей интеллекта фронтир-уровня благодаря возможностям моделей, масштабу обслуживания и эффективности по токенам: они выводят модели такого уровня на месяцы раньше конкурентов и одновременно оптимизируют издержки на них же. Рынок пока не воспринимает интеллект как товар: спрос сфокусирован именно на Anthropic и OpenAI, а не на более слабых моделях, отсюда и продажа мощностей от SpaceXAI и Meta в пользу Anthropic. В долгосрочной перспективе лидер фронтира лучше всех позиций для доминирования и на нефронтирных рынках, которые представляют собой просто фронтир минус несколько месяцев.

Вывод автора: нынешняя разница в цене, это "ценовой зонтик", порождённый дефицитом вычислений, а не тем, что китайские модели реально дешевле в обслуживании по предельным издержкам. Далее автор объясняет, почему сами фронтир-лаборатории всё же паникуют из-за китайских моделей. Первая причина, инерция мышления: пока обучение моделей потребляло больше GPU, чем инференс, лабораториям было критично максимизировать выручку от инференса, чтобы финансировать следующий цикл обучения, отсюда высокие цены. Но по мере того как рынок инференса будет расти быстрее затрат на обучение (даже если сами эти затраты продолжат расти), лаборатории смогут окупаться за счёт объёма, а не цены, этому способствует взрывной рост агентных сценариев использования. Вторая причина, которую автор начинает раскрывать: интеллект, не идеальный товар отчасти потому, что применение интеллекта делает его умнее, а тот, кто ведёт инференс, тем самым получает дополнительное преимущество, на этом месте текст источника обрывается.

Ключевые факты

  • Спор в X вокруг открытой китайской модели Kimi K3, приближающейся к уровню лучших закрытых моделей, стал поводом для разбора экономики инференса на Stratechery
  • Ключевое разграничение: R&D, фиксированные затраты на разработку модели, COGS, себестоимость инференса, прямо пропорциональная выручке; открытые веса не значит бесплатное обслуживание
  • Kimi K3 стоит 3$/млн входных и 15$/млн выходных токенов против 5$/30$ у условной модели Sol, но, по данным автора, тратит заметно больше токенов на тот же результат, что нивелирует ценовое преимущество
  • Себестоимость интеллекта складывается из пяти факторов: размер модели, эффективность вычислений, эффективность памяти, эффективность обслуживания и эффективность токенов
  • Сейчас рынок фронтир-моделей не подчиняется законам товарного рынка из-за дефицита вычислений; у Anthropic и OpenAI, по мнению автора, одна из самых низких себестоимостей интеллекта фронтир-уровня, реакция на китайские модели преувеличена

Почему это важно

Материал возвращает в фокус старую, но подзабытую в эпоху ИИ-хайпа логику: у ИИ-сервисов, в отличие от классического софта, есть ненулевая себестоимость обслуживания (COGS), и именно она, а не цена доступа к весам модели, определяет, кто выиграет ценовую конкуренцию. Появление сильных открытых китайских моделей вроде Kimi K3 выглядит угрозой для Anthropic и OpenAI на первый взгляд, но при разборе себестоимости токенов и эффективности рассуждений картина куда сложнее.

Кому это важно

Тем, кто строит бизнес на API моделей и должен понимать реальную unit-экономику, а не сравнивать модели по цене за токен на бумаге; инвесторам и аналитикам, оценивающим устойчивость бизнес-моделей Anthropic, OpenAI и открытых китайских проектов; самим лабораториям, формирующим ценовую стратегию на фоне роста агентных сценариев.

Как это применить

При выборе модели для продакшена сравнивать не цену за токен, а совокупную стоимость получения правильного ответа, с учётом того, сколько токенов рассуждений реально тратит модель на задачу. При оценке "дешёвых" открытых моделей закладывать реальные расходы на инференс (память, ускорители, батчинг), а не считать веса бесплатным ресурсом.

Можно ли доверять

Это авторская экономическая колонка на Stratechery, а не эмпирическое исследование: числа по стоимости токенов Kimi K3 и "Sol" приведены как иллюстрация, а утверждение о том, что Kimi тратит больше токенов на ответ, подано автором со ссылкой "по имеющимся данным", без указания источника измерений. Логика COGS-против-R&D и разбор товарных рынков, устоявшийся аналитический фреймворк, но выводы о конкурентном положении Anthropic и OpenAI, интерпретация автора.

Риски и подводные камни

Аргумент строится на предположении о будущем росте рынка инференса быстрее затрат на обучение, это прогноз, а не факт. Пример с тремя поставщиками и ценами 10/15/20 долларов, упрощённая иллюстрация механики товарных рынков, а не расчёт по реальным данным индустрии. Текст источника обрывается на середине второго довода о том, почему интеллект, не идеальный товар, поэтому этот аргумент раскрыт не полностью.

«Я сильно сомневаюсь, что китайские модели дешевле в обслуживании по предельным издержкам, они просто кажутся дешевле, потому что Anthropic и OpenAI настолько ограничены по мощностям, что берут гораздо больше, чем брали бы при достаточном предложении для покрытия спроса на интеллект.»

— автор колонки Stratechery

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.