gpt-5.6-luna и другие малые модели подешевели настолько, что потребительский ИИ становится рентабельным

Автор эссе, по тексту, сооснователь Segment вместе со своим собеседником Питером, уже несколько недель пользуется моделью gpt-5.6-luna и описывает её как впечатляюще способную, быструю (около 100 токенов в секунду) и умную: она разбирает его кодовую базу, почту и базу знаний. Главное преимущество, по его словам, цена: даже сложные исследовательские сессии, включая поиск по тысячам писем, обходятся ему в «десятки центов». Отдельно он называет модель GLM 5.3 ещё одним вариантом на границе Парето (оптимальном балансе цены и качества). Для тяжёлой работы с кодом автор по-прежнему выбирает самые дорогие и мощные модели, в тексте названы Fable 5 и 5.6 Sol, поэтому прогресс именно малых быстрых моделей, по его мнению, легко упустить из виду.
Толчком к эссе послужил вопрос нескольких инвесторов, с которыми общался автор: «Почему мы не видим больше потребительских ИИ-компаний?» Его ответ, дело в стоимости токенов. До эпохи ИИ типовой путь крупного потребительского сервиса выглядел так: сделать сравнительно дешёвый в поддержке привлекательный сайт, набрать пользователей за счёт виральности, привлечь инвестиции, масштабироваться и в итоге построить рекламную площадку, по мнению автора, так примерно устроены Google, Facebook и Snapchat. Но как только в продукт добавляется ИИ, на каждый запрос ложатся реальные расходы на вычисления (inference), и требуемый на старте капитал резко растёт.
В качестве личного теста автор регулярно строит персонализированный ежедневный новостной сайт, по запросу вида «найди в интернете информацию про @calvinfo, определи, какие новости ему могут быть интересны, собери мини-сайт с главными историями дня, ищи по Hacker News, Reddit, Twitter и другим источникам». На моделях предыдущего поколения, «уровня Sonnet», получить хоть какой-то результат стоило около $1 за прогон, при такой себестоимости брать с потребителя $30 в месяц, как берут классические подписки уровня WSJ или The Economist, экономически не оправдано, если сервис не даёт сравнимой ценности. На gpt-5.6-luna результат получается вполне достойным, а средняя стоимость прогона, около $0.10: по словам автора, именно при такой цене расчёт наконец сходится.
Вторую половину эссе автор посвящает бизнес-применению дешёвых моделей. На прогулке он обсуждал это со своим сооснователем по Segment Питером, который помимо Segment привлёк более $100 млн для Charm Industrial и недавно закрыл раунд Series A для Revoy. По наблюдению Питера, вся его работа делится на два типа: «IQ 180», редкие прорывные решения гениального уровня, и «token spewer» (дословно, «выплёвывающий токены», то есть постоянный безостановочный поток мелких действий), созвоны, подталкивание людей, разбор текучки. По оценке самого Питера, около 95% его времени уходит именно на второй тип, хотя без «гениального» технического ядра его компании, по его словам, были бы обречены.
Отсюда прогноз автора: спрос на «топовые» модели продолжит расти, особенно там, где нужны прорывы и открытия (инженерия, точные науки, обучение самих моделей), но одновременно вот-вот начнётся взрывной рост спроса на быстрые, дешёвые и «достаточно хорошие» модели. По аналогии он замечает, что и в компаниях большинство «человеческих токенов» сегодня уходит именно на то, чтобы быть отзывчивым и держать дела в движении, а не на гениальные озарения, поэтому наём людей исторически тоже смещён в сторону этого архетипа. Чтобы дешёвые модели реально заработали в бизнесе, по мнению автора, всё ещё нужны новые «обвязки» (harnesses) вокруг моделей, защита от prompt injection (внедрения вредоносных инструкций через текст запроса), а также продуманные роли и права доступа, но он уверен, что индустрия с этим справится. В финале автор приглашает всех, кто тоже экспериментирует с полезным применением малых моделей, написать ему.
Ключевые факты
- Автор уже несколько недель использует gpt-5.6-luna: около 100 токенов в секунду, сложные исследовательские сессии с поиском по тысячам писем обходятся в «десятки центов»; GLM 5.3 назван ещё одним вариантом на границе Парето.
- Его личный тест, персонализированный новостной мини-сайт: на моделях «уровня Sonnet» прогон стоил около $1 (подписка $30/мес при такой цене не окупается), на gpt-5.6-luna, в среднем около $0.10.
- Сооснователь Segment Питер (привлёк более $100 млн для Charm Industrial, закрыл Series A для Revoy) говорит, что около 95% его работы, не «гениальные» прорывы, а постоянная отзывчивая рутина: звонки, подталкивание людей, разбор текучки.
- Прогноз автора: спрос на топовые модели продолжит расти для задач с прорывами (инженерия, наука, обучение моделей), но спрос на быстрые/дешёвые/«достаточно хорошие» модели вот-вот резко вырастет, по аналогии с тем, что наём людей давно смещён в сторону отзывчивости, а не гениальности.
- Для бизнес-применения дешёвых моделей пока не хватает инфраструктуры: новых «обвязок» (harnesses), защиты от prompt injection, продуманных ролей и прав доступа, но автор уверен, что это решаемо.
Почему это важно
Автор поднимает конкретный экономический вопрос, который несколько инвесторов задавали ему напрямую: почему до сих пор так мало новых потребительских ИИ-компаний? Его ответ, дело не в идеях, а в стоимости токенов: как только в продукт добавляется ИИ, на каждый запрос ложатся реальные расходы на вычисления, и нужный на старте капитал резко растёт по сравнению со сценарием до эпохи ИИ «дешёвый сайт плюс виральность плюс реклама». Ключевой тезис эссе в том, что этот порог стоимости уже пройден: на своём повторяющемся личном тесте, сборке персонализированного новостного сайта, автор получил падение цены прогона примерно с $1 (модели «уровня Sonnet») до $0.10 (gpt-5.6-luna). Именно такая арифметика, по его мнению, впервые делает реальными и потребительские ИИ-продукты по разумной цене, и массовое использование ИИ для рутинной «человеческой» работы в бизнесе.
Кому это важно
В первую очередь это касается основателей потребительских ИИ-продуктов и инвесторов, которые пытаются понять, почему таких компаний до сих пор мало: аргумент автора даёт конкретную экономическую причину и ориентир по цене, десятки центов, а не доллар за прогон. Во вторую очередь, командам, которые строят автоматизацию рутинной работы внутри бизнеса: по наблюдению сооснователя Segment Питера, около 95% его собственной работы, это не «гениальные» прорывы, а постоянная отзывчивая рутина (звонки, подталкивание людей, разбор текучки), и именно такую работу, по мысли автора, способны закрыть дешёвые быстрые модели. Отдельно это касается инженеров и продуктовых команд, которые выбирают между дорогими топовыми моделями (в тексте, Fable 5, 5.6 Sol) и новыми быстрыми моделями (gpt-5.6-luna, GLM 5.3) для разных типов задач.
Как это применить
Практический вывод автора: не тянуться по умолчанию к самой дорогой и мощной модели, а разделять задачи по типу. Для редких задач, требующих настоящего прорыва или нестандартного решения, сложная инженерия, точные науки, обучение самих моделей, по-прежнему нужны топовые модели. А для массовой, но не творческой работы, быть отзывчивым, разбирать входящие запросы, вести переписку, собирать и персонализировать контент, подходят быстрые и дешёвые модели вроде gpt-5.6-luna или GLM 5.3: именно на них построен пример автора с персонализированным новостным сайтом. При этом он прямо оговаривает, что для бизнес-применения дешёвых моделей инфраструктуры пока не хватает: нужны новые «обвязки» (harnesses) вокруг моделей, защита от prompt injection (внедрения вредоносных инструкций через текст запроса), а также продуманные роли и права доступа, без этого раздавать дешёвым моделям реальные бизнес-процессы рискованно.
Можно ли доверять
Это личное эссе на собственном блоге автора (calv.info), а не независимое исследование или бенчмарк производителя моделей: цифры ~$1 и ~$0.10, его собственные неформальные наблюдения по одному повторяющемуся личному тесту, а не результат контролируемого сравнения. В тексте не указано, кто выпускает модели gpt-5.6-luna, GLM 5.3, Fable 5 и 5.6 Sol, и не приведено ни одного количественного бенчмарка в подтверждение их возможностей, читателю предлагается поверить оценке автора на слово. При этом он говорит по собственному опыту, ссылается на конкретного собеседника, своего сооснователя по Segment Питера, с уточнением его инвестиций в Charm Industrial и раунда Series A для Revoy, и описывает воспроизводимый личный пример, а не абстрактные рассуждения, что добавляет тексту веса как мнению практика. Материал вызвал заметный отклик на Hacker News, 563 балла и 251 комментарий, что говорит скорее о резонансности темы, чем о проверенности конкретных цифр.
Риски и подводные камни
Главный риск, переносить вывод с одного узкого личного примера (сборка персонализированного новостного сайта) на весь рынок потребительского ИИ: $0.10, это средняя цена по одному сценарию использования, без раскрытой методики подсчёта и объёма запросов, а не универсальный тариф на «ИИ-задачу». Ровно те риски, которые нужно закрыть для бизнес-применения дешёвых моделей, prompt injection, права доступа, роли, автор сам называет нерешёнными на момент публикации, то есть перейти от идеи к безопасному массовому внедрению пока нельзя «из коробки». Наконец, из текста нельзя понять ни то, кто производит названные модели, ни насколько стабильны их цена и доступность в будущем, а именно от этого зависит, сохранится ли обнаруженный автором ценовой порог.
«Как-то странно, что мы не видим больше потребительских ИИ-компаний. Почему так?»
— неназванные инвесторы, в разговоре с автором эссе
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.