Cerebras добавила модель Qwen 3.8 27B на скорости 1500 токенов/с

Компания Cerebras добавила модель Qwen 3.8 27B в каталог своего публичного (общего для всех) инференс-API. Qwen 3.8 27B, модель Alibaba на 27 миллиардов параметров, плотная (не смесь экспертов) и мультимодальная: принимает текст и изображения (в формате PNG или JPEG, закодированные в base64), а предназначена для агентного программирования, использования внешних инструментов, исследовательских задач и длительных рабочих процессов; поддерживает настраиваемый режим рассуждений. По собственной таблице Cerebras модель работает со скоростью около 1500 токенов в секунду. Сейчас это лишь вторая модель на бесплатном/публичном тарифе Cerebras, первая это OpenAI GPT OSS (120 миллиардов параметров, около 3000 токенов в секунду); всё остальное Cerebras открывает только через платные выделенные эндпоинты (Dedicated Endpoints).
По характеристикам: контекстное окно, 64 тысячи токенов на бесплатном тарифе и 128 тысяч на платных, максимальная длина ответа, 32 тысячи токенов на бесплатном тарифе и 40 тысяч на платных. Цена, 0,99 доллара за миллион входных токенов и 1,49 доллара за миллион выходных. Бесплатный пробный тариф ограничен 5 запросами в минуту, 30 тысячами некэшированных входных токенов в минуту, 90 тысячами токенов в минуту суммарно и 1 миллионом токенов в сутки (не больше 2 изображений на запрос). Платный тариф Developer снимает суточный лимит и поднимает планку до 300 запросов в минуту, 150 тысяч некэшированных входных токенов в минуту и 450 тысяч токенов в минуту суммарно (до 10 изображений на запрос). Максимальный размер запроса, 10 МиБ. Среди заявленных возможностей, потоковая выдача, структурированный вывод, вызов инструментов (включая параллельный) и кэширование промптов.
На Hacker News (491 голос, 148 комментариев) обсуждение быстро свернуло с самой модели на практику использования: несколько комментаторов отметили, что кэшированные токены всё равно расходуют общий лимит токенов в минуту и не дают скидки, поэтому в реальных сессиях агентов в лимит упираются быстрее, чем в саму скорость модели. Пользователь gpugreg сообщил, что упёрся в лимит Developer-тарифа (450 тысяч токенов в минуту) примерно за 90 секунд и потратил на это 1,10 доллара, так и не закончив задачу при контекстном окне в 64 178 токенов; тот же сценарий на DeepSeek-V4-Flash уложился в 172 секунды и обошёлся в 0,024 доллара. Пользователь eli протестировал модель в связке с ИИ-агентом на реальном код-ревью: сессия заняла 5,1 минуты и стоила 1,60 доллара, при этом изредка возникали ошибки превышения лимита запросов (429), а измеренная медианная скорость составила 890 токенов в секунду с задержкой до первого токена 0,64 секунды, заметно ниже заявленных ~1500 токенов в секунду. По его собственным прикидкам, через OpenRouter та же работа обошлась бы в 0,29 доллара и заняла около 14,4 минуты, то есть Cerebras вышел примерно в 5,6 раза дороже в обмен на скорость примерно в 2,8 раза выше. Отдельная ветка комментариев касалась не модели, а самой компании: пользователи жаловались на проблемы с биллингом и слабую поддержку, а один из них (olivermuty) резюмировал так: «Технологии Cerebras, это восторг, а вот сама компания, это катастрофа».
Ключевые факты
- Cerebras добавила Qwen 3.8 27B (27 млрд параметров, мультимодальная модель Alibaba, текст и изображения) в публичный инференс-API; на общем тарифе это лишь вторая модель после OpenAI GPT OSS (120 млрд параметров), остальные модели Cerebras отдаёт только через платные выделенные эндпоинты.
- Заявленная скорость, около 1500 токенов в секунду; контекстное окно 64 тысячи токенов на бесплатном тарифе и 128 тысяч на платном, максимальная длина ответа, 32 и 40 тысяч токенов соответственно.
- Цена, 0,99 доллара за миллион входных токенов и 1,49 доллара за миллион выходных; бесплатный тариф даёт 1 миллион токенов в сутки, но лимит в минуту у платного тарифа Developer, всего 450 тысяч токенов суммарно.
- Кэшированные токены всё равно учитываются в лимите токенов в минуту и не дают скидки, на Hacker News это назвали главной практической проблемой для агентных (многошаговых) сценариев использования.
- Один пользователь потратил 1,10 доллара за 90 секунд и не закончил задачу (упёрся в лимит 450 тысяч токенов в минуту), тогда как DeepSeek-V4-Flash справился за 172 секунды и 0,024 доллара; другой измерил реальную медианную скорость в 890 токенов в секунду, заметно ниже заявленной.
Почему это важно
Cerebras строит своё место на рынке инференса на голой скорости: чип-производитель делает ставку на то, что вычисления на его специализированном железе идут в разы быстрее, чем в обычных GPU-облаках, и старается как можно быстрее выкладывать в публичный доступ свежие открытые модели, в данном случае модель линейки Qwen от Alibaba. Но история интересна не только этим: она показывает, что бесплатный/публичный тариф у таких компаний, это узкая витрина (сейчас на нём всего две модели), а на практике при реальной нагрузке важнее оказывается не заявленная скорость в токенах в секунду, а лимит токенов в минуту, именно он определяет, сколько реально стоит и сколько длится сессия.
Кому это важно
Разработчикам, которые строят приложения и агентов, чувствительные к задержке ответа, и выбирают между Cerebras и обычными облаками на базе GPU. Командам, которые хотят опробовать модель Qwen 3.8 27B без развёртывания собственной инфраструктуры. И всем, кто сравнивает провайдеров инференса не по рекламной скорости, а по реальной стоимости и длительности типичной рабочей сессии.
Как это применить
Модель доступна через облачный API Cerebras под идентификатором qwen-3.8-27b, на бесплатном пробном тарифе или платном тарифе Developer. Она принимает текст и изображения (PNG/JPEG в base64, до 2 изображений на запрос бесплатно и до 10, на платном тарифе), поддерживает настраиваемые рассуждения (по умолчанию, глубокий режим high, отключается параметром reasoning_effort=none) и кэширование промптов. Главная практическая оговорка, кэш не освобождает от лимита токенов в минуту и не даёт скидки на цену, поэтому при оценке реальной стоимости и длительности сессии агента стоит ориентироваться не на заявленные ~1500 токенов в секунду, а на лимит токенов в минуту (90 тысяч на бесплатном тарифе, 450 тысяч, на платном Developer): именно в него на практике упираются раньше, чем в скорость самой модели.
Можно ли доверять
Цифры о скорости, цене и лимитах взяты из собственной документации Cerebras, это данные вендора, а не независимый замер. И расхождение с реальностью тут же нашлось: пользователь Hacker News, реально прогнавший код-ревью через модель, замерил медианную скорость в 890 токенов в секунду, заметно меньше заявленных ~1500. Это обычная история для таких показателей: они зависят от длины запроса и ответа, параллельной нагрузки на сервис и конкретной задачи, поэтому воспринимать ~1500 токенов в секунду стоит как ориентир Cerebras, а не как гарантированную цифру. Отдельно Cerebras заявляет, что не выкладывает прунированные (урезанные по архитектуре) модели на публичных эндпоинтах: сжатие ограничено квантованием весов при хранении (16/8/4 бита), а вычисления с активациями, вниманием и кэшем ключей-значений идут в полной точности; прунированные версии по собственной технологии REAP компания публикует отдельно на Hugging Face для исследований, а не в рабочем API. Иначе говоря, ничто не указывает на то, что скорость Qwen 3.8 27B на Cerebras куплена ценой урезанной версии модели, но это тоже заявление самой компании, а не результат независимой проверки.
Риски и подводные камни
Главный подводный камень, кэшированные токены всё равно расходуют общий лимит токенов в минуту и не дают скидки на цену (в отличие от многих конкурентов), поэтому чем длиннее сессия агента, тем относительно дороже выходит Cerebras. Лимиты бесплатного тарифа (90 тысяч токенов в минуту, 1 миллион токенов в сутки, не больше 2 изображений на запрос) годятся только для короткого тестирования, а не для рабочей нагрузки. Несколько комментаторов на Hacker News отдельно жаловались на проблемы с биллингом и слабую поддержку у Cerebras как у компании, вплоть до блокировки доступа к настройкам оплаты; один высказал предположение, что публичные эндпоинты для Cerebras, в первую очередь демонстрация возможностей для потенциальных корпоративных клиентов, а не по-настоящему рабочий бесплатный тариф.
«Технологии Cerebras, это восторг, а вот сама компания, это катастрофа.»
— olivermuty, комментарий на Hacker News