Nvidia и Cerebras похвастались скоростью ИИ-чипов, которую клиенты не увидят

Nvidia и Cerebras похвастались скоростью ИИ-чипов, которую клиенты не увидят

На конференции Hot Chips в Калифорнии Nvidia объявила, что её новые стойки LPX на базе технологии Groq-3 вышли в серийное производство. В первых тестах они выдают 3400 токенов в секунду на модели Gemma 4 31B, по словам Nvidia, это вчетверо быстрее, чем у Cerebras. Днём позже Cerebras ответила: её новые ускорители CS4 (представленные неделей раньше) показывают почти такую же скорость. Оба набора цифр посчитала одна и та же независимая команда, Artificial Analysis.

The Register (материал вышел без подписи автора) утверждает: обе компании технически не лгут, но меряются цифрами, которые их клиенты в реальной эксплуатации почти никогда не увидят. Это не показатели прода, а «максимальная скорость на спидометре», ни один разумный оператор inference-сервиса не станет гонять систему в таком режиме, обслуживая по одному запросу за раз. Причина в архитектуре: и LPU от Groq, и вейфер-скейл чипы Cerebras получают скорость за счёт огромного объёма памяти прямо на кристалле (SRAM), а не за счёт грубой вычислительной мощности, и именно эта память быстро заканчивается, когда запросов становится много.

Издание само посчитало пределы по открытым техническим характеристикам и калькулятору KV-кэша LMcache. При 8-битной точности (в ней же Nvidia получила свои 3400 токенов/с) веса модели Gemma 4 31B занимают около 31 ГБ памяти, это около 64 чипов Groq-3 LPU (у каждого по 500 МБ памяти на кристалле). На это накладывается KV-кэш: каждые 100 000 токенов входного запроса добавляют ещё 8 ГБ памяти на один запрос, то есть ещё 16 LPU. В одной стойке LPX, 256 LPU, и по расчётам The Register этого хватает максимум на 12 одновременных запросов с длиной входа 100 000 токенов, прежде чем память закончится. У Cerebras счёт другой (стойка CS4, это три ускорителя WSE-3T по 44 ГБ SRAM, итого 132 ГБ), но итог тот же: около 12 запросов одновременно. Это упирается не в вычисления, а именно в память, увеличить батч можно только добавив стойки или урезав длину промпта. Оговорка самого издания: расчёт упрощённый, для батча с фиксированной длиной входа; чат-бот с ограниченным контекстным окном на той же стойке в теории обслужит заметно больше пользователей, чем 12.

Практический выход, по мнению The Register, гетерогенные вычисления: сочетать GPU (или другие вычислительно тяжёлые чипы, например Trainium от Amazon) с SRAM-ускорителями вроде LPU от Groq, вейфер-скейл чипов Cerebras или SN-ускорителей SambaNova, но использовать последние только как ускорители этапа декодирования (генерации токенов). Тогда SRAM-чипу нужно держать в памяти только веса модели, а не полный KV-кэш, и проблема с памятью почти снимается. Именно поэтому Nvidia заплатила $20 млрд, чтобы получить технологию Groq и переманить её инженерную команду, а Cerebras объединилась с AWS и AMD. На эту связку GPU и SRAM-ускорителей и ставят Nvidia, AMD и AWS, чтобы сделать «премиальный», сверхбыстрый inference экономически выгодным.

Бенчмарков для таких гибридных связок GPU + LPX или GPU + CS4 пока не существует, есть только цифры для отдельно взятых стоек. The Register указывает на более показательный тест, InferenceX от SemiAnalysis, который строит производительность по всей кривой Парето, от объёмного «балкового» inference до сверхбыстрого премиального; им уже пользуется OpenAI, чтобы показать возможности своих ускорителей Jalapeño. Nvidia и Cerebras выбрали более простую методику Artificial Analysis. Издание прямо называет это догадкой, а не фактом, но предполагает: на левой и средней части кривой Парето стойки LPX и CS4 выглядели бы не так эффектно, и обе компании покажут результаты InferenceX для гибридных систем, когда те будут готовы.

Ключевые факты

  • Nvidia объявила на конференции Hot Chips о выходе в серийное производство ИИ-стоек LPX на технологии Groq-3: в первых тестах, 3400 токенов в секунду на модели Gemma 4 31B, по заявлению Nvidia вчетверо быстрее Cerebras.
  • Днём позже Cerebras ответила: её новые ускорители CS4 показывают почти такую же скорость.
  • The Register по открытым характеристикам посчитала память обеих систем: при 8-битной точности и входе в 100 000 токенов ни стойка LPX (256 чипов LPU), ни стойка CS4 (132 ГБ SRAM) не тянут больше 12 одновременных запросов, упор идёт в память, а не в вычисления.
  • Практическое решение, гетерогенные системы: GPU в связке с SRAM-ускорителями (LPU Groq, чипы Cerebras, SambaNova) в роли декодера; ради этого Nvidia заплатила $20 млрд за технологию и инженеров Groq, а Cerebras объединилась с AWS и AMD.
  • Бенчмарков для гибридных GPU-связок пока нет: Nvidia и Cerebras посчитали производительность по упрощённой методике Artificial Analysis, а не по более полному тесту SemiAnalysis InferenceX, которым уже пользуется OpenAI для своих ускорителей Jalapeño.

Почему это важно

Nvidia и Cerebras устроили публичную гонку заголовков вокруг скорости инференса, и обе цифры (3400 токенов/с и «почти столько же») реальны, но получены в режиме, который не имеет отношения к тому, как эти системы будут работать у клиентов. The Register показывает конкретный механизм разрыва между маркетинговым бенчмарком и продакшен-экономикой: скорость SRAM-ускорителей на одном запросе не масштабируется линейно на много пользователей просто потому, что память на кристалле конечна. Это общая проблема для всей волны «премиального», сверхбыстрого inference, которую сейчас продают как следующий big thing.

Кому это важно

Тем, кто закупает или арендует инференс-инфраструктуру для ИИ-продуктов, облачным провайдерам и inference-as-a-service операторам, которые могут купиться на пиковые цифры вместо реальной экономики на масштабе. Инвесторам и аналитикам, оценивающим сделки вроде $20-миллиардной лицензии Nvidia на технологию Groq или партнёрство Cerebras с AWS и AMD. Конкурентам на рынке ИИ-ускорителей, AMD, SambaNova, самой Amazon с её чипами Trainium, которые предлагают похожие гетерогенные схемы.

Как это применить

Практический вывод статьи: не оценивать ускорители по одиночным пиковым цифрам токенов в секунду на пользователя, это «максимальная скорость на спидометре», а не показатель прода. Рабочая архитектура для быстрого инференса, гетерогенная связка: GPU (или другой вычислительно тяжёлый чип) держит основную нагрузку и KV-кэш, а SRAM-ускорители вроде Groq LPU или чипов Cerebras подключаются как декодер-ускорители, отвечающие только за генерацию токенов поверх уже загруженных весов. Именно эту схему уже строят Nvidia (через покупку технологии Groq) и Cerebras (через AWS и AMD). При выборе поставщика inference стоит спрашивать полный бенчмарк по методике SemiAnalysis InferenceX, охватывающий весь диапазон от объёмного до сверхбыстрого inference, а не только цифры от Artificial Analysis для одного пользователя.

Можно ли доверять

The Register прямо пишет, что ни Nvidia, ни Cerebras не лгут, цифры воспроизводимы и посчитаны независимой командой Artificial Analysis. Но заявление Nvidia о четырёхкратном превосходстве над Cerebras на следующий день частично нейтрализуется ответом самой Cerebras о «почти такой же» скорости её нового CS4, само по себе показывающее, насколько такие top-line цифры зависят от того, какую версию чужого продукта берут для сравнения. Расчёт батча в 12 одновременных запросов, это собственная оценка The Register по открытым характеристикам и калькулятору LMcache, а не цифра, подтверждённая Nvidia, Cerebras или реальным клиентом; издание само оговаривает, что это упрощённая модель с фиксированной длиной входа, и в реальном чат-боте с более коротким контекстом стойка может обслужить больше пользователей. У материала нет указанного автора, это аналитическая колонка, а не новость с цитатами официальных представителей компаний.

Риски и подводные камни

Главный риск, принимать решения о закупке inference-инфраструктуры по маркетинговым пиковым цифрам без пересчёта на реальную нагрузку: память, а не вычислительная мощность, оказывается узким местом уже на батче около десятка запросов. Второй риск, сама ставка на «премиальный» инференс: обещанная экономика гибридных GPU + SRAM-систем пока не подтверждена ни одним опубликованным бенчмарком, такие связки существуют только как план. The Register прямо называет догадкой, а не фактом, своё предположение о том, почему Nvidia и Cerebras выбрали более лёгкую методику Artificial Analysis вместо полного теста InferenceX, но сам факт этого выбора стоит держать в уме, читая обе пресс-волны как маркетинг, а не как готовый продукт.

«На самом деле эти цифры больше похожи на максимальную скорость гоночного автомобиля: отличный маркетинг, но в обычной жизни на такой скорости никто не ездит, а если бы и поехал, далеко бы не уехал, прежде чем кончится бак.»

— The Register