Cerebras представила CS-4, вдвое быстрее на том же чипе

Cerebras представила CS-4, вдвое быстрее на том же чипе

Cerebras представила новый ИИ-ускоритель CS-4, систему уровня стойки (rack-scale), то есть полноценный серверный шкаф с вычислительными модулями, питанием и охлаждением, который целиком устанавливается в дата-центр как единый блок. По словам CEO компании Эндрю Фелдмана, это самая быстрая система в отрасли. CS-4 по-прежнему построена на 5-нанометровом чипе WSE-3, том же, что стоял в предыдущем поколении CS-3, но производительность выросла вдвое за счёт более высокой тактовой частоты, которую обеспечили увеличенная подача питания и улучшенное охлаждение. Одна стойка теперь вмещает три пластины (wafer) вместо двух и выдаёт до 4400 токенов в секунду на пользователя, по заявлению Cerebras, это до 30 раз быстрее конфигураций на GPU Nvidia. Объём памяти не изменился и остаётся на уровне 44 ГБ на пластину. Компания также применила новую модульную конструкцию "Backpack" для более быстрой сборки, а для распределённого (disaggregated) инференса задействует партнёров AMD и AWS Trainium. Аналитики SemiAnalysis, впрочем, считают прирост в сетевой части довольно скромным. Подробности обещают раскрыть на конференции Hot Chips. Оборудование Cerebras уже использует, в частности, OpenAI, для Codex Spark.

Ключевые факты

  • CS-4, система уровня стойки на прежнем 5-нм чипе WSE-3, но с вдвое большей производительностью за счёт роста тактовой частоты, питания и охлаждения
  • Одна стойка теперь содержит три пластины вместо двух и выдаёт до 4400 токенов в секунду на пользователя
  • Cerebras заявляет об ускорении до 30 раз по сравнению с конфигурациями на Nvidia GPU; память осталась прежней, 44 ГБ на пластину
  • Новая модульная конструкция "Backpack" ускоряет сборку; для распределённого инференса компания сотрудничает с AMD и AWS Trainium
  • Аналитики SemiAnalysis оценивают прирост в сетевой части как небольшой; подробности обещаны на конференции Hot Chips

Почему это важно

Cerebras добилась удвоения производительности не за счёт перехода на новый техпроцесс, а инженерными средствами: тот же 5-нм чип WSE-3, но выше тактовая частота (больше питания, лучше охлаждение) и три пластины в стойке вместо двух. Это показывает, что архитектура wafer-scale (чип размером с целую кремниевую пластину) ещё не исчерпала резерв по производительности на существующем кристалле, и позволяет Cerebras заявлять о заметном отрыве от инференса на GPU Nvidia по скорости выдачи токенов.

Кому это важно

В первую очередь, компаниям, которые арендуют инференс-мощности для больших языковых моделей и конкурируют за скорость ответа: чем выше токенов в секунду на пользователя, тем отзывчивее продукт. Среди клиентов Cerebras уже назван OpenAI, использующий это оборудование для Codex Spark. Важно это и облачным провайдерам-партнёрам, AMD и AWS Trainium, с которыми Cerebras выстраивает разделённый (disaggregated) инференс.

Как это применить

CS-4 поставляется как готовая стойка целиком, вычисления, питание и охлаждение в одном шкафу, который встраивается в дата-центр как единый блок. Модульная конструкция "Backpack" рассчитана на более быстрый монтаж. В источнике нет ни цены, ни даты выхода или начала поставок, подробности компания обещала раскрыть позже, на конференции Hot Chips.

Можно ли доверять

Ключевые цифры, двукратный прирост производительности и ускорение до 30 раз относительно Nvidia GPU, это заявления самой Cerebras и её CEO, а не независимые измерения. Единственная сторонняя оценка в материале, от аналитиков SemiAnalysis, которые характеризуют прирост именно в сетевой части как довольно скромный, то есть частично уравновешивают маркетинговый посыл компании.

Риски и подводные камни

Формулировки "до 4400 токенов в секунду" и "до 30 раз быстрее", это верхняя граница в лучшем сценарии, а не типичный результат в проде. Сравнение с Nvidia GPU сделано по методологии и на конфигурациях, которые выбирала сама Cerebras, без раскрытия деталей теста. Цены, сроки поставок и характер сетевых ограничений (кроме общей оценки SemiAnalysis) в материале не раскрыты.