Cerebras выпустила CS-4: инференс до 30 раз быстрее GPU

Cerebras представила CS-4, новое поколение стоечных систем для ИИ-инференса и первую реализацию новой архитектуры Nexus Platform. По заявлению компании, CS-4 обеспечивает инференс до 30 раз быстрее GPU-систем, устанавливая, как утверждает Cerebras, новый рекорд скорости среди систем, доступных в промышленной эксплуатации.
В основе системы, три кристалла WSE-3 Turbo на систему; каждый из них, по заявлению компании, работает до 2 раз быстрее кристаллов предыдущего поколения. По сравнению с предыдущей моделью CS-3, новая система даёт до 10 раз больше пропускной способности на ватт и генерирует токены до 30 раз быстрее производственных GPU-систем. Задержка соединения между кристаллами снижена до 2 микросекунд, что позволяет выдавать более 1000 токенов в секунду на моделях с более чем 10 триллионами параметров. Отдельно Cerebras заявляет, что такая задержка сохраняет интерактивность отклика и для моделей с десятками триллионов параметров, источник не поясняет, совпадает ли этот более крупный порог с планкой в 10 триллионов параметров, используемой для показателя в 1000 токенов в секунду.
Архитектурно CS-4 построена по модульному принципу вокруг трёх элементов, вычислений, питания и ввода-вывода. Компания переработала конструкцию сервера: каждый вычислительный модуль ("Wafer-Scale Backpack") объединяет кристалл, преобразование питания, прямое жидкостное охлаждение, высокоскоростной ввод-вывод и электронику управления в компактном трёхмерном корпусе с числом компонентов на 50% меньше, что упрощает производство и сокращает время развёртывания с дней до часов. Питание подводится к процессору на расстоянии всего 0,5 мм, примерно в 100 раз ближе, чем на обычных платах GPU (около 50 мм); это, по словам компании, почти устраняет потери мощности на уровне платы и позволяет подавать на WSE-3T вдвое больше энергии для более высоких рабочих частот. Новый программируемый интерфейс ввода-вывода удваивает пропускную способность и снижает задержки, а модуль Wafer I/O Module позволяет соединять кристаллы внутри стоек и между ними без коммутатора.
Cerebras разделяет развёртывание инфраструктуры и вычислений: стойку PowerRack со стабильным слоем питания, охлаждения и сети можно установить и аттестовать на площадке ещё до поступления вычислительных модулей, они затем просто вставляются на место и подключаются к питанию, охлаждению и данным, что тоже сокращает срок развёртывания с дней до часов.
В материале нет даты выхода или доступности CS-4, цены, названия конкретной модели GPU, с которой сравнивают систему, методологии тестов, на которых получены цифры 30x/10x/2x, а также данных о числе систем в стойке и подтверждений от сторонних заказчиков или независимых тестов, все заявления в источнике исходят от самой Cerebras.
Ключевые факты
- Cerebras анонсировала CS-4, первую систему на новой архитектуре Nexus Platform, три кристалла WSE-3 Turbo на систему
- По заявлению компании, инференс до 30 раз быстрее GPU-систем и до 10 раз больше пропускной способности на ватт, чем у предыдущей CS-3
- Задержка между кристаллами снижена до 2 микросекунд, что даёт свыше 1000 токенов в секунду на моделях свыше 10 триллионов параметров
- Модульный дизайн "Wafer-Scale Backpack" на 50% сокращает число компонентов и время развёртывания, с дней до часов
- В источнике нет даты выхода, цены, названия GPU для сравнения, методологии тестов и подтверждений от сторонних заказчиков
Почему это важно
Cerebras заявляет о новом поколении своих wafer-scale систем, CS-4, с которым компания рассчитывает закрепить позицию поставщика самого быстрого инференса ИИ, обгоняя по заявленной скорости GPU-системы конкурентов. Это очередной шаг в гонке за инфраструктуру для обслуживания всё более крупных моделей: CS-4 нацелена на модели с десятками триллионов параметров, которые обычная GPU-инфраструктура обслуживает с трудом из-за задержек и энергопотребления.
Кому это важно
В первую очередь операторам гипермасштабируемых дата-центров и компаниям, которые разворачивают инференс очень крупных языковых моделей и заинтересованы в альтернативе GPU-кластерам. Также это касается конкурентов на рынке ИИ-железа, производителей GPU и других wafer-scale решений, которым CS-4 бросает вызов по заявленной скорости и энергоэффективности.
Как это применить
Cerebras предлагает подход "сначала инфраструктура, потом вычисления": стойку PowerRack с питанием, охлаждением и сетью можно установить и аттестовать заранее, а вычислительные модули добавить позже, что сокращает развёртывание с дней до часов. Однако источник не называет ни цену CS-4, ни дату начала поставок, поэтому оценить, когда и на каких условиях систему можно будет реально купить и развернуть, по этому материалу нельзя.
Можно ли доверять
Материал, это страница самой Cerebras, и все цифры (30x, 10x, 2x, снижение задержки до 2 мкс и другие) исходят исключительно от компании. В тексте не названа конкретная модель GPU, с которой идёт сравнение, не описана методология измерений и нет ни одного стороннего заказчика или независимого теста, подтверждающих заявленные показатели. Относиться к цифрам стоит как к маркетинговым заявлениям производителя, а не к независимо проверенным бенчмаркам.
Риски и подводные камни
Главный риск, непроверяемость заявленных цифр: без названного бенчмарка, эталонной GPU-системы и независимых тестов 30-кратное ускорение остаётся утверждением производителя. Отсутствие даты доступности и цены не позволяет оценить, когда и по какой стоимости CS-4 реально появится у заказчиков и насколько заявленные преимущества по энергоэффективности и плотности мощности подтвердятся в реальном развёртывании, а не в контролируемых компанией условиях.