Nvidia раскрыла архитектуру CPU Vera и кастомных ядер Olympus

Nvidia выпустила Vera, свой первый самостоятельный процессор, который можно разворачивать независимо от GPU компании. Это прямой вызов доминированию Intel и AMD на рынке серверных CPU. Разворачивать чипы в своих облаках уже согласились Alibaba, ByteDance, Meta, Oracle, CoreWeave, Lambda, Nebius и NScale. Vera, развитие линейки Grace; Nvidia нацеливает его на две роли: узел управления GPU в будущих системах Vera Rubin и хост для ИИ-агентов, которые, в отличие от языковых моделей, не выполняются на GPU.
Один чип Vera несёт 88 кастомных ядер Armv9.2, 176 потоков и поддержку до 1,5 ТБ памяти LPDDR5X. Все 88 ядер расположены на одном монолитном вычислительном кристалле (по предположению издания, на техпроцессе TSMC 3 нм; сама Nvidia эту деталь не подтверждала), а память и ввод-вывод вынесены на отдельные чиплеты, восемь контроллеров LPDDR5x и два блока ввода-вывода (PCIe 6.4/CXL 3.1 и интерфейс NVLink Chip-to-Chip). По компоновке Vera похожа на Graviton 4 от Amazon, где так же совмещены монолитный вычислительный блок и вынесенные чиплеты памяти и ввода-вывода.
Двухсокетная версия, Vera CPU Superchip, представленная на GTC в марте (год в материале не указан), соединяет два чипа Vera через NVLink-C2C на скорости 1,8 ТБ/с и даёт 176 ядер и 352 потока суммарно. Данные на оба чипа поступают от 16 модулей памяти SOCAMM2 LPDDR5x: 2,4 ТБ/с суммарной пропускной способности (по 1,2 ТБ/с на чип), примерно вдвое больше, чем у AMD Turin Epyc (запущены в 2024 году). Референсный дизайн стойки для агентных ИИ-нагрузок вмещает до 128 таких суперчипов (256 процессоров), это 22 528 ядер и 384 ТБ памяти в одной стойке с жидкостным охлаждением.
Раньше Nvidia использовала готовые ядра Arm, Neoverse V2 в Grace (GB200/300), Neoverse V3 в AGX Thor, Cortex X925 и A725 в GB10. С Vera компания перешла на собственное ARMv9.2-совместимое ядро Olympus. Насколько оно действительно кастомное, вопрос спорный: по данным The Register, ядро сильно опирается на существующую IP-технологию Arm, а по архитектурной блок-схеме Olympus напоминает глубоко модифицированный Cortex X925.
Olympus получил 10-широкий блок декодирования и диспетчеризации, десять целочисленных арифметико-логических блоков (ALU), шесть vector/FP-конвейеров (SVE 128), четыре load-блока и два store-блока, фронт и бэкенд шире, чем у ядер Zen 5 в AMD Turin Epyc или Redwood Cove в Intel Granite Rapids Xeon, хотя по сравнению с готовыми ядрами Arm рекордов Olympus не ставит. Ключевое заявленное отличие, полностью кастомный нейросетевой предиктор ветвлений, способный одновременно просчитывать два варианта развития кода; по утверждению Nvidia, он даёт более высокую точность предсказаний, чем историко-статистические подходы, и особенно эффективен на ветвистых нагрузках вроде Python-скриптов, которые на лету генерируют ИИ-ассистенты для написания кода.
Другие заявленные новшества среднего уровня конвейера нацелены на устранение простоев: переименование памяти ускоряет цепочки зависимостей store-to-load, позволяя выполнять зависимые инструкции до завершения загрузки данных, если связь с данными можно определить заранее, Nvidia описывает это как особенно полезное «для программ с интенсивной работой с указателями, обхода графов, сред выполнения и сложных объектно-ориентированных нагрузок». Схема предсказания значений определяет устойчивые цепочки зависимостей и предсказывает будущие значения до их фактического появления, позволяя зависимым инструкциям выполняться спекулятивно с последующей проверкой корректности, по заявлению компании, это ускоряет повторяющиеся шаблоны кода и последовательную обработку данных.
На бэкенде из ALU восемь блоков, простые, для базовой арифметики, ещё два комплексных ALU отвечают за умножение, деление, CRC и битовые сдвиги; четыре выделенных блока ветвления работают совместно с предиктором, разрешая ситуации, которые иначе приводили бы к простоям конвейера. Для операций с плавающей точкой Olympus получил шесть 128-битных векторных движков Arm SVE2 с поддержкой FP8 и пару векторных блоков для криптографических операций. На ядро приходится 64 КБ кеша инструкций L1, 96 КБ кеша данных L1 и 2 МБ кеша L2; плюс 164 МБ общего кеша системного уровня (SLC), распределённого по чипу.
Ещё одна заметная особенность Olympus, поддержка технологии, похожей на одновременную многопоточность (SMT), мейнстримную для x86 с 2002 года. Arm в своём собственном агентном процессоре от такой функции отказалась, но Nvidia всё же реализовала похожую возможность в Olympus, с оговоркой, что это не классический SMT. Компания называет её пространственной многопоточностью (spatial multithreading): вместо двух потоков, делящих ресурсы одного ядра, реализация Olympus больше похожа на разделение ядра на два «худых» ядра с общей строкой кеша, то есть либо одно «толстое» ядро, либо два «тонких». The Register сравнивает это с технологией multi-instance GPU (MIG), только для CPU, и советует не переоценивать заявления Nvidia о том, что такая схема избегает конкуренции за ресурсы, характерной для x86, SMT традиционно то помогает, то не помогает, в зависимости от нагрузки, и его несложно отключить. Практическая польза схемы, в песочницах для ИИ-агентов: контейнер несёт в себе и сам исполняемый код (например, Python-скрипт и интерпретатор), и рантайм контейнера, отвечающий за оркестрацию, сеть и работу с хранилищем, это очень разные по характеру задачи, и разделение их по разным «половинкам» ядра теоретически даёт более предсказуемую производительность.
Все 88 ядер чипа связывает второе поколение масштабируемой когерентной фабрики Nvidia (SCF) с бисекционной пропускной способностью 3,4 ТБ/с. По описанию Nvidia, SCF, это распределённый когерентный интерконнект, соединяющий ядра через узлы коммутации когерентности (CSN), каждый из которых связывает до двух ядер и служит точкой маршрутизации между ядрами, кешами, контроллерами памяти и внешними интерфейсами. Именно в SCF расположен кеш L3, этим объясняется, почему общий кеш системного уровня (SLC) шардирован по чипу, а не собран в одном месте.
По памяти у Vera восемь контроллеров LPDDR5x с поддержкой модулей SOCAMM2 на скорости до 9600 MT/s: 1,2 ТБ/с суммарно и около 14 ГБ/с на ядро, один из самых быстрых показателей в отрасли на сегодня, хотя конкурирующие чипы вышли на рынок почти два года назад. И Intel, и AMD в новом поколении переходят на 16 каналов памяти: подробности по 192-ядерной платформе Intel Diamond Rapids пока не раскрыты, а AMD Venice, как стало известно изданию на прошлой неделе, получит до 256 ядер и поддержку модулей RDIMM на 8000 MT/s либо MRDIMM на 12 800 MT/s, что даёт от 1 до 1,6 ТБ/с. Если связи GMI у AMD не станут узким местом, 96-ядерные Epyc должны выйти примерно на 17 ГБ/с на ядро, и нет оснований полагать, что Xeon 7 от Intel не покажет того же.
При этом память Vera на LPDDR5X должна потреблять меньше энергии, чем стандартные модули RDIMM: по заявлению Nvidia, при устойчивой нагрузке подсистема памяти потребляет всего 30, 40 Вт против 100, 200 Вт у традиционной серверной платформы (в зависимости от числа каналов и модулей). Для сравнения, тепловой пакет (TDP) самого Vera настраивается в диапазоне от 250 до 450 Вт. Энергопотребление памяти может объяснять, почему AMD разрабатывает новый Epyc под кодовым названием Verano, который тоже будет использовать LPDDR5X.
По вводу-выводу Vera одной из первых поддерживает PCIe 6.4 и CXL 3.1, опережая в этом Intel и, возможно, AMD, в зависимости от того, чьи системы первыми попадут к заказчикам. Как и в прошлых поколениях PCIe, переход на версию 6.0 удваивает пропускную способность на линию до 64 Гбит/с. На этом фрагменте текста источника, доступного редакции, материал обрывается.
Ключевые факты
- Nvidia выпустила Vera, первый процессор компании, который можно разворачивать самостоятельно, независимо от GPU; чипы уже согласились ставить в облаках Alibaba, ByteDance, Meta, Oracle, CoreWeave, Lambda, Nebius и NScale.
- Один чип Vera, 88 кастомных ядер Armv9.2, 176 потоков, до 1,5 ТБ памяти LPDDR5X; двухсокетный Vera CPU Superchip даёт 176 ядер и 352 потока при связи между чипами на 1,8 ТБ/с через NVLink-C2C.
- Кастомное ядро Olympus получило нейросетевой предиктор ветвлений (просчитывает два варианта кода одновременно) и «пространственную многопоточность», разделение одного ядра на два «тонких» вместо классического SMT.
- 88 ядер связывает интерконнект SCF на 3,4 ТБ/с; подсистема памяти выдаёт 1,2 ТБ/с (около 14 ГБ/с на ядро) и, по заявлению Nvidia, потребляет заметно меньше энергии, чем платформы на RDIMM.
- The Register указывает, что «кастомность» Olympus спорна: ядро сильно опирается на существующую IP-технологию Arm и по архитектуре напоминает модифицированный Cortex X925.
Почему это важно
Vera, первый случай, когда Nvidia выходит с самостоятельным серверным процессором на территорию Intel и AMD, а не поставляет CPU только как довесок к своим GPU. Материал The Register, не шутка из юмористической рубрики издания, а подробный технический разбор официального технического документа (white paper) Nvidia и архитектурных блок-схем Olympus. Значимость в том, что Nvidia целится не только в классические серверные нагрузки, но и в отдельную нишу, хостинг ИИ-агентов, которые, в отличие от языковых моделей, не работают на GPU; под это заточены и нейросетевой предиктор ветвлений, и пространственная многопоточность.
Кому это важно
В первую очередь, гиперскейлерам и облачным провайдерам, уже заявившим о развёртывании Vera: Alibaba, ByteDance, Meta, Oracle, CoreWeave, Lambda, Nebius, NScale. Во вторую, конкурентам, Intel и AMD, чьи Turin Epyc, готовящийся Venice и будущие Xeon-платформы The Register прямо сравнивает с Vera по памяти, ядрам и энергопотреблению. Материал полезен и инженерам, проектирующим инфраструктуру под агентные ИИ-системы: описанное разделение ядра на рабочую нагрузку и рантайм контейнера впрямую адресовано этому сценарию.
Как это применить
Nvidia предлагает Vera в двух ролях: как управляющий узел для GPU в системах Vera Rubin и как отдельный хост для песочниц ИИ-агентов, где пространственная многопоточность разносит исполняемый код (например, Python-скрипт с интерпретатором) и рантайм контейнера (оркестрация, сеть, хранилище) по разным «половинкам» одного ядра ради более предсказуемой производительности. Референсный дизайн стойки под агентные нагрузки, до 128 суперчипов (256 процессоров, 22 528 ядер, 384 ТБ памяти) с жидкостным охлаждением, ориентир для тех, кто планирует масштаб развёртывания.
Можно ли доверять
Технические характеристики построены на официальном white paper Nvidia и собственном анализе блок-схем редакцией The Register, а не на независимых бенчмарках. Заявления о выигрыше от нейросетевого предиктора ветвлений, переименования памяти, предсказания значений и экономии энергии на памяти, всё это утверждения самой Nvidia, третьей стороной не подтверждённые. Само издание прямо ставит под сомнение степень «кастомности» Olympus, отмечая по неназванным источникам, что ядро сильно опирается на существующую IP-технологию Arm, и предупреждает не переоценивать заявления Nvidia о преимуществах пространственной многопоточности над традиционным SMT.
Риски и подводные камни
В материале нет ни цены, ни даты начала поставок Vera или Superchip. Часть сравнений с конкурентами опережающая: характеристики AMD Venice и Intel Diamond Rapids/Xeon 7 приводятся по ещё не выпущенным чипам, а вывод о преимуществе Vera по энергопотреблению памяти опирается исключительно на цифры самой Nvidia. Техпроцесс TSMC 3 нм для вычислительного кристалла, предположение редакции, а не подтверждённая Nvidia спецификация. Отдельный риск для читателя, не путать глубину кастомизации Olympus с маркетинговым описанием: по архитектуре ядро ближе к модифицированному готовому дизайну Arm, чем к разработке с нуля.
«Это особенно полезно для программ с интенсивной работой с указателями, обхода графов, сред выполнения и сложных объектно-ориентированных нагрузок»
— Nvidia, в техническом документе о процессоре Vera
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.