NVIDIA Vera: чип быстрый, но вайтпейпер поймали на натяжках

NVIDIA Vera: чип быстрый, но вайтпейпер поймали на натяжках

21 июля NVIDIA опубликовала 45-страничный вайтпейпер о Vera, своём первом серверном процессоре, построенном на собственном ядре Olympus. 5 августа техническое издание Chips and Cheese, главный редактор Джордж Козма и соавтор Честер Лэм, разобрало документ построчно и пришло к выводу: архитектура чипа сама по себе сильная, а конкурентная риторика вокруг неё, нет. По формулировке авторов, самая сильная часть вайтпейпера, железо, самая слабая, история, которую NVIDIA о нём рассказывает.

Технически Vera выглядит впечатляюще. Это монолитный кристалл на 88 ядер Olympus, 10-широких ядер архитектуры Arm v9.2 с внеочередным исполнением: фронтенд декодирует до десяти инструкций и обрабатывает до двух взятых переходов за такт. NVIDIA заявляет у Olympus нейросетевой предсказатель переходов, предсказание значений, переименование памяти, большое окно инструкций, шесть 128-битных конвейеров SVE, четыре конвейера загрузки, два конвейера записи, 96 КБ кеша L1 данных и примерно 10-тактный доступ к 2 МБ приватного L2 на ядро. Все 88 ядер связаны шиной когерентности на 3,4 ТБ/с и делят распределённый кеш последнего уровня объёмом 164 МБ. Память, восемь интерфейсов LPDDR5X на модулях SOCAMM2, до 1,5 ТБ ёмкости и заявленные 1,2 ТБ/с полосы; по данным NVIDIA, заполненная память потребляет только около 50 Вт. Авторы отмечают, что ни одна из этих идей не изобретена NVIDIA с нуля: предсказание значений у AMD в ограниченном виде было ещё в Family 17h (поколения Zen 1, 2), но у Olympus реализация шире и ближе к подходу Apple; графовый префетчер концептуально повторяет Data-Dependent Prefetcher, который у Intel в серийных чипах с 2022 года, и Array of Pointers Prefetcher в новейшем Intel Granite Rapids; а нейросетевой предсказатель переходов продолжает линию персептронных предикторов, которые AMD использовала в Piledriver в 2012 году и в Zen 1, прежде чем начиная с Zen 2 отдать финальное решение TAGE-предсказателю, снижающему число промахов на 30%, судя по всему, к Zen 5 AMD перешла на TAGE полностью.

Главное подтверждение силы чипа, не цифры самой NVIDIA, а независимый тест Phoronix: в мае Майкл Ларабел прогнал ранний образец Vera против актуальных x86- и Arm-серверов. В рамках набора тестов, который выбрала NVIDIA, средний геометрический результат Vera оказался на 10% выше EPYC 9575F (5 ГГц), в 1,55 раза выше Xeon 6980P и в 1,63 раза выше Grace, по словам авторов, это самый производительный Arm-сервер, который они видели в открытых тестах. Оговорки существенные: набор задач выбирала NVIDIA, частоту и энергопотребление мониторить не позволили, тестировался предсерийный образец, а окно тестирования составило один день. Но авторы делают вывод: результат достаточно сильный, чтобы отбросить версию, будто графики вайтпейпера, чистая фантазия. Ядро Olympus, судя по всему, действительно быстрое, вопрос в том, доказывает ли вайтпейпер именно то, что заявляет.

Дальше начинается разбор конкретных натяжек. Первая, диаграмма на рисунке 5, которая противопоставляет «традиционный SMT» (одновременную многопоточность) на x86 фирменной технологии Vera, Spatial Multithreading («пространственная многопоточность»). x86-версия нарисована как «нарезка времени»: ступени конвейера будто бы по очереди достаются то одному, то другому потоку, а ресурсы простаивают. Авторы объясняют, что это не так: ступени выборки, декодирования и распределения действительно обслуживают по одному потоку за такт, но стадии исполнения и доступа к памяти потокобезразличны, оба потока могут одновременно использовать исполнительные блоки и порты кеша, если способны их загрузить; статическое разделение ресурсов, которое выбрала Vera, наоборот, рискует оставить половину исполнительных мощностей простаивать, если один из потоков упирается в вычисления. Показательно, что сам текст вайтпейпера обосновывает Spatial Multithreading через детерминированность, изоляцию и качество обслуживания, а не через производительность: NVIDIA прямо пишет, что снижение взаимного влияния потоков повышает детерминированность и качество обслуживания по сравнению с традиционным SMT, но прироста скорости не заявляет. Отдельная деталь: переключение ядра Olympus обратно в однопоточный режим после завершения соседнего потока занимает около 10 000 тактов, программному обеспечению придётся закладывать эту цену при запуске второго потока.

Вторая натяжка, про NUMA (неоднородный доступ к памяти). NVIDIA пишет, что крупная двухсокетная x86-система может выставлять «до 32 доменов NUMA», тогда как у Vera, один домен на сокет. Цифра не выдумана, но это максимальная опциональная конфигурация: руководство AMD по настройке перечисляет режимы NPS4, NPS2, NPS1 и NPS0, а домен последнего уровня кеша можно выставить отдельным NUMA-узлом только по желанию администратора. 32 домена, это не типичный пользовательский опыт чиплетного процессора, а один полюс настраиваемого спектра, который вайтпейпер подаёт как неизбежную данность x86. При этом карты задержек «ядро-ядро», которые могли бы подтвердить преимущество Vera цифрами, в документе, просто цветные квадраты без номеров ядер, без таблицы минимум/медиана/максимум и без описания методики; формулировка «до 50% ниже» отражает лучший случай NVIDIA, а не типичное поведение чипа. Авторы отдельно отмечают, что это скорее честный инженерный компромисс, чем изъян: у Intel есть похожая сетчатая топология (Mesh), и разница в том, что кластеры EPYC дают низкую задержку внутри кластера и высокую между кластерами, тогда как у Vera и Xeon с топологией Mesh задержка более равномерная.

Третья, самая заметная натяжка, маркировка тестов. NVIDIA берёт четыре стандартных целочисленных теста SPEC CPU 2026, CPython, GCC, LLVM и Cppcheck (по определению самого SPEC, интерпретатор Python, два оптимизирующих компилятора и статический анализатор кода на C и C++), и называет их «агентными бенчмарками», хотя ни один из них не обслуживает языковую модель, не управляет агентной средой исполнения и не запускает песочницу, обращающуюся к внешним данным или инструментам. Вайтпейпер честно помечает эти результаты как оценочные, референсное железо Vera на момент теста ещё не продавалось широко: рисунок 15 показывает преимущество в 1,7, 1,8 раза на физическое ядро именно по этим четырём тестам в полностью нагруженной двухсокетной системе. Но на страницах с полной конфигурацией итоговая оценка SPECrate 2026 Integer Base по всему набору тестов, 925 очков у двух сокетов Vera против 898 у двух сокетов EPYC 9755, то есть преимущество на уровне системы, всего 3,0%. Разница объясняется числом ядер: в этом сравнении у Vera 176 физических ядер, у EPYC, 256; если поделить очки на число ядер, по всему набору тестов Vera быстрее примерно на 50% на ядро, а именно по выбранным четырём тестам, на 70, 80%. То есть вынесенные в графики значения в 1,7, 1,8 раза, не выдумка, а верхняя, самая выигрышная часть куда более скромной общей картины.

Похожая путаница, с рисунком 19, который назван «IPC (число исполненных инструкций за такт) в однопоточном режиме», хотя на деле описывает полностью нагруженную систему: конфигурация запускает 352 процесса на 176 ядрах Vera и 512 процессов на 256 ядрах EPYC, по два процесса на физическое ядро, а вовсе не один поток. Как именно считали IPC в этом случае, усредняли по обоим логическим потокам или брали показания одного при активном втором, вайтпейпер не раскрывает. Не легче и с самими цифрами: NVIDIA объясняет превосходство Olympus по IPC четырьмя группами счётчиков, до 2,3 раза больше предсказаний переходов за такт, в 3,5 раза больше взятых переходов, в 2,4 раза больше операций выборки инструкций и в 4,3 раза больше операций в бэкенде. Проверить эти цифры невозможно: не раскрыты ни названия и определения аппаратных счётчиков, ни интервалы выборки, ни частоты, а инструкция Arm и инструкция x86, не одна и та же единица работы, поэтому межархитектурное сравнение IPC само по себе показательно только вместе с объёмом реально выполненной работы и частотой, а не как самостоятельная метрика.

Самый сильный раздел вайтпейпера, про память, и здесь же самый спорный вывод. По графику NVIDIA, Vera достигает около 1,1 ТБ/с пропускной способности под нагрузкой, тогда как EPYC 9755 (Turin) выходит на плато около 400 ГБ/с, то есть почти трёхкратный разрыв, а на ядро, 12,7 ГБ/с у Vera против 3,1 ГБ/с у Turin, то есть в 4,1 раза. Но в собственном тестировании Chips and Cheese тот же Turin с 12-канальной памятью DDR5-6400 выдал около 570 ГБ/с, это прямо расходится с цифрой NVIDIA. С поправкой на реальный результат Turin суммарное преимущество Vera по памяти оказывается около 1,9 раза, а не «почти 3 раза», как в вайтпейпере, а на ядро, около 2,8 раза, а не 4,1 раза, при пересчитанных ~4,5 ГБ/с на ядро у EPYC 9755. Если сравнивать с EPYC 9575F, моделью, которую AMD продвигает именно для ИИ-узлов (около 9 ГБ/с на ядро), превосходство Vera по памяти на ядро падает примерно до 40%. Авторы также показывают, что оба чипа выжимают из памяти похожую долю теоретического максимума: их собственный результат в 570 ГБ/с, это около 93% от заявленного AMD теоретического предела Turin в 614 ГБ/с, а измеренные NVIDIA 1,1 ТБ/с у Vera, около 92% от собственного теоретического предела Vera в 1,2 ТБ/с. То есть Vera выигрывает не потому, что чиплетный Turin плохо использует свою память, а потому, что у неё почти вдвое выше теоретическая полоса на сокет и меньше ядер её делят между собой, а это не довод в пользу монолитного превосходства над чиплетным x86, на который вайтпейпер отдельно упирает. Сравнение к тому же успело устареть: 6-е поколение EPYC AMD выпустила всего через два дня после публикации вайтпейпера NVIDIA, а новый 96-ядерный EPYC 9686F, который по числу ядер ближе всего к 88-ядерной Vera, предлагает уже 16 каналов памяти на DDR5-8000 или MRDIMM-12800, то есть 1024 или 1638 ГБ/с на сокет; на топовой скорости MRDIMM это превосходит теоретическую полосу Vera и по общей пропускной способности, и на ядро, в зависимости от того, с какой моделью EPYC сравнивать.

Ещё три графика вызывают вопросы по методике. Заявленное преимущество в 2,6 раза по PageRank, с почти линейным масштабированием Vera до 32 ядер против 10-кратного роста у EPYC, не подкреплено раскрытыми параметрами теста GAP Benchmark Suite, а сам график обрывается на 32 ядрах, хотя у Vera 88 ядер на сокет, а у EPYC 9755, 128; авторы называют результат, скорее всего, невоспроизводимым. График по ClickHouse с преимуществом в 1,2 раза избирательно не учитывает результаты EPYC 9575F, хотя в его основе лежит проверяемый независимый тест Phoronix, три прохода по базе на сто миллионов строк. Хуже всего дело обстоит с рисунком 24 под заголовком «Vera даёт прирост в 1,8 раза при обучении с подкреплением»: под этой подписью, просто ряд одинаковых квадратиков без единицы измерения, без указания модели, среды, распределения между CPU и GPU, фреймворка, размера батча, замера энергопотребления, числа повторов или доверительного интервала. Формулировка авторов жёсткая: это не плохой бенчмарк, это вообще не бенчмарк.

Итог Chips and Cheese: ничего из перечисленного не делает Vera медленным чипом, архитектура Olympus и независимые тесты Phoronix говорят об обратном. Проблема в том, что конкурентная часть вайтпейпера искажает картину сильнее, чем это нужно объективно быстрому чипу: диаграмма SMT вводит в заблуждение, опциональная конфигурация NUMA подана как норма x86, стандартные тесты переименованы в «агентные», трёхпроцентное системное преимущество спрятано за столбцами в 1,8 раза на ядро, кросс-архитектурные счётчики сравниваются без определений, а прирост по памяти приписан монолитному кристаллу, хотя объясняется в первую очередь числом каналов памяти. Ответа или комментария NVIDIA на эту конкретную критику в статье нет. Авторы призывают дать независимым обозревателям неограниченный доступ к серийному железу Vera, с замером частоты и энергопотребления, тестами Spatial Multithreading в режимах включено и выключено и возможностью гонять любые бенчмарки по своему выбору, чтобы будущие результаты убеждали сами по себе, без диаграмм-метафор: по мнению авторов, у NVIDIA уже достаточно сильный чип, и маркетинг рискует лишь испортить ему репутацию.

Ключевые факты

  • Независимый тест Phoronix (Майкл Ларабел, май) на предсерийном образце дал Vera геометрическое преимущество на 10% над EPYC 9575F (5 ГГц), в 1,55 раза над Xeon 6980P и в 1,63 раза над Grace, притом что тестовый набор и условия выбирала сама NVIDIA.
  • Диаграмма SMT в вайтпейпере изображает x86 как менее эффективную «нарезку времени», хотя стадии исполнения и доступа к памяти у x86-ядер на практике потокобезразличны и не простаивают так, как показано; сам документ обосновывает Spatial Multithreading через детерминированность и качество обслуживания, а не производительность.
  • Заявление «до 32 доменов NUMA» у x86-систем описывает опциональную максимальную конфигурацию (режимы NPS4, NPS0), а не типичный режим работы: вайтпейпер подаёт её как неизбежную данность x86, хотя это лишь один полюс настраиваемого спектра.
  • Четыре стандартных теста SPEC CPU 2026 (CPython, GCC, LLVM, Cppcheck) названы «агентными бенчмарками», хотя ни один не запускает модель или агентную среду исполнения; реальное преимущество по всему набору SPECrate 2026 Integer Base, 3,0% на уровне системы (925 очков против 898 у двух сокетов), а не показанные в графике 1,7, 1,8 раза на ядро.
  • Собственный тест Chips and Cheese дал для EPYC 9755 (Turin) пропускную способность около 570 ГБ/с против ~400 ГБ/с в графике NVIDIA; с поправкой преимущество Vera по памяти, около 1,9 раза по общей полосе и 2,8 раза на ядро, а не «почти 3 раза», как в вайтпейпере, а против EPYC 9575F, рекомендованного для ИИ-узлов, вообще около 40%.

Почему это важно

NVIDIA выходит на рынок серверных CPU совершенно новым чипом собственной разработки, Olympus, и вайтпейпер Vera должен убедить дата-центры выбирать её вместо привычных AMD EPYC и Intel Xeon. Разбор Chips and Cheese интересен не только оценкой одного продукта: он показывает конкретный набор приёмов, которыми вендорский документ может смешивать реальную инженерную силу с искажённой конкурентной риторикой, переименование обычных тестов в «агентные», диаграмму, где визуальное пространство подменяет данные, сравнение с необязательной, а не типичной конфигурацией конкурента. Показательно и то, что слово «агентный» здесь используется как маркетинговый ярлык для рядовых процессорных тестов, наглядный пример того, как быстро этот термин штампуют на что попало на фоне интереса к ИИ-агентам.

Кому это важно

Инженерам и архитекторам, которые выбирают процессоры для дата-центров и инфраструктуры под ИИ-нагрузки, именно они читают подобные вайтпейперы перед закупкой. Аналитикам и журналистам, следящим за рынком серверных CPU, где NVIDIA бросает вызов многолетним лидерам AMD и Intel. Самим AMD и Intel, чьи продукты в вайтпейпере сравниваются с их же необязательными или устаревшими конфигурациями. И читателям, которым интересно, как отличить реальное технологическое превосходство от маркетинговой обёртки вокруг него.

Как это применить

Перед тем как цитировать или закладывать в закупочное решение вендорский вайтпейпер, стоит искать не нормализованные показатели «на ядро», а итоговые цифры на уровне всей системы: в этом случае разница между заявленными 1,7, 1,8 раза на ядро и реальными 3,0% на уровне системы решает, насколько выигрышна презентация. Стоит требовать раскрытия методики для любых счётчиков IPC и «агентных» результатов, без определения событий, интервалов замера и частот такие цифры непроверяемы. При сравнении пропускной способности памяти важно смотреть, какую долю от теоретического максимума показал каждый чип, а не только заявленную кратность разрыва. И стоит учитывать, что база сравнения в вендорских документах устаревает быстро, здесь сопоставление с Turin устарело буквально через два дня после публикации, когда AMD выпустила новое поколение EPYC.

Можно ли доверять

Источник, Chips and Cheese, специализированное издание о микроархитектуре процессоров; материал подписан главным редактором Джорджем Козмой и соавтором Честером Лэмом. Разбор методологически аккуратен: авторы не отвергают вайтпейпер целиком, а прямо признают то, что в нём корректно, маркировку SPEC-оценок как оценок, реальную силу ядра Olympus, независимые цифры Phoronix, и подкрепляют собственную критику по памяти собственными измерениями Turin (570 ГБ/с), а не одним лишь утверждением. Ответа или комментария NVIDIA на эту конкретную критику в статье нет, это критика одной стороны, которая пока не получила публичной реакции вендора. Часть выводов о самом чипе Vera тоже предварительна: единственный независимый тест провёл Phoronix за один день на предсерийном образце и в рамках, которые определяла сама NVIDIA.

Риски и подводные камни

Главный риск, принять яркие цифры вайтпейпера («почти 3 раза по памяти», «2,6 раза по PageRank», «1,8 раза при обучении с подкреплением») за подтверждённый факт: по разбору Chips and Cheese, часть из них вообще не проверяема, методика по графикам PageRank и обучения с подкреплением не раскрыта, а часть при перепроверке заметно сжимается, как в случае с памятью, где разрыв падает с почти 3 раз до 1,9 раза по общей полосе. Второй риск, база сравнения самого вайтпейпера уже устарела: новое поколение EPYC AMD вышло через два дня после публикации и по памяти теоретически обгоняет Vera в топовой конфигурации. Третий риск, данные о самом чипе Vera пока ограничены одним предсерийным образцом и одним днём независимого тестирования; более широкая картина появится, когда чип станет доступен вне лабораторий NVIDIA.

«Ничто из этого не делает Vera медленным чипом, это лишь означает, что у NVIDIA меньше доказательств, чем прозы в её маркетинговых материалах.»

— Джордж Козма и Честер Лэм, Chips and Cheese