Cornelis и Delos Data бросили вызов NVLink Nvidia

Технологии scale-up-сетей объединяют несколько ускорителей в единый гигантский «виртуальный» GPU, и сегодня эту нишу прочно удерживает Nvidia: её фирменный NVLink уже позволяет восьми, 72 и, на последнем поколении систем, 576 GPU работать как единое целое. Соперники вроде AMD пока используют для этого открытый протокол Ultra Accelerator Link (UALink), но «туннелируют» его через обычные коммутаторы Ethernet: например, ускорители AMD MI455X подключаются через коммутаторы Broadcom на основе чипа Tomahawk 6 пропускной способностью 102,4 Тбит/с. Специализированных коммутаторов и физических интерконнектов, изначально спроектированных под такие открытые протоколы, на рынке пока не было. На этой неделе на конференции AI Infra Summit это начало меняться: сетевые компании Cornelis Networks и Delos Data официально объявили о выходе на рынок scale-up-сетей, каждая со своим подходом к тому, как обойтись без фирменной технологии Nvidia.
Cornelis Networks, специализирующаяся на сетях для высокопроизводительных вычислений (HPC), была выделена из Intel в 2020 году; её более ранняя технология Omni-Path изначально создавалась как интерконнект для объединения множества узлов в суперкомпьютерах, включая Trinity и Lynx. В понедельник на AI Infra компания представила открытую архитектуру Active Compute Fabric (ACF): она расширяет протоколы UALink и Ethernet for Scale-Up Networking (ESUN), встраивая программируемые вычисления прямо в сетевую инфраструктуру, и рассчитана не только на собственное оборудование Cornelis серии CN, но и на оборудование других производителей. По сути, ACF пытается в открытом виде повторить то, что Nvidia уже делает в своих проприетарных коммутаторах NVSwitch, где поддержка технологии SHARP позволяет выгружать на коммутатор часть коллективных сетевых операций, снимая нагрузку с самих GPU и снижая накладные расходы на коммуникацию. Cornelis перечисляет более широкий список задач, которые ACF должна ускорять на уровне сети: выгрузку KV-кэша (хранения и извлечения состояния модели между сессиями), диспетчеризацию обращений к экспертам в MoE-моделях, разгрузку интерфейса передачи сообщений (MPI) для HPC-приложений и создание контрольных точек прямо в сети для восстановления после сбоев при обучении и других больших нагрузках. «Накладные расходы на коммуникацию и синхронизацию могут оставлять дорогие ускорители недозагруженными», говорится в заявлении компании; такие сетевые ускорители, по её словам, «позволяют сети обрабатывать данные прямо по ходу их движения через систему». По собственному моделированию Cornelis на основе публичных данных, в системе на 100 000 GPU примерно половина всех GPU-часов уходит на ожидание данных, это около $1,68 млрд потерянной производительности в год и 500 ГВт·ч энергии; сама The Register при этом предупреждает, что к такой оценке стоит относиться скептически. Помимо архитектуры ACF, Cornelis готовит к скорому выпуску коммутаторы и сетевые адаптеры серии CN6000 пропускной способностью 800 Гбит/с и объявила о привлечении примерно $205 млн финансирования на разработку сетевых продуктов следующего поколения.
Delos Data, стартап, основанный бывшими руководителями Barefoot Networks и Intel, пошла другим путём и показала не архитектуру, а готовое «железо»: линейку интерконнектов под брендом Nonstop AI, от совместно упакованных (co-packaged) соединителей до более традиционных сетевых адаптеров (NIC). Все продукты Delos протокол-агностичны, работают и с ESUN, и с UALink, и с другими протоколами, и рассчитаны в первую очередь на производителей ускорителей, которые предпочли бы вложить инженерные усилия в сам ИИ-чип, а не в разработку собственного интерконнекта: по словам компании, это относится к большинству гиперскейлеров, которые в таком случае могут просто лицензировать чиплет-дизайн Delos. Линейка строится на трёх типах решений. Первое, кристалл ввода-вывода с совокупной пропускной способностью более 30 Тбит/с (около 8 ТБ/с в каждом направлении), это более чем вдвое выше предела в 3,6 ТБ/с, которым, по данным статьи, ограничены нынешние старшие ускорители Nvidia и AMD; насколько это окажется конкурентоспособным на практике, зависит от того, когда чиплеты Delos дойдут до реального развёртывания, а сроки, в свою очередь, зависят от глубокой совместной разработки с производителями ускорителей, такой кристалл должен быть интегрирован прямо в корпус чипа. При этом, подчёркивает издание, Delos, в отличие от Nvidia с её NVLink Fusion, не пытается привязать клиентов к закрытой экосистеме: на момент публикации статьи Nvidia всё ещё требует от клиентов NVLink Fusion покупать собственные коммутаторы NVSwitch для scale-up-сетей. Второе решение, технология «оптики, встроенной рядом с корпусом чипа» (near-packaged optics, NPO) с пропускной способностью интерфейса более 10 Тбит/с (или 2,5 ТБ/с в двух направлениях, если считать так, как принято у Nvidia); она нужна потому, что по мере роста кластеров, от стоечных систем на 72 GPU (как нынешний NVL72 у Nvidia) до кластеров на уровне ряда стоек на 576, а в перспективе и на 1152 GPU, одной медной проводки, которой сегодня в основном ограничиваются из-за энергопотребления, уже не хватает, а модули NPO при этом можно обслуживать и заменять отдельно, не встраивая оптику прямо в сам ускоритель. Третье, сетевой адаптер на более чем 400 Гбит/с для scale-out-сетей: обучающих кластеров, а также сетей доступа и хранения данных. Все эти интерфейсы дополняют более раннюю референсную архитектуру вычислительных систем Delos, с которой The Register уже знакомилось на Computex, и её программную платформу Nonstop AI, которая настраивает и мониторит такие сети и умеет динамически перенаправлять трафик при обрыве связи, используя телеметрию с самих сетевых интерфейсов. Во вторник Delos Data объявила, что в сумме уже привлекла более $100 млн финансирования при поддержке венчурных фондов Matrix, Playground и Socratic Partners.
Ключевые факты
- На AI Infra Summit сетевые компании Cornelis Networks и Delos Data официально вышли на рынок scale-up-сетей, технологий, объединяющих множество GPU в единый ускоритель, как альтернативы фирменному NVLink Nvidia; сейчас NVLink доводит такое объединение до 576 GPU (было 8, затем 72).
- Cornelis Networks, выделенная из Intel в 2020 году, представила открытую архитектуру Active Compute Fabric (ACF) поверх протоколов UALink и Ethernet for Scale-Up Networking (ESUN): она выгружает в сеть KV-кэш, диспетчеризацию MoE-моделей, интерфейс MPI и контрольные точки восстановления; компания также готовит коммутаторы и адаптеры серии CN6000 на 800 Гбит/с и привлекла около $205 млн финансирования.
- По собственному моделированию Cornelis, которое сама The Register просит не принимать на веру, в гипотетической системе на 100 000 GPU простой ускорителей в ожидании данных обходится примерно в $1,68 млрд в год и 500 ГВт·ч энергии.
- Delos Data, основанная бывшими руководителями Barefoot Networks и Intel, показала протокол-агностичную линейку Nonstop AI: кристалл ввода-вывода на более чем 30 Тбит/с (около 8 ТБ/с в каждом направлении, более чем вдвое выше сегодняшнего предела Nvidia и AMD в 3,6 ТБ/с), оптические модули NPO на 10+ Тбит/с и сетевой адаптер на 400+ Гбит/с; всего компания привлекла более $100 млн.
- Ни одна из компаний не назвала цену своих продуктов и точные сроки поставок: коммутаторы CN6000 у Cornelis лишь готовятся к скорому выпуску, а сроки у Delos напрямую зависят от совместной разработки с производителями ускорителей, в чей корпус должен встраиваться её кристалл ввода-вывода.
Почему это важно
Компании, которые контролируют технологию scale-up-сетей, объединение множества ускорителей в единый гигантский «виртуальный» GPU, фактически контролируют критический слой инфраструктуры для обучения и запуска крупнейших ИИ-моделей. Сегодня эту нишу почти безраздельно держит Nvidia с фирменным NVLink: именно эта технология позволяет 576 GPU в её новейших системах работать как единое целое, а клиентам, которым нужен такой масштаб, приходится покупать коммутаторы Nvidia NVSwitch. Выход Cornelis Networks и Delos Data на AI Infra Summit, первая по-настоящему предметная попытка предложить альтернативу: не абстрактный «открытый протокол», а конкретную архитектуру (ACF у Cornelis) и конкретное «железо» (линейка Nonstop AI у Delos), рассчитанные на открытые протоколы UALink и ESUN, а не на технологию Nvidia. До сих пор такие открытые протоколы соперники вроде AMD были вынуждены «туннелировать» через обычные коммутаторы Ethernet, специализированных под них устройств просто не было.
Кому это важно
В первую очередь, производителям ИИ-ускорителей помимо Nvidia (в тексте явно упомянута AMD, которая уже использует протокол UALink через коммутаторы Broadcom) и вообще любым чипмейкерам, которые предпочли бы не тратить инженерные ресурсы на собственный интерконнект: Delos прямо говорит, что её протокол-агностичный чиплет-дизайн можно лицензировать и что это относится к большинству гиперскейлеров. Во вторую, операторам крупных ИИ-кластеров и дата-центров, для которых значим сам факт появления открытой альтернативы NVLink: она может снизить зависимость от одного поставщика и его цен на коммутаторы. В третью, инвесторам в инфраструктуру ИИ: оба раунда (около $205 млн у Cornelis и более $100 млн у Delos Data, включая фонды Matrix, Playground и Socratic Partners) показывают, что рынок сетевого оборудования для ИИ-кластеров сам по себе остаётся точкой роста, отдельной от рынка самих ускорителей.
Как это применить
Практически применить эти анонсы пока почти нельзя, оба продукта на стадии запуска, а не поставок. Коммутаторы и адаптеры Cornelis серии CN6000 (800 Гбит/с) описаны как готовящиеся к скорому выпуску, но точной даты в источнике нет. У Delos ситуация ещё менее определённая: компания не называет сроков поставки ни для кристалла ввода-вывода, ни для оптических модулей NPO, ни для сетевого адаптера, а прямо говорит, что график зависит от глубокой совместной разработки с производителями ускорителей, кристалл должен быть встроен прямо в корпус их чипов. Цену не назвала ни одна из компаний ни на одно из устройств. Единственный уже сейчас доступный путь применения, лицензирование: Delos прямо предлагает чипмейкерам, которые не хотят разрабатывать интерконнект самостоятельно, лицензировать её протокол-агностичный чиплет-дизайн. Для остальных практический шаг на этом этапе, оценка архитектуры ACF и решений Delos при планировании следующего поколения ускорителей и кластеров, а не закупка уже сейчас.
Можно ли доверять
Ключевые технические и экономические цифры в материале исходят только от самих компаний, источник (The Register) не приводит собственных измерений или тестов ни для одного из продуктов. Самая заметная цифра, что простой ускорителей в гипотетической системе на 100 000 GPU обходится примерно в $1,68 млрд в год и 500 ГВт·ч энергии, прямо названа результатом «моделирования Cornelis на публичных данных», а не независимо подтверждённым фактом, и сама The Register оговаривается, что к этой оценке стоит относиться скептически. Цитаты Cornelis в материале приписаны не конкретному сотруднику, а обезличенно «компании». Ни Cornelis, ни Delos Data не раскрывают оценку стоимости бизнеса, только суммы привлечённого финансирования. Источник также не сообщает, есть ли у ACF, UALink или ESUN хотя бы один подтверждённый заказчик и поставлялось ли уже это оборудование кому-либо, то есть речь идёт именно об анонсе, а не о проверенном на практике продукте.
Риски и подводные камни
Открытость архитектур пока декларативная: в источнике нет ни одного названного заказчика ни для ACF, ни для линейки Delos, и неясно, поддержит ли рынок именно эти протоколы (UALink, ESUN) или предпочтёт закрытую, но уже работающую экосистему Nvidia. Одновременное существование нескольких «открытых» стандартов (UALink, ESUN, ACF) наряду с проприетарным NVLink/NVLink Fusion Nvidia само по себе создаёт риск фрагментации: клиент, выбравший не тот стандарт, рискует получить не меньшую привязку к поставщику, только с другим именем. Самый технически впечатляющий продукт Delos, кристалл ввода-вывода, требует глубокой совместной разработки с производителями ускорителей ещё до того, как сможет выйти на рынок, а значит его реальные сроки и судьба зависят от решений, которые Delos не контролирует. Экономическое обоснование Cornelis, $1,68 млрд и 500 ГВт·ч ежегодных потерь, это собственная модель компании, которую источник прямо просит не принимать на веру. И, наконец, Nvidia не стоит на месте: её NVLink и NVLink Fusion, включая сетевые вычисления SHARP в коммутаторах NVSwitch, уже существуют и поставляются сегодня, то есть открытые конкуренты пытаются догнать движущуюся цель, оставаясь при этом сами на стадии анонса.
«По данным моделирования Cornelis на основе публичных данных, в системе на 100 000 GPU примерно половина всех GPU-часов уходит на ожидание данных, это около $1,68 млрд потерянной производительности в год и 500 ГВт·ч энергии.»
— Cornelis Networks