OpenAI Jalapeño обошёл Nvidia Blackwell в тестах SemiAnalysis

OpenAI на конференции Hot Chips впервые подробно показала инференс-чип с кодовым названием Jalapeño, который компания вместе с Broadcom разрабатывает уже больше года. Партнёрство с Broadcom было публично анонсировано в июне; само проектирование чипа началось в середине 2024 года, и путь от найма команды до тейпаута (передачи проекта в производство) занял около 16 месяцев, очень быстрый цикл для ASIC. Аналитическое издание SemiAnalysis получило доступ в лаборатории OpenAI, увидело чип вживую и прогнало на нём собственный тестовый набор InferenceX.
По итогам тестов SemiAnalysis утверждает, что Jalapeño обходит по эффективности (производительности на ватт) все протестированные чипы Nvidia, AMD и Google на нескольких открытых моделях, редкий случай, когда чип первого поколения оказывается конкурентоспособным. Вопреки репликам в СМИ о «чипе под конкретные модели OpenAI», авторы настаивают: Jalapeño, универсальный инференс-чип, эффективно работающий с разными моделями и нагрузками. В качестве демонстрации инженеры OpenAI даже показали, как на чипе через промпты Codex запустили Doom.
Конкретные цифры: на модели DeepSeek R1 при параллелизме 1 (один запрос на пользователя) Jalapeño выдаёт свыше 700 токенов в секунду на пользователя; на GPT-OSS, около 1400 токенов в секунду на пользователя, а результаты по бенчмарку GSM8k у Jalapeño на всех протестированных моделях сопоставимы с чипами Nvidia. На модели Kimi K2.5 чип показывает почти 700 ток/с на пользователя и более чем в 9 раз опережает ближайшего конкурента на отметке 100 ток/с на пользователя; на GPT-OSS пропускная способность на мегаватт почти вдвое выше лучшего показателя GB200 и более чем в 50 раз выше показателя GB200 при параллелизме 1. Все эти результаты получены без спекулятивного декодирования и без разделения prefill и decode по разным пулам чипов, Jalapeño использует единый однородный пул.
SemiAnalysis сама оговаривает ограничения сравнения. Во-первых, все цифры предоставлены OpenAI; издание лично проверило прогоны InferenceX в лаборатории, но не запускало полный набор тестов само и не видело результатов по AgentX, своему предпочтительному бенчмарку, который учитывает длинный контекст и многоходовые сценарии, характерные для реальных продакшен-нагрузок. Во-вторых, сравнение именно с Blackwell авторы называют «неполным и не совсем честным»: настоящий конкурент Jalapeño, чип Nvidia Rubin, тоже построенный на памяти HBM4; по более ранним расчётам SemiAnalysis, система Vera Rubin NVL72 выдаёт в 5,4 раза больше производительности на мегаватт, чем GB200 NVL72. Даже при сравнении с июльскими показателями Vera Rubin пропускная способность Jalapeño на мегаватт (без спекулятивного декодирования) превосходит результаты Rubin с этим механизмом и намного превышает мегаваттные показатели GB200 2025 года. По стоимости выдачи токена (perf/TCO) Jalapeño и Vera Rubin примерно на равных, но Rubin достигает этого с помощью спекулятивного декодирования, которое само по себе снижает цену токена в 3, 5 раз, то есть при внедрении этой техники на Jalapeño его экономика может ещё улучшиться. Часть выигрыша по стоимости также объясняется тем, что маржа Broadcom ниже маржи Nvidia (хотя и всё равно высокая); авторы отмечают, что дело не только в этом, иначе собственные ASIC-программы Meta и Microsoft, которые компании ведут дольше, тоже были бы успешны.
В-третьих, протестированные модели, не самые крупные и не самые свежие: у Nvidia и AMD есть публикации по более тяжёлым моделям вроде DeepSeek V4 Pro и Kimi K3 на бенчмарке AgentX, а чем крупнее и новее модель, тем сложнее её «завести» на новом чипе. Наконец, все приведённые результаты получены на ревизии A0, всего через 9 месяцев после старта программы; в производстве уже следующая ревизия B0, которая должна дать ещё около 25% прироста производительности на ватт. По паспортным характеристикам B0 показывает 13,4 петафлопс в формате MXFP4 на одном вычислительном чиплете размером с полную фотолитографическую матрицу (техпроцесс TSMC N3P) при тепловом пакете 700 Вт, для сравнения, у сопоставимого по размеру и техпроцессу вычислительного чиплета Rubin заявлено 17,5 петафлопс в формате NVFP4 при тепловом пакете 900, 1150 Вт на кристалл. По полосе пропускания памяти на ватт и по флопс на ватт Jalapeño сопоставим с конфигурацией Rubin Max-Q на 1800 Вт. Память, HBM4 (полоса 15,4 ТБ/с на пакет, больше, чем у конкурентов на HBM3E), межчиповый обмен идёт через отдельный чиплет ввода-вывода с 32 линиями SerDes на 800 Гбит/с: 24 линии (600 ГБ/с), для масштабирования внутри стойки, 8 линий (200 ГБ/с), для связи между стойками в домене из 2048 чипов; для подключения к процессору хоста используется PCIe Gen 5. До серийных поставок при этом ещё далеко, пока существуют только инженерные образцы.
Ключевые факты
- OpenAI и Broadcom показали на Hot Chips инференс-чип Jalapeño; путь от найма команды до тейпаута занял около 16 месяцев.
- По тестам SemiAnalysis (набор InferenceX) Jalapeño обходит по производительности на ватт протестированные чипы Nvidia, AMD и Google: свыше 700 ток/с на пользователя на DeepSeek R1 и около 1400 ток/с на пользователя на GPT-OSS.
- Все цифры предоставлены самой OpenAI; SemiAnalysis лично проверила прогоны в лаборатории, но не запускала полный набор тестов сама и не видела результатов по AgentX, своему бенчмарку для реалистичных многоходовых нагрузок.
- Настоящий соперник, не Blackwell, а Nvidia Rubin (тоже на HBM4): по стоимости токена они примерно на равных, хотя Rubin использует спекулятивное декодирование, а Jalapeño, нет.
- Показанные результаты получены на ревизии чипа A0 (9 месяцев в программе); в производстве уже ревизия B0 с приростом около 25% производительности на ватт, но серийного чипа пока нет, только инженерные образцы.
Почему это важно
OpenAI впервые показала работающий кремний собственной разработки для инференса, и, по оценке независимого (хотя и приглашённого самой компанией) аналитического издания, чип первого поколения обходит по эффективности профильные чипы Nvidia, AMD и Google, обычно так не бывает. Это укладывается в тренд, о котором на Hot Chips 2026 говорила и Nvidia: дата-центры сегодня упираются не в бюджет, а в лимит электроэнергии, поэтому решает не цена чипа, а количество токенов на ватт. Если Jalapeño действительно масштабируется до серийного производства, OpenAI получает рычаг снижения себестоимости вывода своих моделей и меньшую зависимость от Nvidia.
Кому это важно
Операторам дата-центров и облачным провайдерам, выбирающим инференс-железо; конкурентам и партнёрам OpenAI по железу, Nvidia, AMD, Broadcom, Google, а также Meta и Microsoft с их собственными, пока менее успешными программами ASIC; самой OpenAI, для которой экономика чипа напрямую влияет на стоимость обслуживания её моделей.
Как это применить
Практического применения для читателя пока нет: чип существует только в виде инженерных образцов ревизии A0, дата серийных поставок не названа. Тем, кто планирует закупки инференс-инфраструктуры, стоит дождаться результатов на бенчмарке AgentX (длинный контекст, многоходовые сценарии) и характеристик готовящейся ревизии B0, прежде чем делать выводы о применимости этих цифр к реальному продакшену.
Можно ли доверять
Осторожно. Все приведённые числа предоставлены самой OpenAI; SemiAnalysis лично наблюдала прогоны InferenceX в лаборатории, но не запускала полный набор тестов самостоятельно и не видела результатов по AgentX, своему более показательному для продакшена бенчмарку. Сами авторы называют сравнение с Blackwell «неполным и не совсем честным», поскольку настоящий соперник Jalapeño, ещё не полностью раскрытый Rubin, а протестированные модели (DeepSeek R1, GPT-OSS, Kimi K2.5) не самые крупные и не самые свежие, Nvidia и AMD публикуют результаты и на более тяжёлых моделях. Плюс всё это, ревизия A0 чипа, которого пока нет в серийном виде.
Риски и подводные камни
Ключевой риск, асимметрия сравнения: Jalapeño протестирован без спекулятивного декодирования, а сравниваемый с ним Rubin, с ним, а эта техника сама по себе снижает цену токена в 3, 5 раз, так что итоговое соотношение стоимости может измениться в любую сторону при доработке. Нет данных по AgentX (длинный контекст, многоходовые сценарии), такие нагрузки обычно проседают на новом железе сильнее простых тестов. Часть заявленного выигрыша по стоимости объясняется просто более низкой маржой Broadcom, а не превосходством архитектуры, сами авторы отмечают, что одного этого недостаточно для успеха ASIC-программы, ссылаясь на неудачи похожих проектов Meta и Microsoft. Наконец, до серийного чипа ещё далеко: есть только инженерные образцы ревизии A0, а более быстрая ревизия B0 пока в производстве.
«Если у вас есть один гигаватт мощности, то производительность на ватт, это и есть выручка»
— Дженсен, на конференции Computex 2026 (по данным SemiAnalysis)
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.