Meta показала чип MTIA 400: обучает ИИ-модели и обслуживает рекламу

Meta на конференции Hot Chips подробно раскрыла характеристики чипа MTIA 400 (Meta Training and Inference Accelerator), своего первого полноценного ускорителя для генеративного ИИ, анонсированного ранее в этом году. В отличие от типичного подхода конкурентов, которые для инференса начинают с более простых и дешёвых чипов (как новые инференс-чипы OpenAI под названием Jalapeño), MTIA 400 нацелен в первую очередь на обучение больших языковых моделей. Одновременно чип возьмёт на себя инференс рекомендательных систем для рекламы (DLRM, deep learning recommender model), именно эта нагрузка приносит Meta основной доход. Сочетание необычное: обучение LLM требует огромных вычислительных мощностей (десятки-сотни тысяч ускорителей), а DLRM-инференс упирается прежде всего в память, поэтому часть вычислительных блоков чипа при этой нагрузке будет простаивать. Автор статьи отмечает, что при нынешних тратах Meta на вычисления совмещение двух задач в одном чипе выгодно, особенно если одна из них высокоприбыльна.
Архитектурно MTIA 400, гетерогенный мультичиповый (chiplet) дизайн: два вычислительных кристалла, два кристалла ввода-вывода и SoC-кристалл, отвечающий за подключение к хосту и оркестрацию нагрузки. По оценке автора, чип почти наверняка построен на IP-технологии XPU компании Broadcom, а вычислительные чиплеты изготовлены по 3-нм техпроцессу, предположительно на мощностях TSMC, оба этих момента официально не подтверждены Meta. Каждый вычислительный чиплет содержит сетку процессорных элементов 6×8; суммарно два чиплета выдают 12 петафлопс в формате MXFP4 на частоте 1,7 ГГц. По производительности на высокой точности, которая обычно используется для обучения, MTIA 400 примерно на 20% быстрее топовых ускорителей Nvidia Blackwell при сопоставимом энергопотреблении. Но по сравнению с ускорителями следующего поколения, Nvidia Rubin и AMD Instinct MI455X, MTIA 400 отстаёт в 3 и 3,3 раза соответственно.
Память чипа, восемь стеков HBM3e по 36 ГБ, суммарно 288 ГБ с пропускной способностью около 9,2 ТБ/с: это примерно на 15% быстрее ускорителей прошлого поколения от Nvidia и AMD, но менее половины пропускной способности их новых GPU. Пара чиплетов ввода-вывода обеспечивает 1,2 ТБ/с пропускной способности между чипами по RDMA; какая именно транспортная технология используется, автор не знает, но предполагает Ethernet, учитывая участие Broadcom. На уровне системы четыре ускорителя MTIA 400 объединяются в один вычислительный блейд через PCIe-коммутатор вместе с x86-процессором и сетевой картой для масштабирования; стойка включает 18 вычислительных блейдов и восемь коммутационных, всего 72 ускорителя в едином домене. Максимальный размер кластера Meta не раскрыла, презентационные слайды ограничиваются формулировкой «масштабирование на многие тысячи ускорителей».
Автор подчёркивает, что даже с учётом двойного назначения собственный кремний вряд ли в ближайшее время заменит GPU AMD и Nvidia: их чипы пока лучше подходят для LLM-инференса, и именно их, по всей видимости, использует подразделение Meta Superintelligence Labs для обучения флагманских моделей вроде Muse Spark. Помимо MTIA 400 Meta готовит инференс-версию MTIA 450, анонсированную ещё в марте, с вдвое большей пропускной способностью памяти (предположительно за счёт перехода с HBM3e на HBM4); её выход в производство запланирован на следующий год. Далее должен последовать MTIA 500, ожидается в 2027 году (вероятно, во второй половине), с ростом пропускной способности памяти ещё на 50% и удвоенным числом вычислительных чиплетов.
Ключевые факты
- MTIA 400, первый полноценный генеративный ИИ-ускоритель Meta, представлен на конференции Hot Chips; в отличие от подхода конкурентов, нацелен прежде всего на обучение LLM, а не на инференс
- Чип совмещает обучение моделей с инференсом рекламных рекомендательных систем (DLRM), необычное сочетание задач с разными требованиями к вычислениям и памяти
- 12 петафлопс MXFP4 на 1,7 ГГц: примерно на 20% быстрее топовых Nvidia Blackwell на точности для обучения, но в 3, 3,3 раза медленнее ускорителей следующего поколения, Nvidia Rubin и AMD Instinct MI455X
- 288 ГБ памяти HBM3e при 9,2 ТБ/с, быстрее чипов прошлого поколения Nvidia и AMD, но менее половины пропускной способности их новых GPU
- Стойка объединяет 72 ускорителя (18 вычислительных и 8 коммутационных блейдов); следующие чипы, инференс-версия MTIA 450 (в производстве со следующего года) и MTIA 500 (2027 год)
Почему это важно
MTIA 400, попытка Meta снизить зависимость от Nvidia и AMD там, где компания тратит больше всего: на обучение ИИ-моделей и на инфраструктуру для показа рекламы. Совмещение обеих задач в одном чипе, редкий архитектурный выбор: обычно компании (включая саму Meta, Amazon и Google в прошлом) начинали собственный кремний именно с инференса как более простой и дешёвой задачи. Здесь же чип с самого начала спроектирован под тяжёлое обучение LLM, а инференс рекламных моделей, дополнительная, но прибыльная нагрузка сверху.
Кому это важно
Новость касается инженеров и аналитиков, следящих за стратегией собственного кремния у гиперскейлеров, конкурентов Meta по железу, Nvidia, AMD и Broadcom (чья IP-технология, по оценке автора, почти наверняка легла в основу чипа), а также инвесторов, оценивающих капитальные затраты Meta на инфраструктуру ИИ.
Как это применить
MTIA 400, внутренний инфраструктурный чип Meta, не продукт для рынка: в источнике нет ни цены, ни даты начала эксплуатации самого MTIA 400, ни подтверждения общедоступности. Практический вывод скорее для тех, кто строит похожую инфраструктуру: конфигурация из четырёх ускорителей на блейд и 72 ускорителей на стойку, ориентир по плотности и топологии, сопоставимый со стойками Nvidia GB200/GB300.
Можно ли доверять
Данные взяты не из официального пресс-релиза Meta, а из презентации и слайдов на конференции Hot Chips в пересказе автора The Register. Ряд деталей, использование IP-технологии Broadcom, изготовление на мощностях TSMC по 3-нм техпроцессу, транспортная технология для RDMA-соединения, явно помечены автором как предположения, а не подтверждённые Meta факты.
Риски и подводные камни
Несмотря на превосходство над нынешними топовыми чипами Nvidia Blackwell, MTIA 400 уже отстаёт от ускорителей следующего поколения, Nvidia Rubin и AMD Instinct MI455X, в 3, 3,3 раза, а по пропускной способности памяти проигрывает их новым GPU более чем вдвое. Поэтому, по оценке автора, собственный кремний Meta в обозримом будущем не заменит GPU AMD и Nvidia для обучения флагманских моделей, для этого, вероятно, по-прежнему используются чипы сторонних производителей.
«Презентационные слайды формулируют это просто: «масштабирование на многие тысячи ускорителей»»
— презентация Meta на конференции Hot Chips
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.