Nvidia, Amazon и Anthropic перестраивают стратегию под инференс: обучение ИИ отходит на второй план

Nvidia, Amazon и Anthropic перестраивают стратегию под инференс: обучение ИИ отходит на второй план

В 2026 году внимание ИИ-индустрии сместилось с обучения больших языковых моделей на инференс, их практическое использование после обучения. «Это как будто обучение, вчерашняя новость. Всё, о чём хочет говорить любой ИТ-директор, это инференс», говорит Мэтт Кимбалл, ведущий аналитик по дата-центрам в Moor Insights & Strategy. Гендиректор Nvidia Дженсен Хуанг на конференции компании GTC 2026 назвал происходящее «точкой перелома для инференса». Сами модели за это время заметно продвинулись: старшая версия GPT-3 (OpenAI), вышедшая в 2020 году, правильно отвечала на 43,9% вопросов неназванного популярного теста на знания и рассуждения, а GPT-4o четыре года спустя набрала на том же тесте 88,7%, источник называет это фактическим сравнением с результатами экспертов-людей.

Инференсная нагрузка выросла резко по двум причинам. Во-первых, распространились рассуждающие модели: отвечая на запрос, они прогоняют инференс не один раз, а многократно, переспрашивая сами себя в процессе «цепочки рассуждений» (chain of thought), модели с высоким уровнем рассуждений генерируют до 20 раз больше текста, чем модели с низким уровнем рассуждений или без него. Во-вторых, распространился агентный ИИ: теперь инференс работает не только как ответ на запрос пользователя в реальном времени, но и круглосуточно, самостоятельно, в сторону цели, заданной пользователем.

Инференс и обучение технически устроены по-разному. Модель отвечает в два этапа. Prefill (предзаполнение), это чтение запроса: все токены обрабатываются параллельно, а их взаимные связи вычисляются механизмом «attention» (внимание), это отличительная черта архитектуры трансформера, на которой построены современные языковые модели. Decode (декодирование), это пошаговая генерация ответа: на каждом шаге модель сверяет последний токен со всем, что хранится в KV-кэше (кэше ключей и значений), предсказывает следующий токен и дописывает его в кэш. Именно decode работает против скорости инференса: чтобы предсказать всего один токен, нужно прочитать из памяти всю модель, от десятков до сотен гигабайт параметров, а сверх этого ещё и KV-кэш, который начинается небольшим, но может разрастись до десятков гигабайт. Из-за этого движение данных через память часто требует большей пропускной способности, чем доступно железу, и вычислительные блоки простаивают в ожидании: по данным исследователей, GPU Nvidia H100 при работе с открытыми LLM простаивают 50, 80% времени. «При GPU-подходе вы получаете сильный избыток вычислений и нехватку памяти. Именно это и подстёгивает масштабный рост памяти», объясняет Шахриар «Ша» Рабии, бывший глава разработки кремния в Meta и сооснователь стартапа Majestic Labs.

Именно упор в память, а не в вычисления, привёл к неожиданным альянсам среди технологических гигантов. Nvidia выкупила ключевых специалистов и интеллектуальную собственность ИИ-стартапа Groq (не путать с Grok, семейством языковых моделей, которое обучает компания SpaceXAI) в сделке стоимостью $20 млрд, которую источник называет спорной. Amazon Web Services, при наличии собственных чипов Trainium (изначально созданных для обучения), разбила инференс на две части: Trainium берёт на себя более вычислительно сложную часть, а чип Cerebras размером с обеденную тарелку (wafer-scale engine, чип во всю кремниевую пластину), более требовательную к памяти часть. OpenAI и Amazon развернули эти чипы Cerebras, хотя у Amazon уже есть собственный Trainium. Anthropic платит конкуренту SpaceXAI больше $1 млрд в месяц за аренду свободных вычислительных мощностей.

За решение проблемы памяти взялись и специализированные стартапы, каждый по-своему. Стартап d-Matrix, чей основатель и технический директор, Судип Бходжа, делает чип второго поколения Raptor: он ставит блок ускорителя прямо на кристалл DRAM вместо того, чтобы, как в обычных GPU, размещать память HBM (high-bandwidth memory) по периметру чипа. По словам Бходжи, это сокращает расстояние, которое должны пройти данные, «до микрометров вместо миллиметров». Стартап Majestic Labs, сооснованный Рабии, пошёл в обратную сторону: вместо того чтобы сокращать расстояние, компания улучшает сам интерфейс памяти, чтобы тот выдерживал более длинные проводники при высокой пропускной способности. По словам Рабии, обычный интерфейс HBM работает на расстоянии не больше 2, 3 мм по периметру чипа; фирменная медная линия и чип-агрегатор Majestic, по заявлению компании, передают данные на расстояние около метра и позволяют подключить до 128 ТБ памяти DRAM в одной серверной стойке, для сравнения, стойка Nvidia GB300 NVL72 несёт около 20 ТБ памяти HBM3E. И d-Matrix, и Majestic вместо HBM используют обычную серийную DRAM: по оценке аналитика по памяти Джима Хэнди, HBM стоит в 2, 3 раза дороже DRAM, и ценовое преимущество отчасти определило выбор обеих компаний.

Производители HBM, в первую очередь Samsung и SK Hynix, не сидят сложа руки. Новое поколение памяти HBM4 уже выпускается и появится в GPU Nvidia Vera Rubin, который должен выйти во второй половине 2026 года. «HBM4 решительно снимет ограничения памяти, сдерживающие сегодня инференс ИИ», говорит Хошик Ким, глава исследований систем памяти в SK Hynix; по словам Кима, новая память вдвое увеличит максимальную пропускную способность HBM и увеличит объём памяти на стек (конкретную цифру источник не приводит).

В итоге крупные игроки, Nvidia и Amazon, используют собственные GPU и чипы Trainium там, где те по-прежнему хороши: на этапе prefill, где считаются все ключи и значения контекста. А для ускорения decode, где генерируются новые токены, оба обращаются к новым, ориентированным на память архитектурам от игроков поменьше, в случае Nvidia это как раз технология, купленная у Groq: на подписи к одному из изображений источник называет получившийся чип «языковым процессором Groq 3», который сокращает движение данных, размещая SRAM-память и вычислительные блоки на кристалле в том порядке, в котором они нужны. Сохранившийся у нас текст обрывается на полуслове ровно в момент, когда должен был начаться рассказ о том, что именно Nvidia показала на конференции GTC 2026, поэтому дальнейшие подробности в этом пересказе отсутствуют.

Ключевые факты

  • В 2026 году фокус ИИ-индустрии сместился с обучения моделей на инференс: рассуждающие модели с «цепочкой рассуждений» (chain of thought) генерируют до 20 раз больше текста, чем модели с низким уровнем рассуждений, а агентный ИИ работает не только по запросу, но и круглосуточно.
  • Проблема не в вычислениях, а в памяти: чтобы предсказать один токен, модель должна прочитать из памяти все свои параметры (от десятков до сотен гигабайт) и весь KV-кэш, по данным исследователей, GPU Nvidia H100 на этом простаивают 50, 80% времени.
  • Nvidia выкупила ключевых специалистов и интеллектуальную собственность ИИ-стартапа Groq за $20 млрд (источник называет сделку спорной); Amazon для инференса развернула вместе с OpenAI чипы Cerebras размером с обеденную тарелку, хотя у неё уже есть собственные чипы Trainium; Anthropic платит конкуренту SpaceXAI больше $1 млрд в месяц за аренду свободных вычислительных мощностей.
  • Стартапы d-Matrix (чип Raptor, вычислительный блок прямо на кристалле DRAM) и Majestic Labs (интерфейс памяти на расстояние до метра через фирменную медную линию, заявленные до 128 ТБ DRAM на стойку) предлагают заменить дорогую память HBM, она в 2, 3 раза дороже обычной DRAM, по оценке аналитика Джима Хэнди, на массовую DRAM.
  • Производители HBM не сдают позиции: память HBM4 уже в производстве и выйдет вместе с GPU Nvidia Vera Rubin во второй половине 2026 года, по словам исследователя SK Hynix Хошика Кима, она вдвое увеличит максимальную пропускную способность HBM.

Почему это важно

Дело не в одном продукте, а в развороте всей индустрии. С 2020 года ИИ-лаборатории в основном соревновались в размере моделей, те выросли с миллионов до триллионов параметров, а точность на неназванном тесте на знания и рассуждения поднялась с 43,9% у GPT-3 (2020) до 88,7% у GPT-4o четыре года спустя. К 2026 году, по словам аналитика Мэтта Кимбалла, разговор сместился на инференс, использование уже готовых моделей, а не их обучение. Причина не только в растущей популярности ИИ, но и в самой механике: рассуждающие модели прогоняют инференс многократно (до 20 раз больше текста при высоком уровне рассуждений), а агентный ИИ работает круглосуточно, а не только в ответ на запрос. Инференс превращается из вспомогательной операции в основной источник вычислительной нагрузки, и расходов, для всей индустрии.

Кому это важно

В первую очередь, тем, кто проектирует или покупает инфраструктуру для больших языковых моделей: инженерам, отвечающим за обслуживание моделей в проде, и дата-центрам, которые выбирают железо под конкретные фазы инференса. Дальше, самим ИИ-лабораториям и облачным провайдерам: Amazon и OpenAI уже развернули чипы Cerebras, хотя у Amazon есть и собственные чипы Trainium, а Anthropic платит конкуренту SpaceXAI больше $1 млрд в месяц за аренду мощностей, то есть выбор архитектуры напрямую бьёт по счетам за вычисления. Наконец, индустрии памяти: и действующим производителям HBM (Samsung, SK Hynix), и стартапам, которые предлагают DRAM как более дешёвую альтернативу (d-Matrix, Majestic Labs), потому что от того, чья архитектура памяти закрепится, зависит расклад рынка ИИ-чипов на годы вперёд. Как формулирует аналитик Мэтт Кимбалл, инференс, это именно то, о чём сейчас хочет говорить любой ИТ-директор.

Как это применить

Для тех, кто проектирует обслуживание языковых моделей: главный вывод источника, decode (пошаговая генерация ответа) упирается не в мощность GPU, а в пропускную способность памяти, поэтому GPU Nvidia H100 на такой нагрузке простаивают 50, 80% времени. Разделение инференса на prefill и decode с разным железом под каждую фазу, уже рабочая практика у крупных игроков, а не гипотеза: именно так Amazon сочетает свои чипы Trainium с чипами Cerebras. При выборе или оценке инференс-чипа имеет смысл спросить, на чём он строится, на дорогой памяти HBM (в 2, 3 раза дороже DRAM, по оценке Джима Хэнди) или на дешёвой DRAM с нестандартным интерфейсом, как у d-Matrix и Majestic Labs, и сопоставить это с реальным объёмом контекста и KV-кэша нагрузки. На конец 2026 года стоит закладывать выход памяти HBM4 вместе с GPU Nvidia Vera Rubin: по заявлению SK Hynix, она вдвое увеличивает пропускную способность HBM. А для агентных и рассуждающих сценариев, где инференс идёт круглосуточно и кратно разрастается по объёму текста, основной статьёй вычислительных расходов стоит считать именно инференс, а не обучение.

Можно ли доверять

Источник, IEEE Spectrum, инженерное издание IEEE, а не пресс-релиз одной компании. В материале на равных приведены слова разных сторон: гендиректора Nvidia Дженсена Хуанга, технического директора стартапа d-Matrix Судипа Бходжи, сооснователя другого стартапа, Majestic Labs, Шахриара Рабии, а также аналитиков сторонних исследовательских фирм, Мэтта Кимбалла (Moor Insights & Strategy) и Джима Хэнди, аналитика по памяти, и исследователя SK Hynix Хошика Кима. Это скорее сильная сторона материала: мнения исходят не только от компаний, заинтересованных в конкретном решении. Но у пересказа есть предел: сохранившийся у нас текст обрывается на полуслове ровно там, где должен был начаться рассказ о том, что Nvidia показала на конференции GTC 2026, а заголовок статьи («Революция ИИ-железа для инференса 2026 года») намекает, что это и есть её главный поворот. Часть цифр, это заявления самой заинтересованной компании, а не независимый замер: цифры Majestic Labs про передачу данных на расстояние около метра и 128 ТБ на стойку в источнике прямо помечены как «заявляет компания», в отличие, например, от показателя ёмкости стойки Nvidia. Тест, на котором GPT-3 набрал 43,9%, а GPT-4o, 88,7%, в источнике не назван, и конкретный год результата GPT-4o тоже не указан, только «четыре года спустя» после выхода GPT-3 в 2020 году.

Риски и подводные камни

Несколько чисел в материале, это диапазоны или потолки, а не точные значения: «до 20 раз больше текста», «50, 80% простоя», «2, 3 мм», «в 2, 3 раза дороже», их не стоит округлять до одного числа или превращать «до» в «ровно столько». Сделку Nvidia с Groq источник называет «спорной», но причину не объясняет, домысливать её не стоит. Groq (чип-стартап, чьи таланты и разработки купила Nvidia) и Grok (семейство языковых моделей SpaceXAI), разные компании и продукты с похожими названиями; источник сам предупреждает о возможной путанице. Заявления Majestic Labs о передаче данных на расстояние около метра и о 128 ТБ DRAM на стойку, это слова самой компании, которая продаёт эту технологию, а не результат независимого теста; у конкурирующего d-Matrix, тот же коммерческий интерес в своей версии решения той же задачи. И главное: сохранившийся у нас текст обрывается до того, как источник должен был раскрыть анонс Nvidia на GTC 2026, сюжетный поворот, вынесенный в заголовок статьи, остался за кадром этого пересказа.

«Это как будто обучение, вчерашняя новость. Всё, о чём хочет говорить любой ИТ-директор, это инференс.»

— Мэтт Кимбалл, ведущий аналитик по дата-центрам, Moor Insights & Strategy

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.