AWS велела экономить CPU: ИИ-агенты взвинтили спрос на процессоры

В начале 2026 года руководство AWS дало инженерам директиву: экономить процессорные циклы любой ценой. Как сообщается, у AWS резко выросло время ожидания серверных CPU-мощностей, облачную инфраструктуру компании перегружают ИИ-нагрузки. Раньше ИИ-бум разгонял спрос на GPU, а затем на память: процессоры из-за слабой параллелизации плохо подходили для инференса больших языковых моделей (LLM) и оставались в стороне. Ситуация изменилась с распространением агентных ИИ-систем, моделей, которые действуют автономно и вызывают вспомогательных субагентов.
Мэтт Кимболл, вице-президент и главный аналитик по дата-центрам Moor Insights & Strategy, говорит, что 2026 год принёс всплеск спроса на CPU, во многом из-за агентных систем: один агентный процесс может породить 100 агентов, а при развёртывании в масштабе предприятия это превращается в десятки и сотни тысяч, а то и миллионы агентов, которые порождают субагентов, делают вызовы API и общаются между собой через протокол контекста модели (MCP) Anthropic.
Причина, в устройстве агентных задач. Инференс LLM выполняется на GPU, но вызовы инструментов («tool use»: обращение к интернету, файлам на диске, стороннему софту) обычно уходят на CPU. Сувик Кунду, старший научный сотрудник Intel, поясняет: процессор разбирает вывод модели, определяет, какой инструмент вызвать, делает API-запрос или выполняет код, забирает результат и передаёт его обратно. Мадху Рангараджан, вице-президент по вычислениям и корпоративному ИИ в AMD, приводит похожую оценку: в тестах AMD семь из восьми стадий реалистичного агентного пайплайна выполняются полностью на CPU.
Кунду в соавторстве с исследователями Технологического института Джорджии (Georgia Tech) опубликовал работу по оптимизации агентных нагрузок. Авторы обнаружили, что CPU часто простаивает, пока инференс LLM идёт на GPU, и наоборот, GPU простаивает, пока вызовы инструментов обрабатываются на CPU. Предложенные ими оптимизации планирования позволяют сократить сквозную задержку агентной задачи (от старта до завершения) до 1,8 раза при устойчивой нагрузке. Проблему усложняют и защитные механизмы: проверки безопасности агентных действий часто представляют собой правила, разбирающие синтаксис и логи, а также небольшие модели (менее миллиарда параметров) для оценки сложности или намерения задачи, их держат на CPU ради минимальной задержки, хотя технически можно запускать и на GPU. Масштаб задачи иллюстрирует упомянутый в статье случай: непреднамеренный «взлом» Hugging Face моделью OpenAI, когда та совершала до 300 действий в час.
Юджин Чон, аспирант Технологического института Джорджии, в другой работе, дополняющей выводы Кунду, показал: при нехватке ядер CPU сервер не успевает раздавать задачи GPU, и те простаивают в ожидании инструкций. Отдельная проблема, токенизация, первый этап инференса LLM, который переводит текст в числовые ID токенов. В отличие от матричных вычислений, которые составляют основу инференса, токенизация, это последовательная обработка строк с ветвлениями, зависящая от данных; она параллелится хуже. Для коротких запросов токенизация тривиальна, но при каждом вызове инструмента агентная модель обязана заново токенизировать весь накопленный контекст: если в диалоге уже 100 000 токенов, а результат вызова инструмента добавляет ещё 1000, токенизатор пересчитывает всю последовательность заново, и так при каждом обращении к инструменту. Работа Чона показывает, что задержка до первого токена ответа резко растёт с увеличением длины последовательности, а увеличение числа ядер CPU снижает эту задержку примерно в 1,5, 7 раз. Тесты проводились на моделях меньшего размера, Qwen 3-30B от Alibaba и Llama 3.1-70B от Meta, из-за ограничений доступного оборудования; Чон предполагает, что у более крупных моделей узкое место будет не так выражено из-за более высокой общей потребности в GPU, но ожидает, что агентный ИИ будет и дальше увеличивать длину последовательностей, модели вроде Anthropic Claude уже легко достигают 500 000, а то и миллиона токенов контекста, и проблема, по его словам, будет только нарастать.
Признаки дефицита процессоров видны и на рынке: Intel распродал серверные CPU минимум до конца года, AMD удвоила прогноз спроса на серверные процессоры, Arm и Qualcomm анонсировали новые CPU для ускорения агентного ИИ, а Nvidia сделала приоритетом Vera, свой CPU на архитектуре Arm для агентного ИИ, часть платформы Vera Rubin. По словам Кимболла, эти шаги, «безусловный признак» того, что индустрия ИИ теперь считает производительность CPU ключевым элементом агентных систем. Он предупреждает, что это может обернуться более широким дефицитом CPU и ростом цен, так же, как уже случилось с GPU и памятью: нехватка ощущается вплоть до потребительского сегмента, а Intel уже сократил выпуск клиентских процессоров в пользу серверных, несмотря на то что новый техпроцесс 18A увеличил продажи Intel в клиентском сегменте. По мнению Кимболла, это показывает, что производители CPU пойдут туда, где деньги.
Ключевые факты
- AWS распорядилась экономить процессорные циклы после резкого роста времени ожидания серверных CPU-мощностей, перегруженных ИИ-нагрузками.
- Вызовы инструментов, токенизация и проверки безопасности агентных ИИ-систем выполняются в основном на CPU, а не на GPU: по данным AMD, семь из восьми стадий агентного пайплайна проходят целиком на процессоре.
- Исследователи Georgia Tech нашли рассинхрон загрузки: CPU простаивает во время инференса на GPU и наоборот; предложенные оптимизации планирования снижают сквозную задержку до 1,8 раза.
- При длинных агентных диалогах (контекст до 500 000, 1 000 000 токенов, как у Claude) увеличение числа ядер CPU снижает задержку до первого токена в 1,5, 7 раз, показали тесты на Qwen 3-30B и Llama 3.1-70B.
- Intel распродал серверные CPU до конца года, AMD удвоила прогноз спроса, Arm и Qualcomm анонсировали новые чипы под агентный ИИ, Nvidia сделала приоритетом свой Arm-CPU Vera в составе платформы Vera Rubin.
Почему это важно
После бума спроса на GPU, а затем на память, дефицит добрался и до CPU, казалось бы, второстепенного компонента ИИ-инфраструктуры. Причина в самой природе агентных систем: инференс модели идёт на GPU, но всё, что вокруг него, вызовы инструментов, разбор их результатов, токенизация растущего контекста, проверки безопасности, ложится на процессор. Чем активнее компании разворачивают агентов, тем больше таких вспомогательных операций и тем сильнее нагрузка на CPU, который раньше не считался узким местом ИИ-инфраструктуры.
Кому это важно
В первую очередь, облачным провайдерам вроде AWS, которые уже вводят внутренние ограничения на использование CPU, и производителям процессоров: Intel, AMD, Arm, Qualcomm и Nvidia, которые расширяют мощности и выпускают чипы под агентные нагрузки. Также это касается компаний, разворачивающих агентные системы в масштабе предприятия, и разработчиков, проектирующих агентные пайплайны с длинным контекстом и частыми вызовами инструментов.
Как это применить
Планируя инфраструктуру под агентные системы, стоит закладывать не только GPU, но и достаточное число ядер CPU, особенно для сценариев с длинным контекстом и частыми вызовами инструментов, где нехватка ядер CPU напрямую увеличивает задержку до первого токена и заставляет GPU простаивать. Оптимизации планирования, которые синхронизируют работу CPU и GPU вместо их последовательного простоя, по данным исследователей, способны заметно сократить сквозную задержку агентной задачи.
Можно ли доверять
Материал IEEE Spectrum опирается на прямые комментарии именованных источников, аналитика Moor Insights & Strategy, исследователей Intel и AMD и соавторов двух работ Georgia Tech, и на проверяемые рыночные факты (распродажа CPU у Intel, пересмотр прогноза AMD, анонсы Arm, Qualcomm и Nvidia). Утверждение о директиве AWS экономить CPU и о росте времени ожидания подано со ссылкой «как сообщается», как факт, полученный из источников издания, а не с официальным подтверждением самой AWS.
Риски и подводные камни
Дефицит CPU рискует повторить сценарий GPU и памяти: рост цен и распространение нехватки за пределы серверного сегмента. В статье уже отмечено, что Intel сократил выпуск клиентских процессоров в пользу серверных, и это чувствуется вплоть до потребительского рынка. При этом сами исследователи предупреждают: предложенные ими оптимизации, лишь частичное решение, а рост длины агентных диалогов будет и дальше увеличивать нагрузку на CPU быстрее, чем успевают появляться новые мощности.
«Многие компоненты агентной ИИ-задачи по своей природе выполняются на CPU. Процессор разбирает вывод модели, определяет, какой инструмент вызвать, делает API-запрос или выполняет код, забирает результат и передаёт его обратно.»
— Сувик Кунду, старший научный сотрудник Intel
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.