Baseten объяснила «эффективную границу» инференса LLM: что её расширяет, а что даёт лишь компромисс

Технический блог компании Baseten (продаёт инфраструктуру для развёртывания и обслуживания LLM) описывает, как устроена экономика инференса больших языковых моделей через понятие «эффективной границы», позаимствованное у экономистов. Модель называют «передовой» («frontier»), если при заданной стоимости или размере она даёт максимальный уровень интеллекта. В инференс-инжиниринге похожая граница существует между задержкой ответа и пропускной способностью (которая определяет стоимость), а также между качеством и эффективностью (квантование, дистилляция, прореживание модели) и между уровнем «интеллекта» модели и скоростью (глубина рассуждений).
Статья делит все техники на два типа. Первые сдвигают развёртывание вдоль уже существующей границы, то есть меняют один параметр за счёт другого. Вторые расширяют саму границу целиком, создавая дополнительную эффективность, которую потом можно распределить как угодно, на задержку, на пропускную способность или на то и другое сразу. Автор подчёркивает: граница на практике не гладкая линия, а «зубчатая», небольшие изменения конфигурации могут давать несоразмерно большой эффект, и такие пороговые точки обычно находят только эмпирически, через перебор параметров (sweep). В качестве рабочего допущения для всей статьи берётся сценарий: LLM вроде GLM-5.3 или Kimi K3 используется для агентного кодинга, с включённым переиспользованием KV-кэша и оптимальной маршрутизацией запросов с учётом KV-кэша (KV-aware routing).
К техникам-«компромиссам» отнесены: размер батча (маленький батч даёт хорошую задержку на пользователя, но низкую пропускную способность и высокую стоимость токена; больший батч, наоборот); стратегия параллелизма, для задержки годится тензорный параллелизм (TP, быстрый благодаря высокоскоростному интерконнекту NVLink, несмотря на дорогую коммуникацию «каждый с каждым»), экспертный параллелизм (EP) в узкой конфигурации чаще улучшает задержку, а широкий EP (вплоть до целой стойки GPU), пропускную способность, а параллелизм данных внимания (ADP, дублирование слоёв внимания для параллельных вычислений) повышает общую пропускную способность за счёт скорости отдельного запроса. Отдельно выделено квантование, снижение точности весов, активаций и/или значений KV-кэша: оно улучшает и задержку, и пропускную способность одновременно, то есть реально расширяет границу, но взамен создаёт новый компромисс между качеством модели и эффективностью обслуживания. По утверждению статьи, эта граница особенно «зубчатая»: большой выигрыш в эффективности возможен почти без потери качества, особенно при использовании форматов пониженной точности MXFP4 и NVFP4.
К техникам, реально расширяющим границу, отнесены три группы. Во-первых, оптимизация низкоуровневых CUDA-ядер и рантайма инференс-движка, ускорение отдельных операций (например, умножения матриц) и всего прохода вперёд снижает ресурсы на генерацию каждого токена; статья ссылается на отдельный разбор от стажёра Baseten Брайана Ли (Brian Li) по производительности на уровне ядер. Во-вторых, спекулятивное декодирование, предсказание вероятных следующих токенов с последующей проверкой; изначально это была та же техника-компромисс (дорогая спекуляция работала только на маленьких батчах), но современные методы вроде EAGLE-3, DSpark и DFlash дают выигрыш и в задержке, и в пропускной способности за счёт пропуска части проходов вперёд, особенно на генерации кода, где последовательность выходных токенов предсказуема. В-третьих, «дизагрегация», разделение фаз prefill (обработки входного контекста) и decode (пошаговой генерации токенов) на разные, специально оптимизированные под каждую фазу воркеры, с возможностью подстраивать соотношение воркеров под длину входа/выхода и частоту попаданий в кэш у реального трафика.
Автор отмечает, что улучшения от разных техник расширения границы обычно перемножаются: как гипотетический пример приводится ситуация, когда удвоение производительности за счёт железа и удвоение за счёт софта вместе дают четырёхкратный прирост общей эффективности обслуживания, это иллюстрация принципа, а не измеренный результат конкретного развёртывания. В конце статьи автор ссылается на свою бесплатную книгу «Inference Engineering» с более подробным разбором каждой техники.
Ключевые факты
- Baseten делит приёмы оптимизации LLM-инференса на два класса: одни двигают развёртывание вдоль границы «задержка/пропускная способность» (компромисс), другие расширяют саму границу (чистый выигрыш)
- К техникам-компромиссам отнесены размер батча и стратегия параллелизма, тензорный параллелизм (TP) для задержки, экспертный параллелизм (EP) для баланса задержки и пропускной способности в зависимости от степени, параллелизм данных внимания (ADP) для пропускной способности
- Квантование улучшает и задержку, и пропускную способность сразу, но создаёт новый компромисс с качеством модели; форматы MXFP4 и NVFP4 позволяют, по утверждению статьи, получать заметный выигрыш почти без потери качества
- К техникам, реально расширяющим границу, отнесены оптимизация CUDA-ядер и рантайма, спекулятивное декодирование (EAGLE-3, DSpark, DFlash, особенно эффективно на генерации кода) и разделение фаз prefill/decode на отдельные воркеры
- Эффективная граница на практике «зубчатая», а не гладкая: пороговые эффекты конфигурации находят только эмпирическим перебором параметров, а не расчётом
Почему это важно
Стоимость и скорость обслуживания больших языковых моделей, одна из главных статей расходов в любом продукте на базе LLM, и статья даёт понятийную рамку, которая разделяет два принципиально разных вида инженерной работы: перераспределение уже имеющихся ресурсов между задержкой и пропускной способностью и создание дополнительной эффективности, которую вообще не нужно ни на что менять. Без этого разделения легко потратить усилия на настройку параметров там, где нужна была бы работа над самим движком инференса, и наоборот.
Кому это важно
Материал адресован инженерам, которые сами разворачивают и обслуживают LLM в продакшене, MLOps- и инфраструктурным командам, а также компаниям, для которых стоимость инференса, значимая статья расходов (агентные продукты с высокой нагрузкой на кодинг, батч-обработка, high-throughput пайплайны). Обычному пользователю готовых API от OpenAI, Anthropic или Google эти настройки недоступны, они актуальны для тех, кто держит собственную инфраструктуру обслуживания моделей.
Как это применить
Практические ориентиры из статьи: для латентно-чувствительных сценариев с высокой готовностью пользователя платить, снижать размер батча и наращивать тензорный параллелизм; для batch-нагрузок и низкой стоимости за токен, увеличивать батч и переходить на широкий экспертный параллелизм или параллелизм данных внимания; квантование (в том числе в форматах MXFP4/NVFP4) стоит пробовать в первую очередь, поскольку оно способно расширить границу почти без потерь в качестве; для агентного кодинга отдельно рассмотреть спекулятивное декодирование методами вроде EAGLE-3; для высоконагруженных развёртываний, разделение prefill и decode на разные воркеры с настройкой их соотношения под реальный трафик. Все пороговые эффекты статья советует находить эмпирическим перебором конфигураций, а не подбирать «на глаз».
Можно ли доверять
Источник, технический блог самой Baseten, компании, которая продаёт услуги по обслуживанию инференса LLM, то есть коммерчески заинтересована в теме; при этом статья не приводит конкретных бенчмарков, процентов или цифр стоимости ни по одной из описанных техник, все утверждения сформулированы на уровне общих закономерностей и оговорок («часто», «как правило»), без выдаваемых за точные измерения чисел. Единственная числовая иллюстрация (четырёхкратный прирост при удвоении железа и софта) прямо названа гипотетическим примером, а не результатом реального развёртывания. Это делает материал скорее практическим объяснением устоявшихся в индустрии подходов, чем независимым исследованием с проверяемыми результатами.
Риски и подводные камни
Главный риск, принять общие закономерности статьи за универсальные правила: сама статья подчёркивает, что граница «зубчатая» и оптимальная конфигурация для конкретной нагрузки находится только экспериментально, а не по аналогии с чужим кейсом. Квантование расширяет границу эффективности, но ценой нового компромисса с качеством модели, и степень этой потери зависит от конкретной модели и формата, «почти без потери качества» не гарантия для любого случая. Наконец, стоит учитывать источник: у Baseten есть коммерческий интерес в том, чтобы такие оптимизации выглядели ценными и востребованными, хотя сама статья остаётся на уровне общей инженерной методологии, а не рекламы конкретного продукта.
«Модель называют «передовой» («frontier model»), если при заданной стоимости или размере она обеспечивает наивысший уровень интеллекта.»
— из блога Baseten