InflationAgent: маршрутизатор ИИ-агентов учитывает «инфляцию токенов»

Когда языковая модель не отвечает на запрос с первой попытки, агентная система делает повторные попытки, и каждая тратит дополнительные токены. Из-за этого возникает разрыв между тем, что обещает цена за токен, и тем, во сколько реально обходится весь рабочий цикл запроса. Авторы называют этот разрыв «инфляцией токенов» и определяют его как отношение реальной стоимости всего цикла к стоимости одного вызова модели. Системы маршрутизации вроде FrugalGPT считают расходы именно по цене одного вызова, и на сложных задачах это может занижать реальные затраты больше чем в 2 раза.

Авторы предлагают InflationAgent, маршрутизатор из четырёх компонентов. Во-первых, он систематически измеряет инфляцию токенов по разным уровням моделей и типам задач: для модели с 7 млрд параметров на многошаговых вопросно-ответных задачах инфляция достигала 4,25 раза. Во-вторых, вводится сигнал сложности запроса, энтропия ветвления цепочки рассуждений (CoT Branching Entropy, CBE), которая вычисляется целиком по локальному выводу модели ещё до выполнения запроса и предсказывает высокую инфляцию с точностью AUROC 0,887. В-третьих, InflationAgent выбирает модель, максимизируя «семантический обменный курс» (Semantic Exchange Rate, SER), отношение ожидаемой точности к прогнозируемой реальной стоимости. К этому добавлена политика «эскалации с чистого листа»: если цепочка рассуждений не удалась, её не передают более сильной модели для доработки, а отбрасывают и начинают решение заново.

На бенчмарке GSM8K при одинаковом бюджете токенов InflationAgent достиг точности 94,7% против 91,0% у FrugalGPT, потратив при этом на 31% меньше токенов. Правильность решения об эскалации с чистого листа авторы подтверждают отдельным экспериментом: если передать GPT-4o неудачную цепочку рассуждений вместо того, чтобы дать ей решать задачу заново, её точность падает, в худшем случае на 34,8 процентного пункта.

Ключевые факты

  • «Инфляция токенов», отношение реальной стоимости всего цикла запросов (с повторами при неудаче) к стоимости одного вызова модели; маршрутизаторы вроде FrugalGPT, считающие только по цене одного вызова, могут занижать реальные расходы больше чем в 2 раза на сложных задачах
  • У модели с 7 млрд параметров на многошаговых вопросно-ответных задачах инфляция токенов достигала 4,25 раза
  • Новый сигнал сложности, энтропия ветвления цепочки рассуждений (CBE), вычисляемый локально ещё до выполнения запроса, предсказывает высокую инфляцию с AUROC 0,887
  • InflationAgent выбирает модель, максимизируя «семантический обменный курс» (SER = ожидаемая точность / прогнозируемая реальная стоимость), и применяет политику «эскалации с чистого листа», отбрасывает неудачную цепочку рассуждений вместо того, чтобы передать её более сильной модели
  • На GSM8K при одинаковом бюджете InflationAgent дал точность 94,7% против 91,0% у FrugalGPT при экономии 31% токенов; передача неудачной цепочки в GPT-4o вместо повторного решения с нуля снижала её точность вплоть до 34,8 процентного пункта

Почему это важно

Цена за токен, которую публикует поставщик модели, описывает стоимость одного вызова, но агентные системы редко укладываются в один вызов: модель ошибается, система повторяет попытку, иногда эскалирует к более сильной и дорогой модели. Каждый такой цикл тратит токены сверх того, что заложено в исходную цену. Авторы формализуют этот разрыв как «инфляцию токенов» и показывают, что маршрутизаторы, которые оптимизируют расходы по цене одного вызова (как FrugalGPT), на сложных задачах занижают реальные затраты больше чем вдвое, то есть команда, планирующая бюджет на основе прайс-листа модели, систематически ошибается в меньшую сторону.

Кому это важно

Работа адресована тем, кто строит и эксплуатирует агентные системы на базе LLM и должен планировать расходы на них: инженерам, которые выбирают между уровнями моделей (дешёвая маленькая модель против дорогой большой) для разных типов запросов, и командам, которые считают unit-экономику продукта, где агент делает несколько попыток на один пользовательский запрос.

Как это применить

InflationAgent работает в четыре шага: сначала измеряет типичную инфляцию токенов для разных моделей и типов задач; затем ещё до выполнения запроса, только по локальному выводу модели, вычисляет сигнал сложности CBE (энтропия ветвления цепочки рассуждений), который заранее указывает на риск дорогого повторного цикла; далее выбирает модель, максимизируя отношение ожидаемой точности к прогнозируемой реальной стоимости (SER); и, наконец, при неудачной попытке не передаёт её результат более сильной модели «на доработку», а запускает решение заново с чистого листа, именно эта деталь, по данным авторов, даёт основной выигрыш.

Можно ли доверять

Это препринт на arXiv: в тексте не указаны ни имена авторов, ни их организация, поэтому проверить репутацию источника напрямую нельзя. При этом заявления подкреплены конкретными количественными результатами, точностью на GSM8K, показателем AUROC для сигнала CBE, процентом экономии токенов, которые в принципе проверяемы при воспроизведении эксперимента. Статья не прошла (или не указано, что прошла) рецензирование, поэтому это предварительный, а не подтверждённый академическим сообществом результат.

Риски и подводные камни

Количественные результаты приведены только для GSM8K и многошаговых вопросно-ответных задач, неясно, насколько выигрыш сохранится на других типах задач. Конкретная 7B-модель, показавшая максимальную инфляцию в 4,25 раза, не названа, известен только размер в параметрах. В тексте нет ни одной абсолютной цифры в долларах: все результаты даны в отношениях и процентах, что затрудняет оценку эффекта в реальных деньгах. Не указана и базовая точность GPT-4o до передачи ему неудачной цепочки, известна только величина падения (до 34,8 п.п.), поэтому масштаб относительных потерь оценить сложнее.