Claude и GPT: учёные оценили «налог на передачу» при смене модели в ИИ-агенте

ИИ-агенты для написания и правки кода выполняют длинные задачи: десятки обращений к модели, вызовов инструментов и правок кода за один прогон. По ходу такой работы разработчик сталкивается с практическим выбором между ценой и качеством: либо повысить модель до более мощной и дорогой, когда дешёвая модель не справляется со сложным шагом, либо, наоборот, понизить до более дешёвой, когда сложная часть рассуждений уже позади. При любом таком переключении принимающая модель вынуждена продолжать чужую траекторию выполнения задачи, историю вызовов и действий, которую сформировала другая модель, а не она сама.
Авторы изучили, как такая передача сказывается на качестве результата и на итоговой стоимости, и как на это влияет то, сколько истории действий передаётся принимающей модели. Для эксперимента брали пары моделей: дешёвую и менее мощную (в терминологии авторов, «LC») и дорогую более мощную (в терминологии авторов, «HC»), отдельно из семейства Claude и отдельно из семейства GPT (конкретные версии моделей в тексте не названы). Варьировали направление передачи (повышение до мощной модели или понижение до дешёвой), момент переключения и то, что именно получает принимающая модель: полную историю действий, её сжатую версию или вообще без истории, только текущее состояние кода в репозитории.
Главный результат: при повышении до мощной модели передача полной истории закрывает меньше половины разрыва в качестве между слабой и мощной моделью, а стоимость при этом заметно растёт. Этот перекос, когда переключение на более мощную модель не окупается ростом качества, авторы и назвали «налогом на передачу» (handoff tax).
При обратном переключении, на более дешёвую модель, картина иная: соотношение цены и качества оказывается выгодным. Интересно, что оптимальный способ передачи истории меняется в зависимости от направления переключения: при повышении до мощной модели результат лучше, если урезать историю действий слабой модели, а не передавать её целиком; а при понижении до дешёвой модели, наоборот, удаление истории действий мощной модели ухудшает результат, эту историю лучше сохранять. Закономерность подтвердилась в обоих семействах моделей, и у Claude, и у GPT.
Ключевые факты
- Исследование измеряет «налог на передачу», потерю качества и рост стоимости, когда кодовый ИИ-агент передаёт длинную задачу от одной модели другой на середине пути.
- Тестировали пары дешёвых слабых (LC) и дорогих мощных (HC) моделей отдельно в семействах Claude и GPT, меняя направление переключения, момент переключения и объём переданной истории действий (полная история, сжатая версия или её отсутствие при сохранении текущего кода).
- При повышении до мощной модели полная передача истории закрывает меньше половины разрыва в качестве между слабой и мощной моделью и обходится заметно дороже, это и есть «налог на передачу».
- При понижении до дешёвой модели, наоборот, соотношение цены и качества выгодное.
- Лучший способ передачи истории зависит от направления: при повышении помогает урезанная история слабой модели, при понижении, наоборот, вредит удаление истории мощной модели.
Почему это важно
Всё больше кодовых ИИ-агентов и продуктов на их основе экономят на стоимости, переключаясь между дешёвыми и дорогими моделями внутри одной задачи: дешёвая модель тянет рутину, а на сложных местах подключается более мощная и дорогая. Интуиция подсказывает, что переключение на мощную модель «долечивает» результат почти до её собственного уровня. Это исследование одним из первых считает цену такого предположения: полный перенос истории действий на более мощную модель закрывает меньше половины разрыва в качестве, а платить приходится заметно больше, отсюда и «налог на передачу». Значит, расчёт «переключусь на модель подороже, получу её качество» не работает буквально.
Кому это важно
Тем, кто строит кодовых ИИ-агентов и платформы для них и закладывает в архитектуру переключение между дешёвыми и дорогими моделями ради экономии, нужно понимать реальную, а не ожидаемую цену такого переключения. Тем, кто настраивает подобные пайплайны для собственной команды или продукта: от выбора порогов эскалации до того, что именно передавать модели при смене. И разработчикам инструментов и интерфейсов агентов, которые предлагают функции автоматического повышения или понижения модели по ходу задачи.
Как это применить
Если система переключает модели в разгар агентной задачи, из выводов исследования следуют три практических момента. Первый: закладывайте в расчёт «налог на передачу», полное повышение до мощной модели не даст её полного качества, а обойдётся заметно дороже, поэтому эскалация не бесплатный «страховой полис». Второй: при повышении до мощной модели стоит не передавать ей всю историю действий слабой модели целиком, а сократить (сжать) её, по данным исследования, это улучшает результат. Третий: при понижении до дешёвой модели, наоборот, историю действий мощной модели лучше сохранить, а не убирать, её удаление ухудшает результат. То есть правило «сколько контекста передавать» зависит от направления переключения, а не одинаково в обе стороны.
Можно ли доверять
Материал, препринт на Hugging Face Papers (карточка arXiv 2608.24358), сама аннотация не называет ни авторов, ни организацию: на странице Hugging Face первым в списке указан Рой Ганц (Roy Ganz), но подтвердить по тексту аннотации весь состав соавторов и их принадлежность нельзя. Работа описывает конкретную методологию (пары LC/HC-моделей, варианты передачи истории) и формулирует выводы как результат сравнения, а не как маркетинговое заявление, это в пользу достоверности. Из настораживающего: ни один количественный показатель (проценты, доллары, оценка на бенчмарке) в аннотации не приведён, только качественные формулировки «меньше половины» и «существенная наценка», конкретные версии моделей Claude и GPT не названы, и на момент публикации у материала пока немного отметок обсуждения на Hugging Face (12 голосов, 2 комментария), независимая проверка сообществом ещё не состоялась.
Риски и подводные камни
Аннотация не раскрывает, на каких именно моделях Claude и GPT получен результат, поэтому неясно, распространяется ли «налог на передачу» на самые новые и мощные версии или был измерен на более ранних. Величина эффекта дана только качественно («меньше половины», «существенная наценка»), без чисел трудно понять, насколько это критично для конкретного бюджета. Эксперимент ограничен кодовыми агентами и решением задач разработки; перенос выводов на агентов другого профиля (аналитика, поддержка, поиск) не проверялся. И это препринт без указания рецензирования или места публикации, выводы стоит воспринимать как предварительные, до независимой проверки.