Claude Code обходится вдвое дороже Pi и Codex CLI при том же качестве

Группа исследователей из UC Berkeley (лаборатория Sky Lab) и компании Arena, Мелисса Пэн, Шо Ян, Негар Арабзаде, Вэй-Линь Цзян, Ион Стойка и Матей Захария, опубликовала исследование HarnessTax о том, насколько выбор «обвязки» (harness, программной надстройки, которая управляет инструментами, контекстом и выполнением задач ИИ-агента) влияет на результат работы агентов-программистов.

Авторы протестировали 21 связку из семи языковых моделей и трёх обвязок, Claude Code, Codex CLI и Pi, на двух открытых бенчмарках: SWE-bench Lite и Terminal-Bench 2.0. Для каждого бенчмарка случайно выбрали 30 задач, каждую связку прогнали по три раза на задачу, ограничив попытку 100 ходами агента. Стоимость токенов считали по фиксированному прайс-листу прямого доступа к API от 1 сентября 2026 года, одинаковому для всех обвязок.

Первый вывод: обвязка почти не влияет на долю решённых задач (разброс в среднем в пределах ±2% на SWE-bench Lite и около ±5% на Terminal-Bench 2.0), но может сильно менять стоимость, до 5 раз при сопоставимом результате. Например, модель Claude Fable 5 решает 97,8% попыток в Claude Code, 96,7% в Codex и 96,7% в Pi, но попытка в Claude Code стоит около $1,33 против $0,67 в Pi, то есть примерно вдвое дороже за прирост успеха всего в 1,1 процентного пункта. В среднем по общим моделям на SWE-bench Lite Claude Code обходится примерно в 2,0 раза дороже Pi и в 1,6 раза дороже Codex, а на Terminal-Bench 2.0, в 1,5 раза дороже Pi (по геометрическому среднему отношений стоимости).

Второй вывод: простая обвязка может быть конкурентоспособной. Pi, минималистичная открытая обвязка всего с четырьмя инструментами (чтение, запись, редактирование файла и командная строка), держится на границе Парето (лучшее соотношение цены и успеха) на обоих бенчмарках. При этом число ходов агента у Pi и Claude Code для Fable 5 на SWE-bench Lite почти одинаковое (15,4 против 15,3), а средний начальный контекст у Claude Code, по данным авторов, более чем в 10 раз больше, чем у Pi, из-за более длинных инструкций и объёмных описаний инструментов.

Третий вывод: модель не всегда лучше всего работает в «родной» обвязке от своего же разработчика. Например, OpenAI описывает GPT-5-Codex как модель, оптимизированную под работу именно в Codex, но среди шести моделей Anthropic и OpenAI на обоих бенчмарках альтернативная обвязка показывала лучший результат в 9 из 12 сравнений. Так, модель Sonnet 4.6 решает 68,9% задач в Codex против 66,7% в Claude Code при сопоставимой стоимости, а GPT-5.6 Sol на Terminal-Bench 2.0 показывает 83,3% успеха в Pi против 78,9% в Codex, примерно за половину цены ($0,42 против $0,76).

Авторы называют переплату за более дорогую обвязку без выигрыша в качестве «налогом на обвязку» (harness tax) и советуют при выборе агента сравнивать стоимость и успех одной и той же модели в разных обвязках, а не полагаться на связку по умолчанию. Они оговаривают: выводы получены только на двух открытых бенчмарках, задачи которых модели могли видеть при обучении, и на других задачах и рабочих нагрузках результат может отличаться. Авторы планируют публично выложить собранные данные профилирования.

Ключевые факты

  • 21 связка «модель + обвязка»: семь языковых моделей и три обвязки для ИИ-агентов, Claude Code, Codex CLI и Pi, протестированы на бенчмарках SWE-bench Lite и Terminal-Bench 2.0
  • Обвязка почти не меняет долю решённых задач (±2, 5%), но может увеличивать стоимость попытки до 5 раз: Claude Fable 5 решает 97,8% попыток в Claude Code за $1,33 против 96,7% в Pi за $0,67
  • Минималистичная открытая обвязка Pi всего с четырьмя инструментами (чтение, запись, редактирование, командная строка) держится на границе лучшего соотношения цены и успеха на обоих бенчмарках; средний начальный контекст у Claude Code более чем в 10 раз больше, чем у Pi
  • Модели не всегда лучше всего работают в обвязке «родного» разработчика: в 9 из 12 сравнений моделей Anthropic и OpenAI лучший результат показала другая обвязка, например, Sonnet 4.6 решает больше задач в Codex, чем в Claude Code
  • Авторы предупреждают: выводы ограничены двумя открытыми бенчмарками, которые модели могли видеть при обучении, и могут не переноситься на другие задачи

Почему это важно

Исследование показывает, что за удобство «фирменной» обвязки коммерческого агента можно платить скрытую наценку, рост стоимости без роста качества результата. Разница в успехе между обвязками остаётся в пределах нескольких процентов, а разница в цене доходит до пятикратной, то есть большая часть переплаты не покупает ничего, кроме привычного интерфейса.

Кому это важно

Разработчикам и командам, которые массово используют ИИ-агентов для написания и правки кода и выбирают между Claude Code, Codex CLI, Pi или похожими инструментами; тем, кто считает бюджет на такие агенты; исследователям, которые оценивают модели и обвязки как единую систему, а не по отдельности.

Как это применить

Перед тем как закрепить связку «модель + обвязка» по умолчанию, стоит сравнить стоимость и долю решённых задач той же модели в нескольких обвязках на своих реальных задачах, а не полагаться на репутацию производителя модели. Минималистичные открытые обвязки с небольшим набором инструментов, как Pi с её четырьмя командами, заслуживают отдельной проверки: по данным исследования, они не уступают более сложным аналогам в успехе, но обходятся дешевле за счёт меньшего начального контекста.

Можно ли доверять

Работу опубликовала исследовательская группа UC Berkeley (лаборатория Sky Lab) совместно с компанией Arena, у авторов есть отслеживаемая методика: фиксированный набор задач, несколько прогонов на задачу, доверительные интервалы по 10 000 бутстреп-пересэмплирований и единый прайс-лист для расчёта стоимости. Авторы сами оговаривают главное ограничение, независимого рецензирования исследование, судя по представленным материалам, не проходило, а выборка задач взята только из двух открытых бенчмарков.

Риски и подводные камни

Выводы получены на двух открытых бенчмарках (SWE-bench Lite и Terminal-Bench 2.0), чьи задачи модели могли встречать во время обучения, на закрытых или более новых наборах задач результат может быть другим. Определение «хода агента» и настроек эффективности различается между обвязками, поэтому сравнивать сырые счётчики ходов напрямую нельзя. Стоимость посчитана по прайс-листу на конкретную дату (1 сентября 2026 года) и может измениться с обновлением цен провайдеров.

«Оказывается, вашим моделям Claude может быть не нужен Claude Code…»

— авторы исследования HarnessTax