Claude Opus 4.8 и GPT-5.5: фирменная обвязка не даёт устойчивого преимущества в кодинге
Авторы работы собрали приватный набор из 256 задач по кодингу, задачи по работе с существующими репозиториями и конкурсные задачи, опубликованные уже после точки отсечения обучающих данных проверяемых моделей, специально защищённый от утечки в обучающие выборки. На части этого набора поставили парный эксперимент: одни и те же 80 задач прогнали дважды, под фирменной обвязкой (harness) вендора модели и под нейтральной обвязкой deepagents, которая работает с разными моделями. Для Claude Opus 4.8 фирменной обвязкой была Claude Agent SDK, для GPT-5.5, Codex SDK от OpenAI; в обоих случаях сравнение шло с одной и той же deepagents. Ещё две модели, Gemini 3.5 Flash и DeepSeek V3.2, участвовали как дополнительные «боковые» ячейки эксперимента, но сравнения обвязок для них в работе не приводится. Итоги 792 из 800 запланированных прогонов проверил изолированный автоматический проверяющий.
На Claude Opus 4.8 фирменная обвязка в среднем решила на 1,25 процентного пункта меньше задач, чем нейтральная: 48,8% против 50,0% (95% доверительный интервал по бутстрэпу задач, от -10,0 до +7,5 п.п.). На GPT-5.5 знак обратный: фирменная обвязка в среднем решила на 1,25 п.п. больше задач, чем нейтральная, 55,6% против 54,4% (95% ДИ, от -4,4 до +6,9 п.п.). В обоих случаях доверительный интервал захватывает ноль, и авторы прямо пишут: ни для одной из двух моделей эксперимент не подтверждает устойчивое среднее преимущество ни одной из обвязок, расхожее убеждение, что связка со «своей» обвязкой решает больше задач, статистически не подтвердилось.
Средний результат по Opus 4.8, впрочем, складывается из двух противоположных подгрупп. На 61 задаче по работе с репозиториями фирменная обвязка отстаёт от нейтральной на 9,0 п.п., а на 19 конкурсных задачах, наоборот, опережает её на 23,7 п.п.; расхождение между подгруппами статистически значимо (перестановочный тест, p = 0,003). Но само это разбиение на «репозитории» и «конкурсные задачи» авторы выбрали уже после того, как увидели результаты, и прямо пишут, что оно нуждается в отдельном, заранее спланированном повторном эксперименте, прежде чем его можно будет считать подтверждённым эффектом, а не находкой задним числом.
Отдельно авторы разводят понятия «решена» и «завершена вовремя»: из 81 прогона, снятого по достижении лимита времени на выполнение, 22 к моменту отмены уже успели произвести патч, проходящий проверку.
Стоимость решения задачи пересчитали по сырым логам использования (число токенов за ход) и зафиксированным официальным прайс-листам. По этому пересчёту нейтральная обвязка обходится дороже фирменной в расчёте на одну решённую задачу: на Claude Opus 4.8, от 1,3 до 1,6 раза, на GPT-5.5, в 1,2 раза. Но именно для Opus 4.8 картина шаткая: 58 прогонов на аккаунте Anthropic вообще не оставили записи об использовании, и то, как отнести их расход на одну из двух обвязок, сдвигает итоговое соотношение стоимости от 0,7 до 2,3 раза, то есть какая обвязка в итоге дешевле по факту на Opus 4.8, по данным статьи не установлено.
Нынешняя версия работы сама исправляет более раннюю, августовскую (2026 года) редакцию: в ней цифры по стоимости опирались на ошибку в логике учёта данных собственной телеметрии авторов. Авторы публикуют оркестратор, автоматический проверяющий, код повторного анализа и итоговые агрегированные данные, но не сами 256 задач: их держат закрытыми, чтобы набор оставался пригодным для будущих проверок моделей, которые его не видели при обучении.
Ключевые факты
- Парный, защищённый от утечки данных тест: одни и те же 80 задач из приватного набора в 256 задач прогнали под фирменной обвязкой (harness) вендора и под нейтральной обвязкой deepagents, отдельно для Claude Opus 4.8 (Claude Agent SDK) и для GPT-5.5 (Codex SDK от OpenAI); 792 из 800 запланированных прогонов проверил изолированный автоматический проверяющий.
- Среднего преимущества у фирменной обвязки не нашли ни у одной модели: на Opus 4.8 она решила на 1,25 п.п. меньше задач, чем нейтральная (48,8% против 50,0%, 95% ДИ от -10,0 до +7,5 п.п.), на GPT-5.5, на 1,25 п.п. больше (55,6% против 54,4%, ДИ от -4,4 до +6,9 п.п.); в обоих случаях интервал захватывает ноль.
- Средний результат по Opus 4.8 скрывает разворот по типу задач: фирменная обвязка отстаёт на 9,0 п.п. на 61 задаче по репозиториям и опережает на 23,7 п.п. на 19 конкурсных задачах (p = 0,003), но это разбиение выбрано уже по факту наблюдения данных и, по словам авторов, нуждается в отдельной проверке.
- 22 из 81 прогона, снятых по лимиту времени на выполнение, к моменту отмены уже успели произвести патч, проходящий проверку: тайм-аут, не то же самое, что «не решено».
- Пересчёт стоимости по сырым логам показал, что нейтральная обвязка дороже фирменной на решённую задачу, от 1,3 до 1,6 раза на Opus 4.8 и в 1,2 раза на GPT-5.5, но для Opus 4.8 из-за 58 прогонов без записи об использовании реальное соотношение может быть от 0,7 до 2,3 раза; сама статья исправляет более раннюю, августовскую версию с ошибкой в учёте телеметрии.
Почему это важно
Агентные продукты для кодинга обычно продают и используют как единый комплект: модель плюс написанная тем же вендором обвязка (harness), инструменты, промпты и цикл действий, которые превращают чат-модель в автономного разработчика. За этим стоит расхожее, редко проверяемое допущение: раз вендор пишет обвязку под свою же модель, такая «родная» пара решает больше задач, чем модель в связке с чужим, универсальным инструментом. Эта работа, контролируемый тест именно этого допущения, причём на приватном наборе задач, специально защищённом от утечки в обучающие данные моделей. И для обеих проверенных моделей допущение не подтвердилось: ни у Claude Opus 4.8, ни у GPT-5.5 фирменная обвязка не даёт статистически надёжного среднего преимущества над нейтральной.
Кому это важно
Командам, которые строят или выбирают конвейер для ИИ-агентов, пишущих код, и решают, использовать ли фирменный SDK вендора модели или взять нейтральную, не привязанную к вендору обвязку вроде deepagents. Тем, кто сравнивает агентные фреймворки между собой и опирается на бенчмарки для такого выбора: работа показывает, что средняя цифра по всем задачам может скрывать разнонаправленный эффект по типам задач. Тем, кто считает бюджет на агентные инструменты для кодинга: результат касается и стоимости решения задачи, а не только доли решённых. Методологам, которые сами строят бенчмарки для агентов: в статье, предметный разбор того, как жёсткие тайм-ауты и пробелы в телеметрии использования искажают итоговые цифры.
Как это применить
Не считать по умолчанию, что фирменная обвязка вендора выигрывает у нейтральной: на этих данных для Claude Opus 4.8 и GPT-5.5 в среднем это не так, и решение стоит проверять на собственной нагрузке, а не на репутации SDK. Если делить задачи на подтипы (например, «репозитории» и «конкурсные задачи») и находить в подгруппах разный знак эффекта, не доверять такому разбиению, пока оно не подтверждено на новых, заранее выбранных данных: именно так эта работа сама себя одёргивает при p = 0,003 на 61 и 19 задачах. При автоматической разметке «решено / не решено» по тайм-ауту, отдельно проверять прогоны, снятые по лимиту времени: часть из них (в этой работе 22 из 81) может уже содержать проходящий патч. При сравнении стоимости агентных инструментов, явно закрывать пробелы в логах использования, а не молчать о них: именно необъяснённые 58 прогонов без записи об использовании не позволили сделать вывод, какая обвязка на Opus 4.8 дешевле по факту. Авторы публикуют оркестратор, проверяющий и код повторного анализа, это можно взять за основу для похожего замера на своих моделях и своей обвязке (сами задачи закрыты).
Можно ли доверять
В пользу выводов: дизайн парный, одни и те же 80 задач под двумя обвязками на одной и той же модели, это снимает главный побочный фактор (разное качество моделей) и изолирует именно эффект обвязки; набор задач приватный и защищён от утечки в обучение (часть задач, конкурсные, опубликованные позже даты отсечения обучающих данных проверяемых моделей); почти все запланированные прогоны (792 из 800) проверил изолированный автоматический проверяющий; авторы прямо называют свои цифры по стоимости оценками по наблюдаемому использованию, а не окончательным счётом, и сами же исправляют более раннюю, августовскую версию работы после того, как нашли ошибку в собственной телеметрии. Против безоговорочного доверия: оба заявленных средних расхождения (-1,25 и +1,25 п.п.) статистически неотличимы от нуля, это и есть основной результат, а не побочная деталь; единственное статистически значимое расхождение (репозитории против конкурсных задач на Opus 4.8) найдено уже по факту наблюдения данных и прямо помечено как нуждающееся в отдельном подтверждении; для 58 прогонов без записи об использовании реальное соотношение стоимости на Opus 4.8 остаётся неизвестным (от 0,7 до 2,3 раза в любую сторону). Для двух дополнительных моделей, Gemini 3.5 Flash и DeepSeek V3.2, результатов сравнения обвязок вообще не приведено, так что вывод работы ограничен именно парой Claude Opus 4.8 и GPT-5.5, а не агентным кодингом вообще.
Риски и подводные камни
Главный риск, вычитать из этой работы больше, чем она утверждает. Она не говорит, что обвязка вообще не имеет значения: расхождение в 9,0 п.п. в одну сторону на задачах по репозиториям и в 23,7 п.п. в другую на конкурсных задачах (для Opus 4.8), статистически значимый и довольно большой эффект, просто ещё не подтверждённый независимо, а не опровергнутый. Она не говорит и того, что нейтральная deepagents «дороже без причины»: цифры от 1,3 до 1,6 раза и в 1,2 раза, это оценки по частично неполным логам, а для Opus 4.8 диапазон возможной реальной разницы (от 0,7 до 2,3 раза) настолько широк, что накрывает и «дешевле», и «дороже». Отдельная ловушка, судить о том, решена ли задача, по одному лишь факту тайм-аута: 22 из 81 таких случаев на деле уже были решены. И наконец, весь результат получен на одной приватной подборке задач, для двух моделей и одной конкретной нейтральной обвязки (deepagents), переносить вывод на другие модели, другие фирменные SDK или другие бенчмарки без дополнительной проверки не стоит.