Claude, Codex и Antigravity вместе сэкономили токены на deep research в 10 раз

Инженер компании Quesma (автор поста, bkotrys) исследовал экономику AI-агентов («токеномику») и для этого запустил у себя встроенный инструмент Claude /deep-research с широким открытым вопросом. За 30 минут инструмент упёрся в лимит подписки Claude Max 5x: успел запустить 111 агентов и поставить в очередь 123 утверждения на проверку, но проверить успел только 25, а итоговый синтез отчёта так и не запустился. После этого пришлось несколько часов ждать сброса лимита.
Решение, не полагаться на один инструмент, а объединить три подписки, которые он уже оплачивает: Claude, Codex (OpenAI) и Antigravity (Google). Он расширил плагин claude-mem, чтобы все три инструмента вели общую память в рамках сессии: что узнал один, могут использовать остальные.
Главным харнессом остался Claude Code, но роли распределены по моделям: Claude Opus 4.8, Claude Sonnet 5, GPT-5.5 и Gemini 3.1 Pro назначены на разные типы задач по итогам бенчмарков Terminal-Bench (терминальная и агентная работа), SWE-bench Pro (сквозная разработка) и общего обзора цены/производительности Artificial Analysis, с оговоркой, что бенчмаркам не стоит доверять как окончательной истине, а разбивка по моделям несколько раз менялась по итогам реальных прогонов.
Техническая реализация, небольшой bash-скрипт run-cli, который агенты Claude вызывают как обычную команду: он запускает codex exec или agy (Antigravity) в headless-режиме как сабагента, а результат сохраняет в общую память. Скрипт отслеживает в выводе сообщения об исчерпании лимита или кредитов и в этом случае возвращает специальный код возврата, оркестратор видит сигнал и автоматически переключает задачу на модель Claude. Отдельно подчёркнуто важное правило: модель нужно жёстко закреплять за каждой ролью, потому что по умолчанию сабагенты наследуют модель родителя, именно так был сожжён весь лимит Fable за 30 минут в первой версии пайплайна. С учётом этой схемы исследование стало работать примерно в 10 раз дольше, часы вместо получаса, прежде чем упереться в лимит хотя бы одной из трёх подписок, без дополнительной оплаты.
Вторая проблема после стоимости, доверие к результатам. В версии на одном Fable попадались уверенно звучащие, но неверные находки: неправильная лицензия репозитория, цифра экономии без источника, число, которого не было на цитируемой странице. Чтобы это исправить, в пайплайн внедрили обязательные правила проверки: тот, кто нашёл утверждение, никогда сам его не верифицирует, это делает другая модель или агент; ничего не попадает в базу знаний без URL и цитаты из первоисточника; нельзя утверждать число, которого нет на странице-источнике. Список правил не был придуман заранее, он рос по ходу работы: каждый раз, когда верификация ловила новый класс ошибок, правило добавлялось в промпты.
Сам инструмент /deep-research в итоге переместили в конец пайплайна: теперь в конце дня он проходит по уже проверенным находкам, углубляет их и закрывает пробелы, вместо того чтобы исследовать интернет с нуля. Последний такой прогон занял 61 агента и 22 минуты, против 111 агентов и получаса в первый день, когда отчёт вообще не был получен.
Все прошедшие проверку факты попадают в вики на базе Obsidian (по образцу «LLM wiki» Андрея Карпатого), связанные атомарные заметки, которые собирают агенты, а правила задаёт человек. За неделю там накопились сотни проверенных заметок по ценам, инструментам, бенчмаркам и практикам.
Автор описывает и провал автоматики: правило триажа автоматически отклонило проект Headroom (56 тысяч звёзд на GitHub, один из крупнейших в своей категории), потому что заявленные им цифры экономии не прошли контроль качества, а правило гласило «неподтверждённое утверждение = проект не попадает в базу». Ошибку заметили только через два дня. Итог, правило переписали: отклонять само утверждение, а не весь проект. Вывод автора: чисто автоматическая проверка агентами недостаточна, чисто ручная, слишком медленная; рабочий вариант, гибрид, где агенты делают тяжёлую исследовательскую работу по пайплайну, который создаёт и постоянно донастраивает человек, а человек же проверяет результаты и закрывает пробелы.
Среди находок собранной базы знаний: на Terminal-Bench одна и та же модель показывает разброс потребления токенов до ~66 раз в зависимости от харнесса (обвязки инструмента), причём более лёгкие обвязки показывают результат лучше, а не хуже; другое исследование зафиксировало разброс качества до 54 процентных пунктов при смене только харнесса. Компакция контекста (сжатие истории диалога) может не экономить, а удваивать счёт: сама операция суммирования тратит токены, а ещё может вытеснить из контекста файлы, которые агенту снова понадобятся, тогда он их перечитывает, контекст снова заполняется, и компакция срабатывает опять; в одном задокументированном случае после смены порога компакции число срабатываний за сессию выросло с 4 до 12-26, а расход токенов на тех же задачах, с 89 миллионов до 160-185 миллионов. Изменение набора инструментов (tool schema) в середине сессии обесценивает весь кешированный префикс: чтение из кеша стоит около 0.1 от базовой цены за токен входа, но кеш инвалидируется иерархически (инструменты → системный промпт → сообщения), и добавление или перестановка одного инструмента посреди сессии перевыставляет счёт по полной цене без какой-либо ошибки. Наконец, счётчик токенов не равен реальному инвойсу: в одном задокументированном случае расчётные $3,60 в месяц на практике обернулись счётом в $25-40, то есть разрывом в 7-11 раз, за счёт накопления контекста, повторных попыток, накладных расходов фреймворка и вызовов на оценку качества, которые простой подсчёт токенов не учитывает.
Ключевые факты
- Встроенный Claude /deep-research за 30 минут упёрся в лимит подписки Claude Max 5x: запустил 111 агентов, поставил в очередь 123 утверждения, проверил только 25, отчёт так и не собрал
- Решение, собственный пайплайн на трёх уже оплаченных подписках (Claude, Codex, Antigravity) с общей памятью через расширенный плагин claude-mem и ролями по моделям (Claude Opus 4.8, Claude Sonnet 5, GPT-5.5, Gemini 3.1 Pro)
- Небольшой bash-скрипт run-cli вызывает Codex и Antigravity как headless-сабагентов и автоматически переключается на Claude при исчерпании лимита; ключевое правило, жёстко закреплять модель за ролью, иначе сабагенты наследуют модель родителя
- Правила верификации (проверяющий не совпадает с нашедшим, обязательны URL и цитата, запрет цифр не из источника) снизили число ложных находок; /deep-research перенесён в конец пайплайна и теперь дообрабатывает уже проверенные факты, 61 агент и 22 минуты вместо 111 агентов и получаса без результата
- Итоговая база знаний в Obsidian показала: разброс токенов до ~66 раз от харнесса на одной модели, удвоение счёта от компакции контекста, полный сброс кеша при смене набора инструментов и разрыв 7-11 раз между расчётной и реальной стоимостью запросов
Почему это важно
История наглядно показывает, что готовые инструменты глубокого исследования (deep research) в AI-агентах могут сжигать лимит подписки за минуты без единого результата, и что решение не в том, чтобы платить больше, а в том, чтобы распределять задачи между разными моделями по ролям и проверять находки отдельным агентом, а не тем же, кто их нашёл.
Кому это важно
Разработчикам и командам, которые строят собственные исследовательские или агентные пайплайны на нескольких LLM-подписках; тем, кто оценивает реальную стоимость AI-агентов в проде, а не по калькулятору токенов; всем, кто использует Claude Code, Codex или Antigravity и хочет ограничить их аппетит к токенам.
Как это применить
Ключевые приёмы из поста: явно закреплять модель за каждой ролью субагента (иначе он наследует модель родителя и жрёт лимит дорогой модели); использовать дешёвые/специализированные модели для поиска, а точную модель, для верификации; переносить тяжёлый deep-research в конец пайплайна, чтобы он дообрабатывал уже отфильтрованные находки, а не искал с нуля; связывать разные CLI (Claude, Codex, Antigravity) через простой headless-скрипт с автоматическим фолбэком при исчерпании лимита одного из них.
Можно ли доверять
Материал, личный опыт инженера компании Quesma, изложенный в блоге компании, без внешней рецензии; цифры (66-кратный разброс токенов, рост компакций с 4 до 12-26, расхождение счёта в 7-11 раз) автор помечает как находки собственной базы знаний с 'средней уверенностью' (обычно 1-2 источника) и прямо говорит, что не считает их окончательной истиной.
Риски и подводные камни
Автор сам описывает провал автоматики: правило триажа ошибочно вычеркнуло из базы знаний легитимный проект Headroom (56 тысяч звёзд на GitHub) только из-за того, что его цифры экономии не прошли проверку качества, ошибку заметили лишь через два дня. Вывод: чисто автоматическая проверка агентами недостаточна и требует постоянной ручной донастройки правил и контроля человеком.
«Дешёвые модели ищут, точные модели проверяют, а глубокое исследование идёт последним.»
— bkotrys, инженер Quesma