Минималистичный харнесс Pi обошёл Claude Code и Codex в тестах Databricks

Earendil, разработчик кодового ИИ-харнесса Pi, опубликовала пост с тезисом: пока рынок наращивает агентные инструменты, увеличивает промты, добавляет слои оркестрации и усложняет логику, Pi намеренно идёт в обратную сторону. Из коробки харнесс даёт всего 4 инструмента, а его системный промт вместе с описаниями инструментов укладывается меньше чем в 1000 токенов. Идея в том, что бо́льшую часть работы можно закрыть базовым набором, а остальное, достроить самому.
Главное подтверждение тезиса, исследование Databricks «Benchmarking Coding Agents on Databricks' Multi-Million Line Codebase». Компания намеренно не брала внешние бенчмарки (посчитав их перенасыщенными) и составила собственный набор задач на основе реальной ежедневной работы своих инженеров. Вывод авторов исследования: «харнесс, из которого вызывается модель, кардинально влияет на стоимость и качество», и «во многих случаях простые харнессы вроде Pi показывали лучший результат на наших задачах». В связке с Opus 4.8 в режиме xhigh Pi показал самую высокую долю успешно решённых задач при заметно меньшей стоимости, чем у Claude Code и Codex.
Отдельно Databricks проверила модель в разных харнессах при одинаковом уровне рассуждений: стоимость решения одной и той же задачи различалась более чем в 2 раза, при этом качество оставалось на одном уровне. Причину Earendil назвала «дисциплиной контекста» Pi: харнесс отправлял модели примерно втрое меньше контекста за один ход, поддерживал более компактный рабочий набор данных и укладывался в меньшее число итераций. Earendil добавляет собственное наблюдение того же порядка: сложные рабочие процессы на Haiku 4.5, особенно с выполнением кода, часто выходили дороже, чем на Sonnet 4.6, просто потому, что агенту требовалось больше ходов до результата. Вывод: экономику агента определяет не только цена токена модели, но и то, сколько ходов и контекста харнесс тратит на задачу.
Второй кейс, Shopify. Инженер Дэвид Кортес (David Cortés) в посте Shopify Engineering описывает, как построил расширение pi-autoresearch, просто попросив саму Pi «создать расширение для Autoresearch»: харнесс прочитал собственную документацию по расширениям и самостоятельно начал собирать новый рабочий процесс. Autoresearch, это автономный цикл оптимизации для кодовых агентов: получив задачу на изменение, он прогоняет эксперименты, проверяет, что работает, а что вызывает регрессии, отбрасывает неудачные варианты и продолжает самоулучшаться, пока есть измеримая цель. В Shopify расширение быстро стало внутренним инструментом продуктивности: юнит-тесты стали выполняться в 300 раз быстрее, монтирование React-компонентов ускорилось на 20%, сократилось время сборки в нескольких проектах, выросла и производительность pnpm.
Earendil объясняет, почему ставка на минимализм срабатывает именно сейчас. Год назад ещё можно было утверждать, что харнессы, «нативные» для конкретной модели, имеют структурное преимущество, модели обучали с расчётом именно на них. Сегодня этот аргумент слабее: передовые модели уверенно работают в обычном терминальном окружении, и, по мнению авторов, наглядное тому подтверждение, недавнее сокращение Anthropic системного промта Claude Code на 80%. Вопрос смещается от «насколько харнесс нативен для модели» к тому, насколько эффективно он расходует контекст и избегает избыточности. При этом минимализм Pi не означает негибкость: харнесс расширяем и самонастраиваем, сложность добавляется только там, где она реально окупается.
Отдельно Earendil отмечает перспективу локальных моделей: у них обычно меньше окно контекста, а предзаполнение (prefill) может занимать много времени, поэтому стабильный неизменный префикс промта особенно важен. «Дисциплина контекста» Pi, то есть отказ менять контекст без явного запроса пользователя, по мнению компании, делает харнесс удобным именно для локальных моделей.
Ключевые факты
- Кодовый харнесс Pi (Earendil) даёт из коробки только 4 инструмента; системный промт вместе с описаниями инструментов, меньше 1000 токенов
- В исследовании Databricks на собственных задачах компании Pi вместе с Opus 4.8 xhigh показал самую высокую долю успешных решений при более низкой стоимости, чем Claude Code и Codex; смена харнесса при той же модели меняла стоимость задачи более чем в 2 раза без потери качества
- Pi отправляет модели примерно втрое меньше контекста за ход, Earendil назвала это «дисциплиной контекста»
- Инженер Shopify Дэвид Кортес построил расширение pi-autoresearch, попросив об этом саму Pi; автономный цикл оптимизации ускорил юнит-тесты в 300 раз, монтирование React-компонентов, на 20%, сократил время сборки и улучшил производительность pnpm
- Earendil связывает успех минимализма с тем, что модели стали компетентны в обычном терминальном окружении (в пример приводится сокращение Anthropic системного промта Claude Code на 80%), а также с преимуществом для локальных моделей с малым контекстным окном
Почему это важно
Пост Earendil бросает вызов тренду на разрастание агентных инструментов: индустрия наращивает промты, слои оркестрации и абстракции в погоне за качеством, но два независимых внешних кейса, Databricks и Shopify, показывают, что выбор харнесса, а не только модели, может быть главным рычагом влияния на стоимость и качество результата. Databricks отдельно замерила эффект именно харнесса, зафиксировав разницу в стоимости более чем в 2 раза при одинаковом качестве, это редкая для индустрии попытка отделить вклад модели от вклада обвязки вокруг неё.
Кому это важно
Инженерным командам, которые выбирают или строят кодовых агентов и считают стоимость запусков; тем, кто использует дорогие модели вроде Opus и хочет снизить расходы без потери качества; командам, экспериментирующим с локальными моделями, где ограниченное контекстное окно и медленное предзаполнение делают экономный харнесс особенно ценным.
Как это применить
Pi поставляется всего с 4 инструментами и системным промтом короче 1000 токенов, минимальная база, которую можно расширять под задачу. Расширения строятся, по описанию Shopify, буквально просьбой к самой Pi создать нужный инструмент: харнесс читает собственную документацию по расширениям и собирает рабочий процесс сам, как в случае с автономным циклом оптимизации pi-autoresearch. Для максимальной доли успешных решений в тестах Databricks Pi запускали с Opus 4.8 в режиме xhigh.
Можно ли доверять
Источник, блог самой Earendil, разработчика Pi, то есть материал по своей природе рекламный. При этом числа и цитаты о Databricks и Shopify взяты из постов самих этих компаний, а не придуманы автором: Databricks публично описала методику (собственный набор задач на реальном многомиллионном кодовой базе, сравнение харнессов при одинаковой модели), а инженер Shopify Дэвид Кортес, свой пост о pi-autoresearch. В тексте нет ни дат публикации этих исследований, ни абсолютных денежных сумм, только относительные показатели (кратности и проценты), что ограничивает независимую проверку.
Риски и подводные камни
Материал написан вендором Pi и подобран так, чтобы подтвердить его собственный тезис о минимализме, конкурирующие точки зрения или методология Databricks в деталях не приводятся. Цифры вроде «в 300 раз быстрее» относятся к конкретному набору юнит-тестов Shopify и не обязательно переносятся на другие проекты. Нет данных о том, как часто вывод Pi требует ручной донастройки для сложных задач за пределами тестов Databricks и Shopify, и насколько устойчив выигрыш при смене модели или профиля задач.
«Во многих случаях простые харнессы вроде Pi показывали лучший результат на наших задачах.»
— Databricks, в исследовании Benchmarking Coding Agents on Databricks' Multi-Million Line Codebase, процитированном Earendil