Nvidia создала SoL-Pi, систему, вдвое снижающую расход токенов ИИ-агентов

Исследователи Nvidia опубликовали работу о системе SoL-Pi, которая борется с растущей стоимостью работы ИИ-агентов не за счёт самой модели, а за счёт оптимизации харнесса, управляющего слоя между моделью и её средой, который используют такие системы, как Codex, Claude Code и OpenClaw. Харнесс определяет, как агент видит состояние среды, выполняет действия и обрабатывает обратную связь; раньше эффективность повышали в основном за счёт ускорения инференса, сжатия моделей или замены их более дешёвыми.
SoL-Pi автоматизирует то, что раньше делали вручную: один агент-исследователь наблюдает за трассами работы другого агента, предлагает изменения в логике харнесса и проверяет их в подготовленных средах, а проверки на возможности и эффективность отсеивают неудачные варианты. По словам авторов, подход опирается на идею рекурсивного самоулучшения. В ходе поиска система перебрала 152 направления улучшений на 535 исполняемых средах, включая 495 задач, построенных на парах issue, pull request из GitHub, и 40 синтетических тестов; всего было выполнено более 3000 прогонов и свыше 60 000 взаимодействий агента со средой.
Чтобы избежать переобучения под тренировочные задачи, проблемы, которую отмечали более ранние работы по автоматической оптимизации харнессов, исследователи строго отделили поиск от оценки. Тестовым бенчмарком служил EdgeBench: из 51 его публичной задачи 11 использовались для разовой проверки готовых кандидатов, а оставшиеся 40 были зарезервированы только для финальной оценки и никогда не попадали обратно в цикл поиска.
В результате поиска появилось четыре механизма экономии. Action Fusion объединяет два последовательных шага (например, правку кода и запуск теста) в один, убирая целый вызов модели. Online Context Compact после каждого шага планирования обрезает накопившийся контекст там, где это не теряет важную информацию. ObservationPack архивирует длинные выводы инструментов и подставляет на следующих шагах короткую сводку вместо повторной отправки полного текста. Evidence-Preserving Reducer отправляет большие логи ошибок и тестов более дешёвой модели, которая сжимает их до ключевых выводов, а отдельный шаг верификации ловит важные детали, которые могли потеряться при сжатии.
На 51 публичной задаче EdgeBench SoL-Pi показывает качество, сопоставимое с исходным харнессом Pi. Вариант со всеми четырьмя механизмами экономит 49% токенов и достигает 93,7% результата Pi; если выбрать только самый сильный отдельный механизм, можно превзойти качество Pi на 5,3%, всё равно экономя токены. В целом по двум вариантам экономия токенов составляет от 44,7 до 49%. В деньгах авторы оценивают экономию в $8,75, 13,50 в час по сравнению со штатными харнессами Codex и Claude Code и в $4,36, 5,71 в час по сравнению с Pi, исходя из текущих цен API.
Систему обучали только на GPT-5.6 Sol, но затем без изменений применили к Opus 5, там она сохранила 94,3% качества Pi при похожей экономии, хотя механизмы срабатывали реже и не так агрессивно; исследователи связывают это с тем, что харнесс оптимизировался исключительно на траекториях GPT-5.6 Sol.
На других бенчмарках картина менее однозначна. На 63 CPU-задачах Terminal-Bench 4 SoL-Pi решает только 15 задач против 18 у Codex и 18 у Pi, хотя суммарные затраты всё равно оказались примерно на четверть ниже, чем у Pi. На формально верифицируемых задачах Lean 4 из математической олимпиады IMO 2026 система решила три задачи из шести с наименьшей стоимостью на решённую задачу. В эксперименте по оптимизации ядер (kernel optimization) рой из 20 воркеров SoL-Pi снизил затраты на 26,8% по сравнению со сравнимым роем на Pi, а суммарные затраты в одном тестовом прогоне упали с $1339 до $894. Авторы называют идею рекурсивного повышения эффективности, предобучение харнесса с последующим использованием уже облегчённой версии для поиска следующей, перспективой на будущее, а не результатом текущей работы.
Авторы приводят и внешние данные о масштабе проблемы: в августовском тесте компании Composio модель Deepseek V4 Flash прогоняли через четыре агентных фреймворка, включая Claude Code и построенный на Pi Oh My Pi, стоимость решения одной задачи различалась почти в 3 раза при одной и той же модели. По словам аналитика OpenRouter Питера Уокера, потребление токенов агентами выросло в 14 раз с февраля 2026 года, и почти 70% этого роста приходится на кешированные промпты. При этом сжатие контекста, похожее на используемое в SoL-Pi, имеет побочные эффекты: одно исследование показало, что после сжатия в среднем сохраняется лишь 17% исходных инструкций пользователя. Разработчик Codex Эрик Провансер также предупреждал, что больше двух суб-агентов почти всегда впустую сжигают токены, не улучшая качество, поскольку большую часть времени тратят на проверку работы друг друга.
Ключевые факты
- SoL-Pi от Nvidia автоматически оптимизирует харнесс, управляющий слой между моделью и средой, а не саму модель агента
- Поиск улучшений прошёл на 535 средах и 152 направлениях, дал более 3000 прогонов и свыше 60 000 взаимодействий агента со средой
- Найдены четыре механизма экономии: Action Fusion, Online Context Compact, ObservationPack и Evidence-Preserving Reducer
- На EdgeBench лучший вариант экономит 49% токенов при 93,7% качества исходного харнесса Pi; экономия в деньгах, $8,75, 13,50 в час против штатных Codex и Claude Code
- На других бенчмарках результаты более смешанные: на Terminal-Bench 4 SoL-Pi решает меньше задач, чем Codex и Pi (15 против 18), хотя затраты всё равно ниже
Почему это важно
Стоимость работы ИИ-агентов растёт вместе с длиной их автономных циклов рассуждений и вызовов инструментов: по данным аналитика OpenRouter Питера Уокера, потребление токенов агентами выросло в 14 раз с февраля 2026 года. Большинство методов экономии до сих пор были нацелены на саму модель, более дешёвый инференс, квантование, замену модели. SoL-Pi показывает, что заметную экономию (по оценке Nvidia, 45, 49% токенов) можно получить, оптимизируя харнесс, управляющий слой вокруг модели, вообще не трогая саму модель.
Кому это важно
В первую очередь, разработчикам и компаниям, которые строят или эксплуатируют кодинговых ИИ-агентов на базе Codex, Claude Code, OpenClaw или похожих систем, а также инженерам, которые считают стоимость агентных пайплайнов в токенах и долларах API. Полезно это и авторам агентных фреймворков: тест компании Composio показал, что при одной и той же модели (Deepseek V4 Flash) стоимость решения задачи в разных фреймворках различалась почти в 3 раза, то есть выбор и настройка харнесса сами по себе сильно влияют на затраты.
Как это применить
Источник не сообщает дату публикации работы, состав авторов и не указывает, выложены ли код SoL-Pi или сам текст статьи в открытый доступ, так что напрямую воспроизвести систему по материалу нельзя. Практическая ценность, в самих найденных механизмах: слияние последовательных шагов (Action Fusion), периодическая обрезка контекста (Online Context Compact), архивирование длинных выводов инструментов вместо их повторной отправки (ObservationPack) и сжатие логов ошибок более дешёвой моделью с проверкой (Evidence-Preserving Reducer), это конкретные идеи, которые команды могут попробовать применить к собственным агентным харнессам.
Можно ли доверять
Это исследование Nvidia с описанной методологией: авторы намеренно отделили данные для поиска улучшений от бенчмарка EdgeBench, зарезервировав 40 из 51 его задачи только для финальной оценки, чтобы избежать переобучения харнесса под тренировочные задачи, риска, который отмечали более ранние работы в этой области. При этом сами авторы честно показывают неоднозначные результаты: на Terminal-Bench 4 SoL-Pi решает меньше задач, чем исходный Pi и Codex, а перенос на модель Opus 5 (система обучалась только на GPT-5.6 Sol) частично теряет в эффективности механизмов. Источник не называет авторов статьи и дату её публикации.
Риски и подводные камни
Оптимизация харнесса исторически склонна к переобучению под конкретные задачи и слабо переносится на незнакомые, именно эту проблему пытается решить SoL-Pi, но полностью она не снята: на 63 CPU-задачах Terminal-Bench 4 система решает только 15 из них против 18 у Codex и Pi, хотя затраты и получаются ниже. Сжатие контекста, лежащее в основе части механизмов, может стирать важные детали: цитируемое в материале исследование показало, что после сжатия в среднем сохраняется лишь 17% исходных инструкций пользователя. Кроме того, харнесс, обученный только на GPT-5.6 Sol, при переносе на Opus 5 срабатывает реже и не так агрессивно, теряя часть эффективности.
«Больше двух суб-агентов почти всегда впустую сжигают токены, не улучшая качество, поскольку большую часть времени тратят на проверку работы друг друга»
— Эрик Провансер, разработчик Codex