JIT-Agent на лету собирает обвязки для чужих ИИ-агентов и обгоняет GPT-5.6

JIT-Agent на лету собирает обвязки для чужих ИИ-агентов и обгоняет GPT-5.6

Авторы работы отмечают: возможности ИИ-агента определяются не только базовой моделью. Не меньшую роль играет «обвязка» (harness) вокруг неё, управление памятью, стратегия планирования, протокол действий и оркестровка инструментов/навыков. Именно обвязка часто перевешивает вклад самой модели, но сегодня её проектируют вручную под конкретную задачу, и такой подход в принципе не масштабируется.

Чтобы решить эту проблему, авторы обучили JIT-Agent, отдельную модель, которая сама синтезирует обвязки «на лету» (just-in-time) для произвольных готовых агентных LLM. Обвязка формализована как составной, машиногенерируемый артефакт, подчинённый фиксированному протоколу из четырёх модулей. JIT-Agent умеет: подбирать обвязку под конкретную задачу, чинить её для стабильной и надёжной работы и самосовершенствоваться, извлекая сигналы об эффективности из растущего архива прежних конфигураций обвязок.

Результаты замеряли на нескольких моделях. С обвязкой от JIT-Agent модель DeepSeek-V4-Flash обходит GPT-5.6 на бенчмарке DeepSearchQA (+9,1 балла) и на OdysseyBench (+4,3 балла). Уже сильная модель GLM-5.2 получает прибавку до +20,2 балла. В контролируемых сравнениях сгенерированные JIT-Agent обвязки оказались сопоставимы по эффективности со зрелыми агентскими рантаймами вроде OpenCode и Claude Code, точные абсолютные цифры этих рантаймов авторы не приводят, речь только о сопоставимости. Метод стабильно улучшает результаты моделей разного масштаба внутри семейств DeepSeek V4, Mimo-V2.5 и Qwen3.6.

Авторы заявляют, что JIT-Agent, первая модель, специально созданная для just-in-time генерации агентских обвязок, и что это делает «интеллект обвязки» отдельным обучаемым, переносимым и накапливающимся измерением возможностей агента, независимым от масштабирования самой модели.

Ключевые факты

  • JIT-Agent, обученная модель, которая на лету синтезирует и чинит обвязку агента (память, планирование, протокол действий, оркестровка инструментов) как единый машиногенерируемый артефакт по фиксированному протоколу из четырёх модулей.
  • С обвязкой от JIT-Agent DeepSeek-V4-Flash обходит GPT-5.6 на DeepSearchQA (+9,1 балла) и на OdysseyBench (+4,3 балла).
  • GLM-5.2 получает прибавку до +20,2 балла.
  • Сгенерированные обвязки сопоставимы по эффективности со зрелыми агентскими рантаймами вроде OpenCode и Claude Code, но абсолютных цифр этих рантаймов авторы не приводят.
  • Метод стабильно улучшает модели разных масштабов из семейств DeepSeek V4, Mimo-V2.5 и Qwen3.6; авторы называют JIT-Agent первой моделью, созданной специально для just-in-time генерации обвязок.

Почему это важно

Работа формулирует тезис, который часто упускают: результат агента, это не только базовая модель, а связка модели и обвязки вокруг неё (память, план, протокол действий, оркестровка инструментов), и вклад обвязки может перевешивать вклад модели. Сегодня обвязки проектируют вручную под каждую задачу, и это не масштабируется. JIT-Agent превращает проектирование обвязки в отдельную обучаемую задачу, «интеллект обвязки» как измерение возможностей агента, независимое от размера самой модели.

Кому это важно

Прежде всего, командам, которые строят агентные системы поверх сторонних LLM (DeepSeek, GLM, Qwen и другие), и разработчикам агентских рантаймов и фреймворков, для которых прямое сравнение упоминает OpenCode и Claude Code. Полезно и исследователям агентных архитектур, которые ищут способ отделить вклад модели от вклада обвязки вокруг неё.

Как это применить

JIT-Agent берёт произвольную готовую агентную LLM «как есть» и синтезирует для неё обвязку под конкретную задачу, а затем чинит и постепенно улучшает её, опираясь на архив прежних конфигураций. В источнике нет ни ссылки на код или репозиторий, ни даты релиза, ни сведений о публичной доступности, судить о готовности к практическому внедрению по этим данным нельзя.

Можно ли доверять

Материал, препринт на HuggingFace Papers, без указания авторов и организаций в самом тексте аннотации и без деталей методологии обучения за пределами общего описания трёх функций (подбор, починка, самообучение). Все приведённые цифры, это относительный прирост баллов на конкретных бенчмарках, заявленный самими авторами; абсолютных показателей для сравниваемых рантаймов OpenCode и Claude Code в источнике нет, независимой проверки результатов тоже нет.

Риски и подводные камни

Все результаты, самоотчёт авторов на выбранных ими бенчмарках (DeepSearchQA, OdysseyBench), без независимого воспроизведения. Утверждение о сопоставимости с OpenCode и Claude Code не подкреплено абсолютными цифрами, поэтому масштаб реального разрыва (или его отсутствия) оценить нельзя. Детали архива конфигураций и механизма самообучения раскрыты только на уровне общей идеи, а отсутствие ссылки на код или дату релиза не позволяет проверить заявленное на практике.