DCAS показал: ИИ-агенты для кода теряют навыки при смене CLI-инструмента

DCAS показал: ИИ-агенты для кода теряют навыки при смене CLI-инструмента

CLI-агенты для программирования (агенты, которые выполняют задачи разработки через командную строку) быстро развиваются, но открытая экосистема фактически сошлась на единственной среде обучения: почти все датасеты траекторий (записанных последовательностей действий агента), на которых дообучают открытые модели, собираются под OpenHands. Модели, дообученные на этих данных, хорошо показывают себя именно в OpenHands, но заметно теряют качество, если их запускают под любой другой обвязкой (CLI-оболочкой, которая управляет циклом работы агента), той, на которой их не обучали. При этом необученные базовые модели такого расхождения не показывают: значит, разрыв создаёт именно дообучение, привязанное к конвенциям среды обучения, а не сама архитектура модели.

Авторы выдвигают гипотезу: ключевая, но зависящая от конкретной обвязки способность, это структура планирования. Они различают два вида планирования: явное, план, который агент составляет как отдельный артефакт перед началом работы, и неявное, структурные конвенции, которые формируют выполнение задачи на протяжении всего цикла работы агента. Если гипотеза верна, закрыть разрыв между обвязками можно, только превратив планирование из жёстко зашитого в конкретную обвязку артефакта в обучаемую способность самой модели.

Для проверки авторы представили DCAS (Decoupling CLI Agent Scaffolding, «развязка обвязки CLI-агента»), слой перехвата, который подменяет бэкенд: он перенаправляет API-трафик между любой CLI-обвязкой и любой моделью-бэкендом, не изменяя саму обвязку. Это позволяет, во-первых, оценивать одну и ту же модель сразу в разных обвязках, а во-вторых, собирать обучающие траектории с учётом планирования (planning-aware).

Контролируемый эксперимент с подменой источника плана через DCAS подтвердил, что качество планирования, фактор с высоким рычагом: выигрыш от лучшего планирования превышает потери, которые модель несёт при переносе в чужую обвязку. Модель, дообученная на небольшом наборе planning-aware траекторий, собранных DCAS под одной-единственной обвязкой, стабильно выигрывает при переносе в другие обвязки, на которых её не обучали. Наконец, эксперименты подтвердили, что явное и неявное планирование, эмпирически разделимые сущности в обучающих данных, а не одно и то же под разными названиями.

Ключевые факты

  • Датасеты для дообучения открытых CLI-агентов почти всегда собираются под одну среду, OpenHands, и модели, обученные на них, теряют качество при переносе в другие CLI-обвязки.
  • Необученные базовые модели такого разрыва не показывают, значит, причина в дообучении, привязанном к конвенциям среды обучения, а не в самой модели.
  • Авторы различают явное планирование (план как отдельный артефакт перед стартом) и неявное планирование (структурные конвенции цикла работы агента).
  • DCAS, слой перехвата API-трафика, который подставляет любую модель под любую CLI-обвязку без изменения самой обвязки, позволяя оценивать модели кросс-обвязочно и собирать planning-aware траектории.
  • Дообучение на небольшом наборе таких траекторий под одной обвязкой стабильно улучшает работу модели в других обвязках, на которых её не обучали.

Почему это важно

Экосистема открытых CLI-агентов для разработки фактически стоит на одном фундаменте, OpenHands как единственной массовой среде для сбора обучающих траекторий. Работа показывает, что это создаёт скрытую хрупкость: модель, которая отлично работает в исходной обвязке, теряет качество, стоит переставить её в другую CLI-оболочку, при том что дело не в самой модели (необученные базовые модели такого перепада не показывают), а в том, что дообучение зашивает в неё конвенции планирования конкретной среды.

Кому это важно

Разработчикам открытых моделей для программирования и авторам CLI-инструментов для агентов, тем, кто дообучает модели на траекториях и рассчитывает, что результат будет переносим между разными обвязками, а не привязан к одной конкретной среде.

Как это применить

DCAS даёт практический путь: слой перехвата подставляется между любой существующей CLI-обвязкой и любым бэкендом-моделью без изменения самой обвязки, это позволяет тестировать модель сразу в нескольких средах и собирать для дообучения planning-aware траектории, где явное и неявное планирование размечены раздельно, а не смешаны, как раньше.

Можно ли доверять

Источник, предзагруженный текст аннотации статьи (страница на Hugging Face). В нём нет ни конкретных числовых результатов (величин расхождения между обвязками или выигрыша от planning-aware дообучения), ни имён соавторов и организаций, ни названий других CLI-обвязок кроме OpenHands, ни размера обучающего датасета, всё это в исходном материале попросту не указано, а не потеряно при пересказе.

Риски и подводные камни

Заявленные эффекты, расхождение между обвязками и выигрыш от planning-aware дообучения, описаны качественно, без цифр, так что степень эффекта по этому тексту не проверить. Список того, что осталось за кадром (метрики, состав авторов, другие обвязки, объём данных), стоит учитывать при оценке зрелости результата.