Harness-Zero переносит поведение агентного харнеса в веса модели

Harness-Zero переносит поведение агентного харнеса в веса модели

Харнес, внешняя система вокруг модели, которая опосредует её взаимодействие со средой: промпты, логика управления, доступные инструменты, формат действий. Харнес способен заметно поднять качество работы агента, но этот прирост привязан именно к тому харнесу, с которым модель развёртывают: лучший харнес для одной области, экземпляра задачи или модели обычно не лучший для другой. В итоге универсальному агенту приходится либо мириться с единым, но не оптимальным для всех случаев харнесом, либо распределять запросы по постоянно растущему набору узкоспециализированных харнесов под каждую задачу.

Исследователи изучают «дистилляцию харнеса»: доменно- или задаче-оптимизированный харнес используется как ориентир на этапе обучения, а поведение, которое он вызывает, переносится в веса модели, так что прирост сохраняется даже под единым фиксированным харнесом на инференсе. Сложность в том, что оптимизированный (обучающий) и целевой (рабочий) харнесы обычно различаются пространством действий и доступной информацией, поэтому подсказки из первого нельзя напрямую использовать как обучающий сигнал для второго.

Harness-Zero решает это через приём «агент как харнес»: вместо того чтобы жёстко зашивать логику оптимизированного харнеса в код, роль харнеса берёт на себя ещё один агент. Ведомый оптимизированным харнесом, этот «харнес-агент» правит ответы обучаемой модели («студента») ещё до того, как они выполняются в пространстве действий целевого харнеса, так подсказки оптимизированного харнеса превращаются в обучающие демонстрации в формате, пригодном для целевой системы. Дообучение модели на получившихся траекториях встраивает вызванное харнесом поведение прямо в её веса, и специализированный харнес на реальном инференсе становится не нужен.

В экспериментах на задачах из интеллектуальной работы со знаниями, использования инструментов и научной области исследователи показывают три результата. Во-первых, для топовых LLM при одном и том же развитом харнесе подход «агент как харнес» превосходит вариант, где харнес реализован жёстко как код. Во-вторых, после дообучения и снятия специализированного харнеса на инференсе Harness-Zero поднимает средний по домену показатель успешного решения задач у базовой модели с 23,3% до 44,3%, это выше 41,7%, которые та же модель показывает, если специализированный харнес оставить подключённым. В-третьих, Harness-Zero восстанавливает у базовой модели поведенческие паттерны, которых у неё изначально не было и которые вызывал именно харнес: в среднем 82,3% из 28 таких паттернов в трёх исследованных областях.

Ключевые факты

  • Прирост от агентного харнеса обычно привязан к конкретному харнесу на инференсе, универсальному агенту приходится либо терпеть неоптимальный общий харнес, либо плодить специализированные под каждый случай
  • Harness-Zero переносит поведение, вызванное оптимизированным харнесом, в веса модели через приём «агент как харнес»: отдельный харнес-агент правит ответы студента ещё до выполнения в целевом пространстве действий
  • Для топовых LLM при одинаковом харнесе подход «агент как харнес» превосходит харнес, реализованный жёстко как код
  • После снятия специализированного харнеса на инференсе Harness-Zero поднимает средний показатель успеха задач с 23,3% до 44,3%, выше 41,7%, которые даёт та же модель с подключённым харнесом
  • Метод восстанавливает 82,3% из 28 харнес-специфичных поведенческих паттернов в трёх областях, изначально отсутствовавших у базовой модели

Почему это важно

Обычно улучшения от агентного харнеса живут только вместе с самим харнесом: снять его на проде, и часть прироста качества пропадает вместе с ним. Harness-Zero предлагает перенести именно поведение, а не инфраструктуру: обучить модель действовать так, как если бы специализированный харнес был на месте, и убрать его на инференсе, не потеряв в качестве. Это меняет экономику развёртывания, не нужно держать и поддерживать зоопарк узких харнесов под каждый домен, если их эффект можно один раз «впаять» в веса.

Кому это важно

Работа адресована тем, кто строит и эксплуатирует агентные системы поверх LLM: инженерам, которые поддерживают несколько специализированных харнесов под разные домены и задачи, исследователям методов дообучения и дистилляции агентов, и тем, кто закладывает архитектуру универсального агента, где нельзя заранее знать, какой харнес понадобится под конкретный запрос.

Как это применить

Схема требует уже существующего доменно- или задаче-оптимизированного харнеса как источника ориентира на этапе обучения. Отдельный харнес-агент, ведомый этим оптимизированным харнесом, правит ответы обучаемой модели ещё до их выполнения в целевом (рабочем) пространстве действий, так получаются обучающие демонстрации, совместимые с целевым харнесом. Дообучение на этих траекториях переносит вызванное харнесом поведение в веса модели, после чего специализированный харнес на инференсе можно убрать вовсе.

Можно ли доверять

Метод проверен на трёх разных типах задач, интеллектуальная работа со знаниями, использование инструментов, научная область, и результаты сопоставлены сразу по трём осям: агент-как-харнес против харнеса-как-кода, харнес снят против харнеса оставлен, и отдельно доля восстановленных харнес-специфичных паттернов. В тексте источника не названы ни авторы работы, ни их организации, ни конкретные бенчмарки или наборы данных, ни модель (или её размер), на которой ставились эксперименты, ни затраты по времени или вычислениям на этапе дообучения, ни дата публикации, это заметно ограничивает возможность независимо оценить условия и масштаб экспериментов.

Риски и подводные камни

Метод всё равно требует доступа к качественному доменно- или задаче-оптимизированному харнесу как источнику обучающего сигнала, Harness-Zero снимает харнес на инференсе, но не отменяет работу по его созданию на этапе обучения. Восстановление харнес-специфичных паттернов не полное: 82,3% в среднем означает, что часть вызванного харнесом поведения по-прежнему теряется при переносе в веса. Наконец, источник не раскрывает состав тестовых наборов и вычислительную стоимость самого процесса дистилляции, поэтому судить о переносимости результата на другие модели и домены напрямую нельзя.