RHI: рекурсивная самонастройка агентной «обвязки» экономит до 60% на инференсе

Статья «Recursive Harness Self-Improvement» (RHI) описывает метод улучшения не самой модели, а её «обвязки» (harness), программной прослойки, которая формирует промпты, управляет циклом работы агента и координирует обмен информацией между его частями. Отправная точка авторов: в условиях совместной эволюции модели и обвязки последняя перестаёт быть просто вспомогательным слоем поверх модели, трассы её выполнения (то, как агент рассуждал и действовал шаг за шагом) сами становятся данными, которые в будущем могут пойти на обучение следующих моделей. Отсюда идея «обучения в контуре обвязки»: оптимизировать её сразу по двум критериям, по немедленной производительности агента и по качеству трасс для будущего обучения моделей.
Проблема в том, что постоянно дорабатывать готовые обвязки от разработчиков моделей дорого и трудоёмко. Авторы проверяют, можно ли вместо этого лёгким и быстрым способом дообучать собственную, пользовательскую обвязку под конкретную задачу. Метод RHI представляет обвязку как промпт-спецификацию цикла работы агента и итеративно улучшает её, сравнивая пары версий из истории собственных правок (парная обратная связь по ревизиям), без изменения весов модели.
Метод проверили на 30 синтетических задачах из области машинно-обучающих исследований, в квантовых финансах, робототехнике и фармацевтике. Уже нескольких итераций RHI хватает, чтобы заметно поднять потолок производительности агентов с низким «усилием рассуждения» (более дешёвый, быстрый режим модели), они начинают превосходить те же агенты в режиме максимального усилия рассуждения, при этом расходы на инференс снижаются до 60%. Авторы отдельно проверили источник этого выигрыша: прирост даёт не более длинное рассуждение модели, а более эффективное управление контекстом под конкретную задачу, то, как информация передаётся между частями агента. В завершение работы авторы формализуют эту динамику как информационно-теоретическую гипотезу о неявной цели оптимизации RHI и предлагают метод как практический алгоритм непрерывного обучения в парадигме совместной эволюции модели и обвязки.
Ключевые факты
- Метод RHI (Recursive Harness Self-Improvement) итеративно улучшает промпт-спецификацию агентной «обвязки» (harness), а не веса самой модели
- Улучшение идёт через парное сравнение версий обвязки по истории её правок, без дообучения модели
- На 30 синтетических задачах (квантовые финансы, робототехника, фармацевтика) несколько итераций RHI поднимают агентов с низким усилием рассуждения выше агентов с максимальным усилием рассуждения
- Экономия расходов на инференс, до 60%
- Прирост объясняется более эффективным управлением контекстом и обменом информацией между частями агента, а не более длинными цепочками рассуждений
Почему это важно
Работа предлагает альтернативу дорогому дообучению моделей: вместо того чтобы улучшать саму модель, авторы улучшают промпт-обвязку вокруг неё, слой, который управляет циклом работы агента. Ключевая идея в том, что обвязка перестаёт быть просто вспомогательным инструментом на этапе инференса: трассы её выполнения могут в будущем стать данными для обучения следующих моделей, а значит, качество обвязки влияет не только на текущий результат, но и на то, чему учится следующее поколение моделей.
Кому это важно
Прежде всего инженерам, которые строят агентные системы поверх готовых моделей и хотят повысить их качество без доступа к дообучению модели или без затрат на дорогие режимы с максимальным усилием рассуждения. Также это релевантно исследователям, изучающим совместную эволюцию моделей и агентных обвязок как источник данных для обучения.
Как это применить
RHI представляет обвязку агента как промпт-спецификацию, текстовое описание цикла работы агента, и итеративно её переписывает, опираясь на парную обратную связь между версиями из истории собственных правок. Метод не требует переобучения модели и, по данным авторов, достигает заметного эффекта за несколько итераций, оставаясь вычислительно лёгким. Тестировался метод на 30 синтетических исследовательских задачах машинного обучения в трёх областях, квантовых финансах, робототехнике и фармацевтике.
Можно ли доверять
Это препринт (страница на Hugging Face Papers, первый автор, Hyunin Lee), без указания на прохождение рецензирования. Результаты получены на 30 синтетических задачах в трёх узких областях, что ограничивает выводы о переносимости метода на реальные, не синтетические агентные сценарии. Заявленная экономия до 60% на инференсе, верхняя граница, достигнутая в конкретной экспериментальной постановке, а не универсальный показатель.
Риски и подводные камни
Синтетические задачи могут не отражать всю сложность и разнообразие реальных рабочих нагрузок агентов, поэтому выигрыш на них не гарантирует такого же результата на практике. Итеративная доработка обвязки на основе парной обратной связи по истории собственных версий потенциально может переобучиться под конкретный набор задач или закрепить систематические ошибки, если сигнал обратной связи зашумлён. Наконец, авторы прямо ограничивают область тестирования тремя доменами и синтетическими задачами, насколько метод устойчив за их пределами, работа не показывает.