AgSpec ускоряет кодинг-агентов: генерация быстрее до 4,76 раза

AgSpec ускоряет кодинг-агентов: генерация быстрее до 4,76 раза

Спекулятивное декодирование на основе поиска (retrieval-based speculative decoding) строит черновик из следующих токенов, копируя продолжения из уже имеющегося текста. Для кодинг-агентов это удобно: они постоянно воспроизводят код, логи и свои прежние попытки. Но, по словам авторов статьи, существующие методы в агентных конвейерах работают хуже, чем могли бы, по двум причинам. Во-первых, значительная часть повторно используемого текста отсутствует в их корпусах или хранится в форме, отличной от той, в которой её выдаёт агент. Во-вторых, длина черновика не учитывает, что длина принятой части меняется от агента к агенту и дрейфует от хода к ходу.

AgSpec, фреймворк, который добавляет то, чего не хватает существующим поисковым движкам в конвейерах кодинг-агентов: политики выбора корпуса и длины черновика. Поиск ведётся сразу по трём корпусам, сессии, рабочему пространству (workspace) и глобальному. При этом сохраняется траектория текущей сессии, а открытые файлы индексируются в том формате, в котором их выдаёт агент. Длина черновика каждого агента ограничивается сверху значением, подобранным заранее при офлайн-профилировании, а затем подстраивается в ходе работы по обратной связи от проверки черновика.

На двух многоагентных бенчмарках уровня репозитория AgSpec, по утверждению авторов, превосходит пять поисковых генераторов черновиков и EAGLE-3 в большинстве оцениваемых настроек. Пропускная способность генерации по сравнению с обычным авторегрессионным декодированием выросла до 4,37 раза при размере батча 1 и до 4,76 раза при размере батча 16. Авторы также пишут, что AgSpec остаётся эффективным на бенчмарках без репозитория и без многоагентного конвейера, и делают вывод, что выигрыш переносится на кодинг-агентов в целом.

Ключевые факты

  • AgSpec, фреймворк спекулятивного декодирования на основе поиска, рассчитанный на конвейеры кодинг-агентов.
  • Поиск черновиков идёт по трём корпусам: сессии, рабочему пространству и глобальному; открытые файлы индексируются в формате, который выдаёт агент.
  • Длина черновика ограничена сверху значением из офлайн-профилирования и подстраивается онлайн по обратной связи от проверки.
  • Пропускная способность генерации выше обычного авторегрессионного декодирования до 4,37 раза при батче 1 и до 4,76 раза при батче 16.
  • На двух бенчмарках уровня репозитория AgSpec, по заявлению авторов, обходит пять поисковых генераторов черновиков и EAGLE-3 в большинстве настроек.

Почему это важно

Кодинг-агенты много раз подряд генерируют текст, который сильно повторяет уже написанное: код, логи, прежние попытки. Метод, который использует это повторение для ускорения вывода, снижает задержку и повышает пропускную способность без смены самой модели. Авторы утверждают, что именно в агентных конвейерах существующие поисковые методы недоиспользуют такие повторы, и AgSpec нацелен на этот пробел.

Кому это важно

Прежде всего тем, кто развёртывает инференс (запуск моделей) для кодинг-агентов и многоагентных конвейеров и заинтересован в пропускной способности генерации. Также исследователям спекулятивного декодирования, которым интересно сравнение поисковых методов с EAGLE-3.

Как это применить

В аннотации описана идея, которую можно взять за ориентир при проектировании: держать корпус для поиска из трёх уровней (сессия, рабочее пространство, глобальный), индексировать файлы в том виде, в каком агент их выдаёт, и задавать длину черновика отдельно для каждого агента, сверху офлайн-профилем, а дальше подстраивать по результатам проверки. Сведений о выпуске кода или о лицензии в источнике нет.

Можно ли доверять

Все цифры, заявления авторов из аннотации статьи на Hugging Face. Рецензирования или независимой проверки в источнике не показано. В аннотации не названы авторы и организации, не указаны названия бенчмарков, моделей и оборудование, поэтому оценить, насколько условия сравнения честны, по ней нельзя. Значения 4,37 и 4,76 раза, это максимумы («до») относительно авторегрессионного декодирования, а не типичные или средние ускорения; средних значений нет. Данных об ускорении относительно EAGLE-3 и поисковых конкурентов тоже нет, только то, что AgSpec лучше них в большинстве настроек.

Риски и подводные камни

Формулировка «в большинстве оцениваемых настроек» означает, что в части настроек AgSpec не выигрывает, но какие именно это настройки, в аннотации не указано. Максимальные значения ускорения не стоит читать как ожидаемый результат в реальной работе. Вывод об обобщении на кодинг-агентов в целом сделан авторами на основе бенчмарков без репозитория и без многоагентного конвейера; детали этих проверок в аннотации не раскрыты.