Зацикленные языковые модели точнее выполняют составные вызовы инструментов

Зацикленные языковые модели (looped language models), архитектура, в которой вычисления несколько раз подряд пропускаются через одни и те же слои, прежде чем модель выдаст ответ, уже показывали хорошие результаты на тестах на рассуждение (reasoning benchmarks). Но насколько они пригодны для агентных сценариев, где модели нужно самостоятельно вызывать внешние инструменты, до этой работы почти не изучалось.
Исследователи сосредоточились именно на составных (многошаговых) сценариях вызова инструментов, когда модель должна скоординировать сразу несколько обращений к API, удержать промежуточное состояние между шагами и учитывать зависимости между вызовами: результат одного шага влияет на следующий.
Для проверки сравнили изначально зацикленные модели и обычные модели, дообученные (переделанные) под зацикленную схему, с обычными, незацикленными моделями. Все модели обучали по одинаковым рецептам дообучения с учителем (SFT), а при выводе ответа отдельно меняли глубину рекуррентности, то есть число повторов вычислений. Проверку провели на трёх тестах на вызов инструментов: API-Bank, BFCL и NESTful.
В контролируемых экспериментах повторяющиеся (рекуррентные) вычисления в целом заметнее всего помогали именно в составных сценариях с зависимостями между вызовами, а на одиночных, изолированных вызовах одного API выигрыш был меньше и сильнее зависел от конкретной модели. Точность на многошаговых задачах в целом росла вместе с глубиной рекуррентности, чем больше повторов, тем выше точность. При этом адаптивный вывод (adaptive inference), при котором модель сама решает, сколько дополнительных вычислений потратить, добавляя их только когда это нужно, дал более выгодное соотношение между затратами вычислений и качеством результата, чем просто максимальная глубина повторов для всех задач подряд.
Из этого исследователи делают вывод, что зацикленные языковые модели, перспективная архитектура для агентных систем, которым нужны надёжные планирование, координация и выполнение составных сценариев вызова инструментов.
Ключевые факты
- Зацикленные (looped) языковые модели, уже показавшие себя на тестах на рассуждение, впервые системно проверили в задачах вызова инструментов, на трёх тестах: API-Bank, BFCL и NESTful.
- Изначально зацикленные модели и модели, дообученные (переделанные) под зацикленную схему, сравнили с обычными моделями; все обучались по одинаковым рецептам дообучения с учителем (SFT), варьировалась только глубина рекуррентности при выводе.
- Повторяющиеся вычисления заметнее всего помогают в составных, многошаговых сценариях с зависимостями между вызовами API, на одиночных вызовах одного инструмента выигрыш меньше и зависит от конкретной модели.
- Точность на многошаговых задачах растёт вместе с глубиной рекуррентности, но адаптивный вывод, когда модель сама решает, сколько повторов вычислений нужно, даёт более выгодный баланс между затратами и качеством, чем максимальная глубина повторов всегда.
- Авторы считают зацикленную архитектуру перспективной для ИИ-агентов, которым нужно надёжно планировать, координировать и доводить до конца составные вызовы инструментов.
Почему это важно
До этой работы зацикленные модели были изучены в основном на задачах на рассуждение, а их пригодность для агентных сценариев с вызовом инструментов оставалась почти неисследованной. Эта работа закрывает именно этот пробел: она показывает, что повторяющиеся вычисления помогают не только в рассуждении, но и там, где модели нужно скоординировать несколько вызовов API и учесть зависимости между ними, причём выигрыш проявляется избирательно, именно в составных сценариях, а не универсально.
Кому это важно
Тем, кто разрабатывает архитектуры моделей и системы для вызова инструментов (function calling/tool use) в ИИ-агентах, исследователям и инженерам, выбирающим, на чём строить агентов для многошаговых задач с внешними API. А также тем, кто оптимизирует затраты на инференс: результат про адаптивный вывод даёт конкретный рычаг для экономии вычислений без потери точности на многошаговых сценариях.
Как это применить
Практический вывод работы: если система должна выполнять составные, многошаговые вызовы инструментов с зависимостями между ними, увеличение глубины рекуррентности, числа повторов вычислений при выводе ответа, работает как способ поднять точность. При этом не обязательно строить модель зацикленной с нуля: авторы проверяли и вариант, при котором обычную модель дообучают (переделывают) под зацикленную схему. Экономичнее всего, не выставлять максимальную глубину повторов всегда, а использовать адаптивный вывод, при котором дополнительные вычисления тратятся только когда задача действительно этого требует.
Можно ли доверять
В доступном тексте нет ни конкретных цифр точности по каждому из трёх тестов, ни названий и размеров сравниваемых моделей, ни имён авторов, института или места публикации, только качественное описание результатов и выводы самих исследователей («в целом», «сильнее», «более выгодное соотношение»). Сама постановка эксперимента говорит в пользу методической аккуратности, модели сравнивали при одинаковых рецептах обучения, варьируя только глубину рекуррентности, но оценить масштаб эффекта по цифрам из этого текста нельзя: для этого нужно смотреть саму статью с таблицами результатов.
Риски и подводные камни
Выигрыш от зацикленной архитектуры неравномерен: на одиночных вызовах одного API он меньше и заметно зависит от конкретной модели, то есть правило «зацикленность всегда лучше» здесь не работает. Рост точности с глубиной рекуррентности означает и рост вычислительных затрат, сами авторы говорят о компромиссе между вычислениями и качеством, который адаптивный вывод смягчает, но не убирает полностью. Наконец, все выводы получены на трёх конкретных тестах и на моделях, обученных по одному общему рецепту, насколько это переносится на другие сценарии, инструменты и модели, из текста не следует.
«Наши результаты позволяют предположить, что зацикленные языковые модели, перспективная архитектура для агентных систем, которым необходимы надёжное планирование, координация и выполнение составных сценариев вызова инструментов.»
— авторы исследования