JAZ: минималистичный ИИ-агент на одном примитиве обошёл MemGPT и ACE

Исследователи построили LLM-агентный фреймворк JAZ, чтобы проверить, способен ли минимальный «каркас» (harness), состоящий почти исключительно из самого агентного цикла, справляться с задачами, для которых обычно создают специализированные системы, системы памяти и системы самообучения. Обычные агентные системы дают модели набор инструментов и позволяют ей чередовать вызовы этих инструментов с наблюдением результата, но для длинных задач с удержанием контекста или для непрерывного самоулучшения разработчикам, по словам авторов, приходится добавлять дополнительную инженерную обвязку поверх агентного цикла.

JAZ построен вокруг единственного основанного на LLM примитива invoke (обобщение существующих агентных циклов в «режиме кода») и набора встроенных хуков, позволяющих программисту накладывать ограничения и вести мониторинг. Авторы определяют invoke как простейший цикл, удовлетворяющий двум свойствам: во-первых, модель может писать произвольный исполняемый код, включающий рекурсивные вызовы invoke; во-вторых, всё, что видит модель, все входные данные invoke и история её взаимодействия со средой исполнения кода, представлено как переменные этой же среды. Авторы описывают invoke как языковой примитив, аналогичный функции, реализация которой предоставляется во время выполнения самой моделью при каждом вызове.

Чтобы проверить эту конструкцию, авторы протестировали invoke без каких-либо вручную спроектированных инструментов, дополнительного каркаса или внешних систем вроде памяти или файловой системы, только с помощью промптинга, на задачах, которые традиционно решаются через специализированные внешние харнессы. На длинных задачах, требующих удержания информации за пределами контекстного окна, JAZ invoke превзошёл Letta (MemGPT) на 8% при вдвое меньшей стоимости на части бенчмарка StuLife, ориентированной на удержание в памяти. На задачах непрерывного самоулучшения JAZ invoke превзошёл систему ACE на 4% при меньшей стоимости на бенчмарке AppWorld, точная величина экономии в этом случае не приводится, только качественное указание «ниже».

Ключевые факты

  • JAZ, минималистичный агентный фреймворк, построенный вокруг единственного примитива invoke
  • invoke удовлетворяет двум свойствам: модель пишет произвольный код с рекурсивными вызовами invoke, а всё видимое модели хранится как переменные среды исполнения
  • Тестирование проводилось без вручную спроектированных инструментов, отдельного харнесса, систем памяти или файловой системы, только промптинг
  • На части бенчмарка StuLife, требующей удержания информации, JAZ invoke обошёл Letta (MemGPT) на 8% при вдвое меньшей стоимости
  • На бенчмарке AppWorld для непрерывного самоулучшения JAZ invoke обошёл систему ACE на 4% при меньшей (но не названной точно) стоимости

Почему это важно

Работа ставит под вопрос необходимость сложных специализированных систем памяти и самообучения, которые сейчас достраивают поверх агентного цикла. Авторы показывают, что предельно простой примитив invoke, дающий модели писать код и видеть всё как переменные среды, способен решать задачи из этих категорий не хуже, а по метрикам, лучше специализированных решений вроде MemGPT и ACE.

Кому это важно

Разработчикам агентных фреймворков и харнессов, инженерам, проектирующим системы памяти и самообучения для LLM-агентов, а также исследователям, изучающим минимальные архитектуры агентных циклов.

Как это применить

Идея invoke, заменить отдельно проектируемые модули памяти и самообучения единым рекурсивным примитивом вызова, где вся история взаимодействия хранится как переменные кода, может служить ориентиром при проектировании новых агентных систем без наращивания дополнительной инфраструктуры. Сведений о доступности кода, лицензии или стоимости использования самого JAZ в источнике нет.

Можно ли доверять

Материал, препринт на arXiv; в извлечённом тексте нет имён авторов, институциональной принадлежности и даты публикации, работа не отмечена как прошедшая рецензирование. Числовые результаты (8% и 4% прироста) приведены со ссылкой на конкретные бенчмарки StuLife и AppWorld, но методика подсчёта стоимости и точное определение «recall-heavy» части StuLife в тексте не раскрываются.

Риски и подводные камни

Экономия по стоимости против ACE на AppWorld указана лишь качественно («ниже»), без конкретной цифры, что затрудняет сравнение. Как именно измеряются метрики и стоимость на обоих бенчмарках, не поясняется, а сама работа, непроверенный рецензированием препринт, поэтому результаты стоит воспринимать как предварительные до независимой проверки.