IBM: ALTK-Evolve обходит ACE по цене при той же точности

IBM: ALTK-Evolve обходит ACE по цене при той же точности

Многошаговый ИИ-агент, например, тот, что сверяет заказ сразу в девяти симулированных приложениях, обычно ошибается не из-за незнания API, а из-за неумения пользоваться им надёжно: неправильно листает страницы результатов, обращается не к тому человеку, возвращает значение там, где его не просили. Такому агента можно научить на собственной истории прошлых попыток. IBM Research показывает, что этим путём идут сразу две системы «агентной памяти», сторонняя ACE (Agentic Context Engineering) и собственная разработка IBM, ALTK-Evolve (представлена в более раннем посте), и сравнивает их напрямую.

Обе системы превращают прошлые траектории агента в переиспользуемые уроки и подают их модели во время работы, без дообучения весов и без разметки людьми. И обе принципиально отказываются сжимать эти уроки в короткую сводку: ACE ведёт единый развивающийся свод инструкций, где у каждого пункта есть счётчик «помогло/навредило»; ALTK-Evolve хранит уроки как отдельно извлекаемые рекомендации, у каждой из которых есть «счёт поддержки», сколько независимых эпизодов её породили. Похожие рекомендации объединяются в кластеры, но при слиянии итоговая запись наследует суммарный счёт, так что свод сжимается, не теряя сведений о том, сколько опыта за ней стоит.

Расходятся системы в другом, в том, как память подаётся модели во время работы, и именно это определяет счёт за токены. ACE закачивает агенту весь свод инструкций на каждом шаге одинаково, вне зависимости от модели и задачи. ALTK-Evolve обращается с подачей как с настраиваемым параметром: небольшое фиксированное ядро из самых подтверждённых рекомендаций плюс отбор под конкретную задачу (по косинусному сходству или с помощью самой модели, с учётом приоритета), либо, если модель способна унести больше, полный консолидированный свод.

Сравнение проводили на бенчмарке AppWorld (сплит test_normal, 168 задач) на одном и том же ReAct-агенте для обеих систем. Чтобы сравнение было корректным по модели и обвязке, авторы не брали цифры ACE из оригинальной статьи (та тестировалась на другой базовой модели, DeepSeek-V3.1), а сами заново прогнали ACE на тех же двух моделях, что и ALTK-Evolve, DeepSeek-V3.2 и gpt-oss-120b. На более способной из двух моделей ALTK-Evolve обходит ACE сразу по обеим метрикам точности (полнота выполнения задачи и полнота сценария) при затратах на инференс около 40% от уровня ACE. На менее способной модели точность практически совпадает, 56,0 против 54,8 (повторный прогон ALTK-Evolve дал 54,8, почти точно как у ACE), но затраты на инференс у ALTK-Evolve при этом примерно в семь раз ниже.

Разбивка по сложности задач показывает разные картины для двух моделей. На DeepSeek-V3.2 ALTK-Evolve выигрывает на лёгких, сложных задачах и в целом, ACE опережает только на задачах средней сложности. На gpt-oss-120b, наоборот, ACE лидирует на лёгких и средних задачах (там, где помогает уже сам по себе развёрнутый свод инструкций), но на сложных задачах, где важнее выбрать нужный урок, а не пролистать все подряд, побеждает выборочная подача ALTK-Evolve, и именно эта категория решает итог. По наблюдению авторов, модели с запасом даётся больше пользы от большего числа уроков, поданных дозированно и не мешающих друг другу; более слабую модель, наоборот, перегружает объёмный контекст.

Авторы прямо оговаривают границы сравнения. Сильной моделью в тексте названа DeepSeek-V3.2, слабой, gpt-oss-120b, но не указано, какой из систем принадлежит каждая из двух базовых точек без памяти на DeepSeek-V3.2 (79,8 и 72,0 TGC), известно только, что эти базовые показатели различаются из-за разницы в шаблоне промпта между двумя реализациями ReAct-агента, а не из-за самой памяти, и авторы не строят вывод на этом разрыве. Абсолютных цифр по токенам или деньгам не приводится, только относительные показатели (~40%, около одной седьмой). Библиотека ALTK-Evolve с конвейером извлечения, консолидации и выдачи рекомендаций доступна открыто, вместе с полным техническим отчётом; детали о том, сколько именно уроков подавать модели и как это масштабируется по уровню её возможностей, авторы обещают раскрыть в следующем посте.

Ключевые факты

  • IBM сравнила свою систему памяти ИИ-агентов ALTK-Evolve с системой ACE (Agentic Context Engineering) на бенчмарке AppWorld, 168 задач, один и тот же ReAct-агент для обеих систем
  • Обе системы не сжимают уроки агента в краткую сводку: ACE ведёт единый развивающийся свод инструкций, ALTK-Evolve, отдельно извлекаемые рекомендации со счётчиком подтверждающих эпизодов
  • Различие, в подаче: ACE закачивает весь свод на каждом шаге независимо от модели, ALTK-Evolve выдаёт калиброванный набор, от узкого ядра до полного свода, в зависимости от того, сколько модель способна усвоить
  • На более способной модели ALTK-Evolve выигрывает по обеим метрикам точности при ~40% затрат на инференс от уровня ACE; на менее способной, практическая ничья по точности (56,0 против 54,8) при затратах примерно в семь раз ниже
  • Источник называет DeepSeek-V3.2 более способной моделью, а gpt-oss-120b, менее мощной; не указано, какой из систем принадлежит какая из двух базовых точек без памяти (79,8 и 72,0)

Почему это важно

Многошаговые ИИ-агенты обычно спотыкаются не из-за незнания API, а из-за неумения пользоваться им надёжно, неправильная пагинация, не тот адресат, лишнее значение в ответе. Такие уроки можно извлекать из истории самого агента без дообучения весов и разметки людьми. ACE и ALTK-Evolve сходятся в том, что копить уроки нужно поштучно, а не сжимать в краткую сводку: сжатие теряет именно те детали, которые агент потом использует. Расхождение, в том, сколько из накопленного опыта реально доходит до модели на каждом шаге, и это напрямую бьёт по счёту за токены.

Кому это важно

Разработчикам многошаговых ИИ-агентов, которые упираются в бюджет на инференс или работают с менее мощными моделями, там, где закачка всего свода инструкций на каждом шаге не помогает, а перегружает контекст. Полезно и тем, кто уже пробовал ACE и хочет сопоставимого или лучшего качества при заметно меньших расходах на токены.

Как это применить

IBM выкладывает библиотеку ALTK-Evolve с конвейером извлечения, консолидации и выдачи рекомендаций в открытом доступе вместе с полным техническим отчётом. Практический вывод из сравнения: подачу накопленного опыта агенту стоит калибровать под возможности конкретной модели, узкое ядро высокоподтверждённых рекомендаций плюс отбор под задачу для менее мощных моделей, полный свод для моделей с запасом контекста, а не всегда закачивать весь объём целиком.

Можно ли доверять

Сравнение внутреннее: авторы ALTK-Evolve сами заново прогнали ACE на тех же двух базовых моделях и той же ReAct-обвязке, что и свою систему, а не взяли цифры из оригинальной статьи ACE (та тестировалась на другой модели, DeepSeek-V3.1), это делает сопоставление корректнее по модели и обвязке, но не убирает того, что обе стороны сравнения посчитаны одной командой. Авторы честно указывают на техническую оговорку: нулевые базовые показатели двух систем на DeepSeek-V3.2 расходятся (79,8 против 72,0) просто из-за разницы в шаблоне промпта, а не из-за самой памяти, и не опирают вывод на этот разрыв.

Риски и подводные камни

Сильной моделью в тексте названа DeepSeek-V3.2, слабой, gpt-oss-120b, но не указано, какой из систем принадлежит каждая из двух базовых точек без памяти. Абсолютных цифр по токенам или деньгам не приведено, только относительные (~40%, около одной седьмой), так что сопоставить реальные затраты в токенах или долларах по этому посту не получится. Подробности о том, сколько именно уроков подавать модели и как это масштабируется по уровню модели, авторы обещают раскрыть в следующем посте, здесь дан только один срез результатов.