IBM Research выяснила: память ИИ-агента нужно дозировать под модель

IBM Research выяснила: память ИИ-агента нужно дозировать под модель

Исследователи IBM Research представили ALTK-Evolve, методику, которая позволяет ИИ-агенту учиться на собственном опыте без дообучения весов и без разметки человеком: система извлекает из прошлых траекторий агента (успешных и неудачных) многоразовый набор рекомендаций-guidelines и подставляет их обратно в контекст на этапе вывода.

Методику проверили на восьми моделях, от плотной модели на 30 млрд параметров до передовых проприетарных систем, на бенчмарке AppWorld: 585 многошаговых задач (168 в normal-наборе и 417 в challenge-наборе) в 9 симулированных приложениях (календари, мессенджеры, платежи и другое). Успех измеряли двумя метриками: TGC (Task Goal Completion, доля полностью и верно выполненных задач) и более строгой SGC (Scenario Goal Completion), сценарий засчитывается, только если агент справился со всеми его вариациями.

Главный вывод: единого правильного объёма памяти не существует, он зависит от уровня модели. Выделили три повторяющихся паттерна:

  1. Сильные модели с запасом возможностей выигрывают от полного набора рекомендаций, включая редкие граничные случаи. DeepSeek-V3.2 (671 млрд параметров, MoE) с полным набором прибавила +9,5 п.п. в TGC и +16,1 п.п. в SGC.
  2. Более слабые модели «тонут» в большом наборе рекомендаций, им подходит компактное ядро из самых надёжных правил плюс несколько релевантных задаче рекомендаций, отбираемых под конкретный запрос. Модель gpt-oss-120b (117 млрд параметров, MoE) с таким выборочным подходом прибавила +16,1 п.п. в TGC, при этом расход токенов вырос всего на +5%; полный набор рекомендаций дал прирост меньше и обошёлся примерно на 50% дороже по токенам.
  3. Модели, уже близкие к потолку своих возможностей на этих задачах, не показали измеримого выигрыша, авторы называют это «паттерном насыщения», уточняя, что это описание наблюдения, а не доказанная причина. В их прогонах в эту категорию попала GLM-5 (745 млрд параметров, MoE), числового значения падения или прироста TGC/SGC для неё в тексте не приводится, указано лишь «нет измеримого выигрыша».

Авторы подчёркивают, что попадание модели в тот или иной паттерн определяется не просто числом параметров: на это может влиять запас по бенчмарку, размер контекстного окна, архитектура, качество рекомендаций и распределение задач, но какой из этих факторов решающий, работа не устанавливает, разделение факторов названо предметом дальнейшей работы.

Эффект памяти сохраняется даже у моделей, близких к потолку по TGC: GPT-5.5 и Opus, обе почти на пределе по TGC, всё равно прибавили +7,2 и +7,1 п.п. соответственно по более строгой метрике SGC, то есть память продолжает помогать, пока у модели остаются хоть какие-то незакрытые типы ошибок.

По стоимости: выборочная («curated») подача рекомендаций держит расход токенов почти на уровне базового прогона без памяти, то есть для более слабых моделей она одновременно и точнее, и дешевле полного набора. Число шагов рассуждения (ReAct-шагов) при этом почти не меняется: у DeepSeek с памятью и без неё оно остаётся примерно тем же (≈18, 19 шагов в среднем), то есть память удорожает не число шагов, а объём токенов на входе. Практический рычаг экономии в проде, кэширование промпта: статичная часть набора рекомендаций одинакова на каждом шаге и может кэшироваться, что существенно снижает эффективную стоимость; для этого важно держать общий префикс с рекомендациями стабильным, чтобы кэш не сбрасывался. Авторы также предполагают (но пока не проверяли контролируемыми экспериментами), что размер контекстного окна модели тоже играет роль: модели с большим окном могут эффективнее усваивать полный набор рекомендаций, а модели с маленьким контекстом больше выигрывают от компактной выборки.

Авторы формулируют практический вывод: не стоит отдавать агенту весь накопленный опыт целиком, стоит отдавать ровно тот объём, который модель способна реально использовать. Для слабых моделей это компактное ядро плюс несколько точечных рекомендаций (и одновременно самый дешёвый вариант), для сильных, полный набор с кэшированием промпта для экономии, для «насыщенных» моделей, вообще не тратить на это лишний контекст, пока не станет понятнее, что именно им мешает.

Авторы называют это отправной точкой, а не финалом: среди дальнейших направлений, обучаемый селектор рекомендаций (нынешний отбор по косинусному сходству, по их собственным данным, не идеально предсказывает, какие рекомендации реально помогут в конкретной задаче), память для очень слабых моделей (у них самодистилляции не хватает сигнала, для них рассматривают дистилляцию от более сильной модели-учителя), проверка выводов за пределами AppWorld и контролируемые эксперименты, отдельно выделяющие роль размера контекстного окна.

Ключевые факты

  • IBM Research представила ALTK-Evolve: агент сам извлекает из своих прошлых траекторий (удачных и неудачных) многоразовый набор рекомендаций и получает их обратно в контекст на этапе вывода, без дообучения весов и без разметки человеком.
  • На восьми моделях на бенчмарке AppWorld (585 задач) выявили три паттерна: сильным моделям с запасом нужен полный набор рекомендаций, слабым, компактное ядро с точечной подборкой под задачу, «насыщенным» моделям память не даёт измеримого выигрыша.
  • DeepSeek-V3.2 (671B) с полным набором рекомендаций прибавила +9,5 п.п. TGC и +16,1 п.п. SGC; gpt-oss-120b (117B) с выборочной подачей прибавила +16,1 п.п. TGC при росте токенов всего на +5%, дешевле и точнее полного набора, который обошёлся примерно на 50% дороже по токенам.
  • Даже у моделей у потолка возможностей (GPT-5.5, Opus) память ещё даёт +7,2 и +7,1 п.п. по строгой метрике SGC, эффект не исчезает наверху шкалы, пока остаются незакрытые типы ошибок.
  • Практический рычаг экономии, кэширование промпта: статичная часть набора рекомендаций одинакова на каждом шаге и кэшируется, что делает даже полный набор доступным по цене в проде; число шагов рассуждения агента при добавлении памяти почти не меняется.

Почему это важно

Расхожая интуиция, «чем больше опыта агенту дать, тем лучше он справится», по данным IBM Research неверна как универсальное правило. Прогон на восьми моделях показал, что объём памяти, который реально улучшает результат, зависит от уровня модели: избыточный набор рекомендаций может «топить» слабую модель вместо того, чтобы ей помогать, а сильной модели, наоборот, нужен весь набор целиком. Это меняет саму постановку задачи для тех, кто строит агентную память: вопрос не «включить или выключить память», а «сколько её дать этой конкретной модели».

Кому это важно

Тем, кто разрабатывает или встраивает ИИ-агентов с накопительной памятью (агентные фреймворки, автономные ассистенты для многошаговых задач) и подбирает под них модель, от небольших открытых моделей вроде gpt-oss-120b до топовых проприетарных систем вроде GPT-5.5 и Opus. Также релевантно для команд, которые считают инференс-бюджет: работа прямо показывает, что более точная (curated) память может быть одновременно и дешевле, и эффективнее полной.

Как это применить

IBM Research открыла библиотеку ALTK-Evolve с пайплайном извлечения, консолидации и отбора рекомендаций и опубликовала технический отчёт с полным описанием метода и абляциями. Практический ориентир из статьи: для слабых/небольших моделей, компактное ядро надёжных правил плюс точечная подборка под конкретную задачу; для сильных моделей с запасом возможностей, полный набор рекомендаций, но с кэшированием промпта, чтобы удержать стоимость; для моделей, уже близких к потолку на своих задачах, тратить на это дополнительный контекст пока не имеет смысла.

Можно ли доверять

Это авторский технический блог IBM Research, а не независимая рецензируемая публикация, все цифры и выводы приведены со слов самих авторов. В пользу доверия, прозрачная методология: восемь моделей разного уровня, признанный отраслевой бенчмарк AppWorld с двумя метриками (TGC и более строгая SGC), обучение рекомендаций строго на тренировочном сплите без утечки тестовых данных. Авторы сами оговаривают границы своих выводов: паттерн «насыщения» называют наблюдением, а не доказанной причиной, а вопрос, что именно определяет паттерн модели (запас по бенчмарку, размер контекста, архитектура, качество рекомендаций, распределение задач), явно оставляют открытым, это скорее аккуратная научная осторожность, чем маркетинговое приукрашивание.

Риски и подводные камни

Результаты подтверждены пока только на одном бенчмарке (AppWorld), сами авторы называют проверку на других задачах и в реальных сценариях предстоящей работой. Метод отбора рекомендаций по косинусному сходству, по признанию авторов, не идеально предсказывает, какие именно рекомендации помогут в конкретной задаче, обучаемый селектор пока не готов. Для очень слабых моделей самодистилляция, по словам авторов, не даёт достаточного сигнала для обучения, им нужен отдельный подход через модель-учителя, который пока не проработан. Наконец, факторы, определяющие паттерн модели (запас по бенчмарку, контекст, архитектура), в статье не разделены и не проверены по отдельности, это предположения авторов, а не установленная причинность.

«Агентная память, это не функция, которую просто включают. Это доза, которую подбирают под конкретную модель.»

— IBM Research, блог ALTK-Evolve