Meta AI создала ИИ-агента-«тренера памяти» для других агентов

Meta AI создала ИИ-агента-«тренера памяти» для других агентов

Meta AI опубликовала статью о проблеме, которую исследователи назвали «распадом поведенческого состояния» (behavioral state decay): во время долгих задач ИИ-агент теряет из виду информацию, которая должна направлять его действия. Агент замечает ограничение в начале задачи, но позже нарушает его, исправляя не связанную с этим ошибку; видит, что команда не сработала, и вскоре пробует почти такую же; диагностирует паттерн ошибки, а потом принимает тот же паттерн за новый. Причина в том, что нужная информация теряется в разрастающейся истории задачи, уходит в глубину контекстного окна или вовсе выпадает из него, а иногда остаётся в тексте, но перестаёт влиять на поведение агента. По словам Meta AI, простое увеличение доступной истории эту проблему не решает.

Существующие системы памяти хорошо справляются с хранением, обновлением и извлечением информации между сессиями, например, для персонализации. Но во время выполнения одной длинной задачи стоит другой вопрос: когда именно напомнить агенту о сохранённой информации. Слишком редкие напоминания, агент повторяет ошибки; слишком частые, растут задержка и расход токенов, а агент отвлекается от текущей работы. Авторы подчёркивают: это не задача суммаризации, суммаризатор решает, что сохранить, а система Meta решает, должно ли уже сохранённое состояние повлиять на следующий шаг агента. Поскольку сбои сильно различаются от задачи к задаче, фиксированное правило суммаризации с этим не справляется.

Предложенная архитектура, пара из немодифицированного «агента-исполнителя» и отдельного «агента памяти». Через фиксированные интервалы агент памяти просматривает скользящее окно последних шагов и обновляет структурированный банк памяти, а затем решает: добавить исполнителю короткое напоминание к следующему вызову или промолчать. По заявлению авторов, модуль встраивается в существующих агентов и оболочки как готовый компонент; в отличие от универсального советника, он даёт только напоминания на основе памяти, но не стратегические советы. Банк памяти состоит из трёх разделов: приватное поле статуса (отслеживает прогресс и риски, исполнителю не показывается), «Память знаний» (устойчивые факты, требования, пути к файлам, конфигурации) и «Процедурная память» (что агент уже пробовал и что получилось: неудачные команды, успешные исправления, отвергнутые гипотезы). Обновлять банк агент памяти может только через заранее заданные вызовы инструментов, а не свободной перезаписью; молчание, тоже часть политики.

Систему проверили на двух бенчмарках. Terminal-Bench 2.0 оценивает автономных агентов в реалистичной командной строке; tau2-Bench, диалоговое использование инструментов в авиаперевозках, ритейле и телекоме. В экспериментах Claude Opus 4.6 выступал агентом памяти, Claude Sonnet 4.5 (более старая модель), агентом-исполнителем: доля задач Terminal-Bench, решённых с первой попытки, выросла с базовых 38% до 46%; средневзвешенный по задачам показатель tau2-Bench, с 55% до 62%. Результаты по доменам разошлись: в авиаперевозках и ритейле рост составил около 10 процентных пунктов в каждом, а в телекоме, только 3 пункта; исследователи связывают это с тем, что агент памяти вмешивается с разной частотой в зависимости от задачи, а не по единому агрегирующему правилу. Когда агентом-исполнителем стала более сильная модель, сам Claude Opus 4.6, прирост оказался меньше, но не исчез: +2,4 процентных пункта на Terminal-Bench и +2,5 пункта на tau2-Bench: по мнению авторов, это значит, что система памяти делает больше, чем просто компенсирует ограниченные возможности слабой модели.

Последовательное удаление отдельных возможностей показало, что именно даёт прирост. Если агенту-исполнителю на каждом шаге передавали весь банк памяти целиком, результат падал ниже полной системы; версия без опции «молчать», выдающая напоминание на каждом шаге, оставалась конкурентоспособной, но давала менее стабильные результаты по доменам; версия-советник без постоянного банка памяти где-то помогала, а где-то ухудшала результат. Полная схема, постоянный банк памяти плюс выборочные напоминания, показала лучший результат из всех и превзошла Mem0, промышленный слой памяти, который извлекает записи через поиск: разница не только в том, какие записи извлекаются, но и в том, что агент памяти сам решает, должно ли и как сохранённое состояние войти в цикл как целевое напоминание. Иллюстрация из домена «Airline» tau2-Bench: пользователь заявил о статусе Gold, но инструмент определил его как обычного клиента; базовая версия предоставила компенсацию на основании заявления пользователя, а агент памяти вместо этого выдал напоминание опираться на проверенные данные инструмента. Большинство оставшихся ошибок связаны не с памятью, а с калибровкой, например, агент памяти иногда придавал спекулятивному выводу слишком высокую уверенность.

Основная версия системы не требует специально обученной модели и работает как промптируемый агент. Команда также проверила, можно ли обучить политике вмешательства открытую модель меньшего размера: обучаемым агентом памяти стала Qwen3.5-27B при замороженной, значительно более крупной модели-исполнителе. Без обучения меньшая модель памяти снижала результат; дообучение с учителем (SFT) устраняло эту потерю, а последующее обучение с подкреплением улучшало решения о том, когда возвращать сохранённое состояние. Среди открытых вопросов, которые перечисляет Meta AI: совместное обучение агентов памяти и исполнителя, обучение системы вызывать память по мере необходимости вместо фиксированного расписания, и когда буквальные воспоминания работают лучше специфичных для задачи обобщений (обобщений под конкретную задачу). Meta AI опубликовала код проекта на GitHub. Подобную проблему решают и другие: открытая платформа Mastra использует два фоновых агента, которые следят за диалогом и сжимают его вместо хранения полной истории в контекстном окне; система GAM нацелена на борьбу с «эрозией контекста» в длинных диалогах и, как и подход Meta, сравнивает результаты с тем же слоем памяти Mem0.

Ключевые факты

  • Meta AI описала «распад поведенческого состояния», во время долгих задач ИИ-агент теряет из виду ограничения и уже найденные ошибки, а простое расширение контекстного окна проблему не решает
  • Предложена архитектура из двух агентов: немодифицированный «агент-исполнитель» плюс отдельный «агент памяти», который периодически проверяет ход задачи и решает, выдать короткое напоминание или промолчать
  • На Terminal-Bench 2.0 с Claude Sonnet 4.5 в роли исполнителя доля решённых с первой попытки задач выросла с 38% до 46%; на tau2-Bench средневзвешенный показатель, с 55% до 62%, при этом в авиаперевозках и ритейле рост около 10 п.п., в телекоме, только 3 п.п.
  • С более сильным исполнителем Claude Opus 4.6 прирост меньше, но сохраняется: +2,4 п.п. на Terminal-Bench и +2,5 п.п. на tau2-Bench
  • Подход превзошёл промышленный слой памяти Mem0; малую открытую модель Qwen3.5-27B в роли агента памяти пришлось дополнительно дообучать (SFT и RL), без этого она снижала результат; код опубликован на GitHub

Почему это важно

Долгие автономные задачи, многошаговая отладка кода, работа в командной строке, диалоги с несколькими инструментами, регулярно спотыкаются об одну и ту же проблему: агент теряет из виду то, что уже узнал. Он может заново наступить на грабли, которые сам же диагностировал парой шагов раньше, или нарушить ограничение, о котором помнил в начале задачи. Meta AI показывает, что причина не в размере контекстного окна, просто давать агенту больше истории не помогает, потому что важная информация тонет в потоке шагов или перестаёт влиять на решения, даже оставаясь технически доступной. Это смещает фокус с вопроса «как хранить память» на вопрос «когда её напомнить», и отделяет эту задачу от обычной суммаризации диалога.

Кому это важно

Разработчикам агентных систем и оболочек для длинных автономных задач, кодовых агентов, ассистентов поддержки, инструментов с многошаговым использованием API, где ошибки из-за забытого контекста напрямую бьют по надёжности. Тем, кто уже использует промышленные слои памяти вроде Mem0 и хочет понять их ограничения. Исследователям, которые работают над архитектурами долгосрочной памяти и context rot (деградацией качества работы модели при разрастании контекста) в длинных диалогах, над похожей проблемой работают и другие независимые проекты (Mastra, GAM).

Как это применить

Модуль заявлен как готовый к встраиванию (plug-and-play): исходного агента-исполнителя менять не нужно, добавляется отдельный агент памяти, работающий на промптах, без специального обучения. Meta AI опубликовала код проекта на GitHub, что позволяет воспроизвести и протестировать подход на своих задачах. Если вместо мощной модели (в экспериментах, Claude Opus 4.6) хочется использовать более компактную открытую модель в роли агента памяти, потребуется дополнительное дообучение: без него меньшая модель, наоборот, снижала результат, а с дообучением с учителем и обучением с подкреплением, восстанавливала и улучшала качество решений о напоминаниях.

Можно ли доверять

Это статья исследователей Meta AI с прозрачной методологией: два независимых бенчмарка (Terminal-Bench 2.0 и tau2-Bench по трём доменам), сравнение с базовой версией без агента памяти и с внешним продуктовым решением Mem0, а также абляционные эксперименты, поочерёдное отключение отдельных возможностей системы показывает, какая часть архитектуры даёт эффект. Код выложен в открытый доступ для проверки. Из ограничений: в тексте нет ни даты публикации статьи, ни имён авторов, ни абсолютного числового результата Mem0 (только то, что подход Meta его превзошёл); прирост для уже сильной модели Opus 4.6 заметно скромнее (+2,4, 2,5 п.п.), чем для более слабой Sonnet 4.5, то есть выгода системы уменьшается по мере роста возможностей базовой модели.

Риски и подводные камни

Эффект неравномерен по доменам, в телекоме прирост всего 3 процентных пункта против примерно 10 в авиаперевозках и ритейле, и сами исследователи признают, что фиксированного правила, объясняющего эту разницу, у них нет. Большинство оставшихся ошибок системы связаны не с памятью, а с калибровкой уверенности: агент памяти иногда придаёт спекулятивному выводу слишком высокий вес. Открытые модели меньшего размера без дополнительного обучения справляются с ролью агента памяти хуже, чем вообще без такого агента, то есть выигрыш не гарантирован «из коробки» на любой модели. Наконец, сама Meta AI перечисляет нерешённые вопросы: совместное обучение агента памяти и агента-исполнителя, переход от фиксированного расписания проверок к вызову по необходимости и выбор между буквальными воспоминаниями и обобщёнными абстракциями, то есть архитектура ещё не финализирована.

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.