Учёные выпустили MERIT, тест долгосрочной памяти ИИ-агентов
Существующие тесты долгосрочной памяти ИИ-агентов (LoCoMo, LongMemEval) проверяют, может ли модель ответить на вопрос по истории диалога, а не то, меняют ли запомненные факты реальные действия агента, который пользуется инструментами. Авторы представили MERIT (Memory Evaluation for Realistic Instrumented Tasks), бенчмарк и тестовый стенд, который измеряет предельную пользу памяти именно для агентов, выполняющих задачи, и делает это с явным учётом затрат. MERIT даёт эпизодические задачи на работу с инструментами в трёх предметных областях; зависимость каждой задачи от фактов из более раннего эпизода проверяется автоматической проверкой на "утечку" (leak check); задачи выстроены по нарастающей сложности вплоть до вспоминания обновлённых фактов; предусмотрено управляемое повреждение памяти; и ведётся полный учёт токенов и долларов на каждую операцию с памятью.
Всего было прогнано 23 440 оценённых эпизодов общей стоимостью $42,57: сначала пилот на двух поколениях модели gpt-4.1-mini, затем заранее зарегистрированная сетка из 3 моделей x 3 случайных запусков (GPT-4.1 и Claude Haiku 4.5, при этом реализация памяти во всех прогонах сетки фиксировалась одинаковой). Память подняла успех выполнения задач, зависящих от памяти, с проверенного на утечки нуля (0,00 без памяти) до 0,55, 1,00 с памятью.
На задачах с обновлёнными фактами поиск по эмбеддингам работает непредсказуемо: успех колеблется от 0,30 до 0,95 в зависимости от модели, а разброс между случайными запусками достигает 0,45. Даже когда нужный факт найден верно, агент действует по нему лишь в 55% случаев. Хранилища с обновлением по факту записи, структурированная база фактов и, что особенно отмечают авторы, суммаризация силами самой LLM, держат результат стабильно в диапазоне 0,70, 1,00; при этом гибридный подход, сочетающий несколько способов хранения, оказался хуже, чем одна только база фактов.
Дополнительная проверка на модели последнего поколения, Claude Sonnet 5, с контролем в виде чистого полного повтора всей истории, воспроизвела ту же картину. Замена одной реализации памяти на другую двигает успех выполнения задач на величину до 60 пунктов. При этом полный повтор всей истории диалога экономически невыгоден ни при каких условиях: лучшее решение по памяти в каждой предметной области даёт в 2,7, 3,9 раза больше пользы на потраченный доллар, чем полный повтор. Авторы публикуют сам бенчмарк, тестовый стенд и все трассы прогонов в открытом доступе.
Ключевые факты
- MERIT, новый бенчмарк для долгосрочной памяти ИИ-агентов: он проверяет не точность ответов, а меняет ли память реальный успех выполнения задач, и считает стоимость каждой операции с памятью в токенах и долларах.
- На 23 440 оценённых эпизодах (общая стоимость $42,57) память подняла успех зависящих от неё задач с проверенного на утечки нуля (0,00) до 0,55, 1,00.
- На обновлённых фактах поиск по эмбеддингам нестабилен (0,30, 0,95 в зависимости от модели, разброс между запусками до 0,45), а агент действует по верно найденному факту лишь в 55% случаев.
- Хранилища с обновлением при записи, структурированная база фактов и суммаризация силами LLM, держат 0,70, 1,00; гибридный подход при этом хуже, чем одна база фактов.
- Замена реализации памяти двигает успех задач на величину до 60 пунктов, а полный повтор всей истории невыгоден: лучшее решение по памяти даёт в 2,7, 3,9 раза больше пользы на доллар.
Почему это важно
Действующие тесты долгосрочной памяти агентов (LoCoMo, LongMemEval) меряют, способна ли модель ответить на вопрос по истории диалога, это тест на память как таковую, а не на то, влияет ли она на реальные действия агента, который выполняет задачи с помощью инструментов. MERIT закрывает именно этот разрыв: он проверяет, меняет ли память поведение агента и его успех в задаче, и делает это с полным учётом стоимости каждой операции с памятью в токенах и долларах, до сих пор такого сочетания (успех задачи + явные деньги) в этой области не было.
Кому это важно
Прежде всего, командам, которые проектируют и эксплуатируют ИИ-агентов с долгосрочной памятью: им приходится выбирать между поиском по эмбеддингам, структурированной базой фактов, суммаризацией силами LLM и их гибридом, и MERIT впервые даёт для этого выбора сравнимые цифры успеха и стоимости, а не только качественные впечатления. Полезно и тем, кто оценивает бюджет на память в проде: результаты прямо переводятся в доллары и токены на операцию.
Как это применить
Для задач, где факты со временем обновляются, работа показывает: не стоит полагаться на поиск по эмбеддингам (0,30, 0,95, разброс между запусками до 0,45) и тем более на гибридную схему, она хуже, чем просто база фактов. Более надёжный выбор, хранилище, которое обновляется прямо в момент записи: структурированная база фактов или даже суммаризация силами самой LLM (обе держат 0,70, 1,00). Полный повтор всей истории диалога как способ "вспомнить всё" MERIT прямо называет экономически невыгодным ни при каких условиях: лучшее по памяти решение даёт в 2,7, 3,9 раза больше пользы на доллар, чем такой повтор.
Можно ли доверять
Методология выстроена аккуратно: зависимость задач от памяти проверяется автоматической проверкой на утечку, есть заранее зарегистрированная сетка из 3 моделей x 3 случайных запусков (GPT-4.1 и Claude Haiku 4.5, при фиксированной реализации памяти), а вывод дополнительно проверен на модели последнего поколения, Claude Sonnet 5, с контролем в виде чистого полного повтора истории. Это внутренняя проверка воспроизводимости, но авторы и их организация в доступном тексте не названы, так что независимого рецензирования результатов пока нет, выводы стоит воспринимать как отчёт самих создателей бенчмарка.
Риски и подводные камни
В доступном тексте не раскрыто, какие именно три предметные области используются и что конкретно представляют собой "лестница сложности" и "управляемое повреждение памяти", без этого трудно понять, насколько результаты переносятся на задачи за пределами теста. Кроме того, в сетке из 3 моделей x 3 запусков реализация памяти была одинаковой для всех моделей, то есть это сравнение моделей при фиксированной памяти, а не памяти между собой; сравнение разных реализаций памяти (база фактов, эмбеддинги, суммаризация, гибрид), отдельная часть работы. Наконец, авторы не уточняют, где и когда именно станут доступны бенчмарк, стенд и трассы прогонов, сказано только, что они будут выложены в открытый доступ.