Бенчмарк InMind выявил слепое пятно в памяти ИИ-агентов

Долговременная память ИИ-агентов работает по простому принципу: система сохраняет то, что сказал пользователь, а затем достаёт это при похожем запросе. Но этот принцип ломается там, где связь между фактом и вопросом неочевидна текстуально, а требует общих знаний о мире. Пример из статьи: если пользователь упомянул аллергию на орехи, а позже спрашивает про макарон, система памяти должна связать эти два факта через состав макарон, в них есть миндальная мука. Но текстово запрос про десерт и факт про аллергию на орехи никак не пересекаются, и обычный поиск по сходству текста эту связь не увидит. Авторы называют это явление «слепым пятном неявных ассоциаций» (implicit-association blind spot).
Чтобы измерить масштаб проблемы, Ruizhe Li с соавторами создали бенчмарк InMind, 125 задач, проверенных экспертами, охватывающих десять сфер жизни; 113 из 125 задач опираются на факты, которые можно проверить по цитируемым открытым источникам. Особенность бенчмарка, парные контрольные условия, которые разделяют три разные причины провала, которые обычно смешивают в одну: факт вообще не был сохранён в памяти; у модели нет фоновых знаний, чтобы связать факт с запросом; или факт был сохранён, но система его просто не нашла и не подняла на поверхность при ответе.
Результат оказался однозначным. Когда нужный факт помещают прямо в контекст модели (без необходимости его искать), базовая модель отвечает правильно на 84,0% косвенных запросов. Но когда тот же факт нужно сначала найти системой памяти, шесть протестированных систем, векторные, графовые и агентные, дают правильный ответ максимум в 14,4% случаев. При этом сами факты эти системы могут достать по прямому запросу почти безупречно, вплоть до 100% случаев, то есть факт физически лежит в памяти и легко извлекается, если спросить напрямую, но не всплывает, когда связь с запросом неявная.
Авторы проверили, помогает ли увеличение эмбеддингов: восьмикратное увеличение размерности векторного представления действительно немного повышает долю нужных фактов, которые система вообще извлекает, но разрыв в качестве ответов при этом почти не сокращается для всех шести систем. Зато простой диагностический приём, держать релевантную память видимой ещё до того, как поступил сам запрос, закрывает большую часть разрыва. Это указывает, что проблема сидит не в самих фактах и не в качестве поиска по сходству, а в самом интерфейсе «запрос → извлечение»: система решает, что показывать, только отталкиваясь от текста запроса, и не может заранее понять, какие сохранённые факты вообще могут понадобиться. Авторы называют это открытой задачей маршрутизации (routing), определения того, какие факты должны оставаться «на виду» независимо от формулировки запроса, и именно для оценки прогресса в её решении построен InMind.
Ключевые факты
- Бенчмарк InMind (125 задач, 10 сфер жизни, 113 задач проверяемы по открытым источникам) измеряет, находят ли системы памяти ИИ-агентов факты, связанные с запросом неявно, через общие знания, а не текстовое сходство
- Парные контрольные условия разделяют три причины провала: факт не сохранён, у модели нет фоновых знаний для связки, или факт сохранён, но не найден
- С фактом прямо в контексте модель отвечает верно в 84,0% случаев; когда факт нужно найти через систему памяти, шесть протестированных систем (векторные, графовые, агентные) дают верный ответ максимум в 14,4% случаев
- Те же системы находят нужные факты по прямому запросу почти безупречно, вплоть до 100%, то есть проблема не в хранении, а в извлечении при неявной связи
- Восьмикратное увеличение размерности эмбеддингов почти не сокращает разрыв; держать память видимой до поступления запроса закрывает большую часть разрыва, авторы указывают на маршрутизацию (выбор, какие факты держать «на виду») как на открытую задачу
Почему это важно
Работа показывает, что провал систем памяти ИИ-агентов на неявных связях, не редкий частный баг, а системная дыра в самой архитектуре «поиск по сходству запроса». Разрыв между 84,0% (факт под рукой) и максимум 14,4% (факт нужно найти) у шести разных типов систем показывает, что проблема не в конкретной реализации, а в самом принципе, на котором строится извлечение памяти.
Кому это важно
Разработчикам систем долговременной памяти для ИИ-агентов (векторных, графовых, агентных), командам, которые строят персональных ассистентов и агентов с памятью о пользователе, а также исследователям, изучающим retrieval и рассуждения на основе знаний о мире.
Как это применить
Разработчикам стоит тестировать retrieval-системы не только на прямом воспроизведении фактов по запросу, но и на косвенных запросах, требующих фоновых знаний, именно для этого и создан InMind. Простое увеличение размерности эмбеддингов проблему не решает; перспективнее выглядят механизмы, которые заранее решают, какие сохранённые факты держать доступными независимо от формулировки будущего запроса.
Можно ли доверять
Бенчмарк построен с экспертной проверкой задач и парными контрольными условиями, которые методично разделяют три разные причины провала, что снижает риск смешать разные проблемы в одну оценку; 113 из 125 задач опираются на проверяемые открытые источники. Насколько выводы обобщаются за пределы протестированных шести систем и десяти выбранных сфер жизни, покажут дальнейшие независимые проверки.
Риски и подводные камни
Если продукты с долговременной памятью (личные ассистенты, агенты поддержки) устроены по тому же принципу «поиск по сходству запроса», они рискуют пропускать критически важные факты о пользователе именно тогда, когда связь с запросом неочевидна, как в примере с аллергией и рецептом. Исследование охватывает лишь десять сфер жизни и шесть систем памяти, поэтому масштаб проблемы в других доменах и архитектурах остаётся открытым вопросом.