RENDER: формат подачи диалога определяет результат оценки памяти ИИ
Исследователи представили RENDER, контрольный метод для оценки моделей ИИ с долговременной памятью и поиском по документам (RAG, retrieval-augmented generation). Идея в том, чтобы зафиксировать сам диалог, который модель должна вспомнить и на основе которого ответить, но менять формат, в котором этот диалог попадает ей на вход: как запись памяти в стиле ChatGPT, как сводка в духе LangChain, как типизированная запись в духе MemGPT или как сырой фрагмент переписки без обработки.
Метод сочетает пятиуровневую «лестницу пакетов», которая указывает, на каком этапе входного текста появляется информация, нужная для ответа, с детерминированными шаблонами для перечисленных четырёх форматов. Проверку провели на 500 вопросах из набора LongMemEval и девяти моделях.
Результаты: пакеты с уже «разрешённой» (resolved) нужной информацией при равном бюджете токенов обходят сырой диалог, обрезанный по свежести, на 42,4, 72,6 балла. Среди форматов, приближённых к реальным продуктам, разброс между лучшим и худшим вариантом составил 24,6, 48,8 балла на модель. По основной метрике оценки записи в стиле ChatGPT дали более высокие баллы, чем тот же диалог в сыром виде, у 7 из 9 моделей. Три модели, набравшие 0% точности на формальных «журнальных» пакетах, отвечали на те же факты из записей на естественном языке с точностью 45,4, 53,4%.
Повторная оценка судьёй-моделью сохраняет положительный эффект в среднем по всем моделям, но для отдельных моделей статистическая значимость результатов неоднородна. Эффект сохраняется и при добавлении шума в поиск, а также переносится на другой набор данных, HotpotQA. Вывод авторов: оценки памяти и RAG должны либо сообщать, в каком формате история подаётся модели-читателю, либо явно контролировать этот формат как переменную эксперимента.
Ключевые факты
- RENDER фиксирует сам диалог и варьирует только формат его подачи модели: запись в стиле ChatGPT, сводка LangChain, типизированная запись MemGPT или сырой текст.
- На 500 вопросах LongMemEval и 9 моделях формат подачи менял точность на 42,4, 72,6 балла между разрешённым пакетом и сырым обрезанным диалогом.
- У 7 из 9 моделей записи в стиле ChatGPT дали более высокую точность по основной метрике, чем тот же диалог в сыром виде.
- Три модели с 0% точности на формальных «журнальных» пакетах отвечали на те же факты из естественно-языковых записей с точностью 45,4, 53,4%.
- Эффект сохраняется при шуме в поиске и переносится на другой бенчмарк, HotpotQA.
Почему это важно
Оценки памяти и RAG обычно считают то, в каком виде системе показывают историю диалога, технической деталью, не влияющей на результат. RENDER показывает обратное: при абсолютно одном и том же диалоге разница между форматами его подачи (сырой текст против структурированной записи) сдвигает точность модели на десятки баллов, то есть значительная часть измеряемой «памяти» модели на деле измеряет удобство формата, а не саму способность вспоминать факты.
Кому это важно
Разработчикам систем с долговременной памятью и RAG-агентов, которые проектируют, в каком виде хранить и подавать модели историю диалога; авторам и пользователям бенчмарков памяти LLM, которым нужно понимать, что сравнение моделей может быть искажено выбором формата; командам, которые сравнивают модели друг с другом по способности «помнить», без контроля формата такое сравнение может быть некорректным.
Как это применить
Авторы предлагают простое практическое правило: любая оценка памяти или RAG должна либо явно указывать, в каком формате история подаётся модели-читателю, либо тестировать несколько форматов и контролировать этот параметр как отдельную переменную. На практике это значит: при выборе формата хранения памяти для продукта стоит проверять несколько вариантов (сырой лог, сводка, структурированная запись), а не полагаться на то, что формат не важен, разница в 42,4, 72,6 балла показывает, что важен, причём сильно.
Можно ли доверять
Фактура опирается на аннотацию статьи, источник читается как полноценный текст, методология описана достаточно подробно (пятиуровневая лестница пакетов, четыре шаблона, 500 вопросов, девять моделей), а результат проверен дополнительно повторной оценкой судьёй-моделью и переносом на другой бенчмарк (HotpotQA), что снижает риск случайной находки. При этом в самой аннотации не названы ни авторы, ни организация, ни место публикации, судить о рецензировании и авторстве по одному тексту нельзя.
Риски и подводные камни
Главный риск, использование этого эффекта не по назначению: выбор «удобного» формата подачи истории может искусственно завышать заявленную точность модели или продукта без реального улучшения памяти. Кроме того, в аннотации не раскрыто, чем именно отличаются друг от друга четыре шаблона на уровне конкретного текста и что именно измеряет «основной скорер» в отличие от повторной оценки судьёй, это ограничивает возможность независимо повторить и проверить конкретные цифры без обращения к полному тексту статьи.