SIMGUIDE обошёл RAG в персонализации ИИ-агентов на GPT-4o и Claude Sonnet 4.5
Персонализированные ИИ-агенты почти всегда представляют пользователя одной плоской анкетой, склеенной в промпт. Это не работает, когда у одного человека в разных сферах жизни разные приоритеты, и ломается совсем, если эти приоритеты противоречат друг другу. По утверждению авторов работы, проблема не в нехватке информации о пользователе, а в формате её представления: именно формат определяет, способен ли агент вообще воспользоваться этой информацией в конкретной ситуации.
Авторы предлагают метод SIMGUIDE: контекст пользователя разбивается на типизированные, привязанные к конкретной сфере блоки (в тексте они называются Sim-блоками), и каждое ограничение внутри блока подкрепляется процедурными примерами, конкретными случаями из прошлых решений пользователя, а не просто декларативным описанием предпочтения. Отдельно авторы построили диагностический тест SIMBENCH из 47 задач планирования с учётом предпочтений, где правильный план зависит от того, какой именно пользовательский контекст сейчас активен, по их словам, ни один существующий тест такое свойство не проверяет.
Ключевой результат: сами по себе декларативные ограничения в Sim-блоках персонализацию через поиск по базе примеров (RAG, retrieval-augmented generation) не превосходят. Превосходство даёт именно процедурное обоснование, привязка ограничений к конкретным примерам прошлых решений. На модели GPT-4o такие процедурно обоснованные Sim-блоки обошли RAG на 7,9 балла по метрике соответствия предпочтениям (Preference Adherence), разница статистически значима (p = 0,013). То же преимущество воспроизвелось на 100 задачах теста τ-bench сразу на двух моделях, GPT-4o и Claude Sonnet 4.5 (p ≤ 0,023 для обеих).
Авторы проверили тот же принцип и на уровне дообучения модели. Точечное LoRA-дообучение под конкретную задачу повышает качество генерации на 12,8 балла по метрике ROUGE-L относительно недообученной базовой модели. Если же адаптеры маршрутизировать не по личности пользователя, а по типу Sim-блока, качество растёт ещё на 7,3 балла сверх этого, и прирост сохраняется даже при 28% ошибок маршрутизации.
Общий вывод авторов: именно формат представления пользовательского контекста, а не его содержание, оказывается определяющей переменной для того, работает персонализация или нет.
Ключевые факты
- SIMGUIDE структурирует контекст пользователя в типизированные Sim-блоки по сферам жизни и подкрепляет каждое ограничение примерами из прошлых решений, а не просто описанием предпочтения
- Диагностический тест SIMBENCH из 47 задач проверяет, меняется ли правильный план в зависимости от того, какой пользовательский контекст активен
- Одни декларативные Sim-ограничения RAG не превосходят, выигрывает именно процедурное обоснование: +7,9 балла Preference Adherence на GPT-4o (p = 0,013)
- Преимущество подтвердилось на 100 задачах τ-bench на GPT-4o и Claude Sonnet 4.5 (p ≤ 0,023)
- На уровне дообучения: task-matched LoRA даёт +12,8 балла ROUGE-L, а маршрутизация адаптеров по типу Sim-блока, ещё +7,3 балла, устойчиво при 28% ошибок маршрутизации
Почему это важно
Большинство персонализированных агентов хранят пользователя как одну плоскую анкету в промпте. Если у человека в разных сферах жизни разные и порой противоречивые приоритеты, такой формат не даёт агенту понять, какой приоритет сейчас действует. Авторы формулируют это прямо: проблема не в нехватке данных о пользователе, а в том, что формат представления определяет, может ли агент вообще применить эти данные. SIMGUIDE предлагает конкретное решение, типизированные блоки контекста, обоснованные примерами реальных прошлых решений, а не абстрактными формулировками предпочтений.
Кому это важно
Прежде всего, разработчикам персонализированных ИИ-агентов и ассистентов, которые сейчас полагаются на плоские профили пользователей или на RAG-подстановку релевантных фрагментов. Также результаты касаются команд, которые дообучают модели под конкретных пользователей или сценарии через LoRA-адаптеры: авторы показывают, что то, по какому принципу маршрутизировать адаптеры, влияет на качество не меньше, чем сам факт дообучения.
Как это применить
Вместо единого профиля пользователя стоит разбивать контекст на типизированные блоки по сферам (работа, здоровье, финансы и так далее) и подкреплять каждое ограничение внутри блока конкретными примерами прошлых решений пользователя в этой сфере, просто описать предпочтение словами недостаточно, преимущество даёт именно процедурная привязка к примерам. При дообучении под конкретные задачи авторы советуют маршрутизировать адаптеры по типу такого блока контекста, а не по личности пользователя, это дополнительно повышает качество и остаётся устойчивым даже при заметной доле ошибок маршрутизации.
Можно ли доверять
Это препринт на arXiv, в исходном тексте не указаны ни авторы, ни организация, поэтому судить о репутации команды по самому материалу нельзя. Метод проверен на двух независимых тестах, собственном диагностическом SIMBENCH из 47 задач и стороннем τ-bench (100 задач), и на двух разных моделях, GPT-4o и Claude Sonnet 4.5, с указанием статистической значимости различий (p = 0,013 и p ≤ 0,023). При этом источник приводит только разницу в баллах между подходами, а не абсолютные показатели Preference Adherence для RAG и для Sim-блоков, оценить итоговый уровень качества по самому тексту нельзя.
Риски и подводные камни
SIMBENCH, тест, который авторы построили сами под собственный метод, а не независимый бенчмарк; τ-bench частично компенсирует это, но не полностью. В источнике нет абсолютных цифр Preference Adherence, только точечные разницы, поэтому нельзя понять, насколько хороша персонализация в целом, а не только относительно RAG. Нет данных о том, что декларативные Sim-блоки без процедурного обоснования дают преимущество вообще, сама структура блоков без примеров из прошлых решений RAG не превосходит. Также в тексте нет ни архитектурных деталей SIMGUIDE сверх общего описания, ни сроков публикации кода или открытия метода, воспроизводимость результата пока проверить не на чем.