IAR, метод, который встраивает знания документов в нейросеть без поиска

IAR, метод, который встраивает знания документов в нейросеть без поиска

Языковые модели часто не могут ответить на вопросы по фиксированному набору документов, если во время генерации ответа эти документы не подгружаются через поиск. Обычно эту задачу решают через поиск релевантных фрагментов документов и подстановку их в запрос модели. Исследователи предложили альтернативу: способ встроить знания документов прямо в веса модели, чтобы она отвечала на вопросы по корпусу вообще без обращения к поиску, это направление они называют «усвоением знаний документов» (document knowledge internalization).

Метод называется IAR (Inject, Align, Recover, «внедрить, выровнять, восстановить») и состоит из трёх последовательных этапов дообучения поверх готовой инструктивной модели. На этапе Inject модель обучают не классическим продолжением текста, как при обычном continued pretraining, а на задачах продолжения, переписывания и восстановления текста по инструкции, сформированных из исходных документов. На этапе Align модель дообучают только на парах «вопрос-ответ» по содержанию документов (answer-only supervision), чтобы она отвечала в нужном формате. На этапе Recover доменную модель объединяют (merge) с исходной инструктивной моделью, чтобы вернуть общие способности, которые обычно теряются при узком дообучении на одном корпусе.

Метод проверили на двух наборах документов, Common Corpus (CC) и CCI, и на моделях семейств Llama, Phi, Qwen и SmolLM. В основном сравнении IAR обошёл обычный SFT (supervised fine-tuning) по всем четырём отслеживаемым метрикам в 7 из 8 сочетаний «датасет + модель», со средним приростом 3,6 процентного пункта в точности ответов по домену и 12,1 процентного пункта в среднем результате по трём общим бенчмаркам, IFEval, MMLU и MSBench. В расширенном сравнении на Common Corpus отдельные базовые методы, LoRA и FAPM, обгоняли IAR по отдельным метрикам общих способностей, но среди методов, которые также показывают лидирующую или близкую к лидирующей степень усвоения знаний домена, у IAR оказался один из самых сильных профилей по общим способностям.

Ключевые факты

  • Проблема: языковые модели плохо отвечают по фиксированному набору документов, если во время ответа эти документы не подгружаются поиском.
  • IAR (Inject, Align, Recover), трёхэтапный пост-тренинг: внедрение знаний документов через задачи продолжения/переписывания/реконструкции, выравнивание на парах «вопрос-ответ», слияние с исходной инструктивной моделью для восстановления общих способностей.
  • На 7 из 8 сочетаний «датасет + модель» IAR превзошёл обычный SFT по всем четырём метрикам сразу: +3,6 п.п. точности по домену и +12,1 п.п. по общим бенчмаркам (IFEval, MMLU, MSBench) в среднем.
  • Метод проверен на двух корпусах (Common Corpus, CCI) и четырёх семействах моделей (Llama, Phi, Qwen, SmolLM).
  • На расширенном сравнении отдельные методы LoRA и FAPM обгоняли IAR по отдельным метрикам общих способностей, хотя в целом уступали ему по совокупности «домен + общие способности».

Почему это важно

Чтобы модель отвечала по закрытому набору документов, например, по внутренней базе знаний компании, обычно используют поиск релевантных фрагментов и подстановку их в запрос модели. У этого подхода есть инфраструктурные издержки: нужен отдельный поисковый индекс, а сам поиск на каждый запрос добавляет задержку. Альтернатива, дообучить модель так, чтобы знания корпуса стали частью её весов, и отвечать вообще без поиска. Проблема в том, что классическое дообучение на узком корпусе (continued pretraining) обычно портит общие способности модели: она хуже следует инструкциям и хуже отвечает на вопросы вне своего домена. IAR, попытка получить оба свойства сразу: и знание конкретного корпуса, и сохранённые общие способности.

Кому это важно

Разработчикам, которые строят ИИ-ассистентов поверх закрытого корпуса документов и хотели бы обойтись без отдельной инфраструктуры для поиска. Инженерам, занимающимся дообучением открытых моделей, в статье использованы семейства Llama, Phi, Qwen и SmolLM, под конкретные корпуса документов. Исследователям, которые работают над методами пост-тренинга и слияния моделей (model merging).

Как это применить

IAR, рецепт из трёх последовательных этапов дообучения поверх готовой инструктивной модели. Inject: модель обучают на задачах продолжения, переписывания и восстановления текста по инструкции, сформированных из исходных документов, вместо обычного continued pretraining. Align: модель дообучают только на парах «вопрос-ответ» по содержанию документов (answer-only supervision), чтобы она отвечала в нужном формате. Recover: получившуюся доменную модель объединяют (merge) с исходной инструктивной моделью, чтобы вернуть общие способности. По утверждению авторов, такое сочетание улучшает баланс между точностью по домену и сохранением общих способностей по сравнению с обычным SFT.

Можно ли доверять

Материал, препринт на HuggingFace Papers; в самом тексте не указаны ни авторы, ни организация-разработчик, ни площадка и дата публикации. Метод проверен на двух отдельных корпусах и четырёх семействах моделей, что расширяет охват сравнения, но приведённые числа, это относительные приросты над бейзлайном, а не независимо проверяемые абсолютные показатели. Публикация пока набрала немного внимания, 10 баллов и 2 комментария на момент сбора данных. О выходе кода или готовых моделей в тексте ничего не сказано, так что независимо воспроизвести результаты по одному описанию нельзя.

Риски и подводные камни

В тексте приведены только относительные приросты (в процентных пунктах) над бейзлайном Vanilla SFT, абсолютные значения точности не публикуются, поэтому оценить итоговое качество модели в абсолютных числах не получится. В одном из 8 сочетаний «датасет + модель» метод не улучшил все четыре метрики сразу, но какое именно это сочетание, не уточняется. На расширенном сравнении на Common Corpus отдельные методы, LoRA и FAPM, обгоняли IAR по отдельным метрикам общих способностей: IAR не лидирует по каждому показателю в отдельности, а даёт сильный профиль в среднем по совокупности метрик.