HPSE учит языковые модели применять новые факты при редактировании, а не только запоминать их

HPSE учит языковые модели применять новые факты при редактировании, а не только запоминать их

Языковые модели (LLM) обучаются на статичном корпусе текстов, и со временем их знания устаревают. Это стало поводом для редактирования знаний (knowledge editing, KE), техники, которая обновляет отдельные факты внутри уже обученной модели, не меняя остальные её знания. Раньше такую правку чаще представляли в виде структурированных троек фактов, но в последних работах эту роль всё чаще берёт на себя произвольный текстовый фрагмент (passage), который может утверждать сразу несколько фактов одновременно, такое направление называют неструктурированным редактированием знаний (unstructured KE, UKE).

Проблема, которую поднимают авторы: существующие UKE-редакторы вставляют такой фрагмент в модель, но модель не умеет им пользоваться. Она способна дословно вспомнить вставленный текст, но не может ответить на атомарный вопрос, простой вопрос по одному конкретному факту из фрагмента, и тем более не может сочетать несколько фактов из него в многошаговом рассуждении (multi-hop reasoning). Авторы называют это отсутствующее свойство комбинируемостью (composability) и связывают его с тем, что существующие редакторы пассивно обучают модель по самому зафиксированному тексту фрагмента, то есть единственным источником обучения служит сам текст, а не то, как эти факты применять.

В ответ Тяньцы Лю (Tianci Liu) с соавторами предлагают метод HPSE (Hybrid-Policy Self-Editing). Идея, трактовать редактирование как самодистилляцию: у той же самой модели создают «привилегированную» версию, по сути, ту же модель, но с новым фактом прямо в подсказке (in-context), и учат отредактированную модель подражать ответам этой привилегированной версии. Внешний учитель, эталонные ответы или разметка для этого не нужны.

Авторы показывают и отдельную сложность: если обучать модель только на её же собственных сгенерированных ответах (так называемая on-policy дистилляция, обучение на генерациях самой обучаемой модели), эффект получается слабым. Вставленный факт для необученной модели новый, и он попросту редко всплывает в её собственных ответах, учить её на этом факте почти не на чем. Чтобы закрыть этот пробел, HPSE строит гибридную траекторию (hybrid rollout): там, где собственная генерация модели не касается нужных фактов, метод точечно вставляет недостающие факты прямо в эту траекторию, а в остальных местах генерация остаётся on-policy, то есть строится на собственных ответах модели.

Авторы приводят теоретическое обоснование преимущества HPSE над чистой on-policy дистилляцией и эмпирически показывают, что метод даёт «plug-and-play»-улучшения, то есть встраивается в уже существующие способы редактирования знаний без переделки под конкретный случай, на четырёх базовых языковых моделях (LLM backbones) в сочетании с двумя KE-редакторами и в разных сценариях. Конкретные числовые результаты (точность, метрики), названия использованных моделей и редакторов, полный состав авторов и их принадлежность к организациям, а также площадка и дата публикации в тексте не приводятся.

Ключевые факты

  • Существующие методы неструктурированного редактирования знаний (UKE) вставляют в языковую модель фрагмент текста с новыми фактами, но отредактированная модель способна лишь дословно вспомнить этот фрагмент, не отвечает на атомарные вопросы по отдельным фактам и не может сочетать их в многошаговом рассуждении (multi-hop reasoning). Авторы называют отсутствующее свойство комбинируемостью (composability).
  • Причина, по мнению авторов: существующие редакторы обучают модель пассивно, единственным источником обучения служит сам зафиксированный текст фрагмента, а не то, как эти факты применять.
  • Тяньцы Лю (Tianci Liu) с соавторами предлагают метод HPSE: редактирование трактуется как самодистилляция, модель учится подражать ответам своей же «привилегированной» версии, которой факт дан прямо в подсказке (in-context), без внешнего учителя и разметки.
  • Обучение только на собственных генерациях модели (on-policy дистилляция) работает слабо, потому что новый факт для необученной модели редко всплывает в её же ответах. HPSE решает это гибридной траекторией (hybrid rollout): там, где генерация модели не покрывает нужный факт, метод точечно вставляет его в эту траекторию, а в остальном генерация остаётся on-policy.
  • Авторы дают теоретическое обоснование преимущества HPSE над чистой on-policy дистилляцией и эмпирически показывают «plug-and-play»-улучшения на четырёх базовых языковых моделях в сочетании с двумя KE-редакторами в разных сценариях; конкретные цифры, названия моделей и редакторов, состав авторов и данные о публикации в тексте не приведены.

Почему это важно

Редактирование знаний, способ обновлять отдельные факты внутри уже обученной модели, не трогая остальные её знания. Но если правка учит модель лишь дословно повторять вставленный текст, а не отвечать на вопросы по отдельным фактам из него и не рассуждать на их основе, практическая польза такой правки под вопросом: факт формально «внесён», но по сути бесполезен для того, кому нужен не текст, а ответ или вывод. Комбинируемость (composability), которую вводят авторы, это именно недостающая способность применять внесённые знания, а не только хранить их. HPSE достигает этого без внешнего учителя и без разметки, то есть без необходимости готовить отдельные размеченные примеры под каждую правку.

Кому это важно

В первую очередь, исследователям и инженерам, которые занимаются редактированием знаний и непрерывным дообучением (continual learning) языковых моделей: HPSE описан как совместимый «из коробки» с уже существующими KE-редакторами, то есть применяется поверх привычных инструментов, а не взамен них. Также релевантно командам, которые поддерживают актуальность фактов в развёрнутых языковых моделях, например, в вопросно-ответных системах или агентных сценариях, где модели важно не просто помнить обновлённый факт, а действительно рассуждать на его основе.

Как это применить

HPSE, не отдельный самостоятельный редактор знаний, а надстройка поверх уже существующих KE-методов: в статье его комбинируют с двумя такими редакторами и проверяют на четырёх базовых языковых моделях (LLM backbones) в разных сценариях. Авторы описывают результат как «plug-and-play»-совместимый, то есть встраивается без переделки под конкретную модель или редактор. В тексте не упомянуто, публикуют ли авторы код или датасет для воспроизведения результатов, судя по всему, на момент публикации абстракта речь идёт об исследовательском методе, а не о готовом к использованию инструменте или репозитории.

Можно ли доверять

Источник, карточка препринта на Hugging Face Papers, 7 голосов и 2 комментария: материал свежий и пока почти не обсуждён. В доступном тексте абстракта не назван полный авторский коллектив (кроме первого автора по метаданным карточки, Тяньцы Лю, Tianci Liu, с соавторами), не указаны организации, площадка и дата публикации, а также не приведено ни одной цифры, авторы говорят об улучшениях и дают теоретическое обоснование, но результаты (точность, метрики) в тексте не названы. Это не делает метод недостоверным, но по доступному тексту заявленные улучшения нельзя оценить количественно, их стоит воспринимать как утверждение авторов препринта, ещё не прошедшее независимую проверку.

Риски и подводные камни

Главный риск метода, сама схема самодистилляции: «привилегированная» версия модели, которой факт дан прямо в контексте, может интерпретировать или применить этот факт с ошибкой, а обучение закрепит эту ошибку в отредактированной модели так же уверенно, как и верный факт, учитель и ученик здесь одна и та же модель, без внешней проверки. Результаты подтверждены только на четырёх конкретных (не названных в тексте) базовых моделях и двух KE-редакторах, насколько эффект переносится на другие архитектуры, масштабы моделей или на промышленные системы редактирования знаний, по тексту судить нельзя. Наконец, в тексте нет ни числовых результатов, ни данных о рецензировании, ни кода или датасета для воспроизведения, независимая проверка заявленных улучшений пока невозможна.