Moir защищает математику и код нейросетей при редактировании знаний
Редактирование знаний, способ точечно исправить факты в уже обученной языковой модели без полного переобучения: например, заменить устаревшую дату или имя. Но у существующих ковариационных редакторов есть системный побочный эффект: после правок сильнее всего страдают математические и программистские способности модели, тогда как энциклопедические знания остаются почти не тронуты. Авторы называют это асимметричной деградацией и связывают её с несоответствием распределений.
Ковариационные редакторы, к которым относятся MEMIT и AlphaEdit, вносят новый факт так, чтобы минимально задеть остальные знания модели, для этого они опираются на ковариационную матрицу, построенную по референсному корпусу текстов. Проблема в том, что любой статичный внешний корпус, хоть Википедия, хоть исходная выборка для предобучения самой модели, не отражает рабочее распределение ответов, которое смещается после дополнительного обучения на инструкциях и человеческих предпочтениях (SFT и DPO). Матрица, построенная на «чужом» тексте, не покрывает те области внутренних представлений, которые модель реально использует для рассуждений, отсюда и просадка в математике и коде.
Авторы предлагают Moir, метод, который строит ковариационную матрицу сохранения не по внешнему корпусу, а по образцам, которые генерирует сама редактируемая модель. Хитрость, в затравке: генерацию запускают не с обычного вопроса, а со случайного токена из словаря модели. Это обходит шаблонные, «инструктивные» ответы, которые иначе доминируют в выдаче, и раскрывает более широкий набор внутренних представлений, накопленных моделью. Moir не требует никаких внешних данных и подключается как готовый компонент к любому ковариационному редактору, что особенно ценно, поскольку обучающие корпусы большинства современных языковых моделей закрыты и недоступны публично.
Метод проверили на моделях с 7, 8 млрд параметров, OLMo-2, Llama-3.1 и Qwen-3, поверх обоих редакторов (MEMIT и AlphaEdit), в пакетном и последовательном режимах правок. Moir стабильно расширяет сохранность знаний именно в самых уязвимых областях. Наиболее показательный результат, на Qwen3-8B после 20 000 пакетных правок AlphaEdit модель с Moir сохраняет 79,9% точности на математическом тесте GSM8K, тогда как при использовании Википедии как референса точность падает до 10,9%.
Вывод авторов: чтобы редактирование знаний не разрушало способности модели, ковариацию сохранения нужно строить не по внешнему тексту, а по рабочему распределению самой модели, а для уже развёрнутых в продакшене систем сама модель может быть самым доступным источником этого распределения.
Ключевые факты
- Редактирование знаний, точечная правка фактов в обученной модели без полного переобучения, но существующие ковариационные редакторы (MEMIT, AlphaEdit) после правок сильно роняют математические и программистские способности модели, почти не трогая энциклопедические знания.
- Причина, несоответствие распределений: ковариационная матрица сохранения строится по внешнему референсному корпусу (Википедия или исходный корпус предобучения), а он не отражает рабочее распределение модели, сместившееся после дообучения на инструкциях и предпочтениях (SFT/DPO).
- Метод Moir строит эту матрицу прямо по собственным ответам модели, запуская генерацию со случайного токена словаря, это обходит шаблонные инструктивные ответы и раскрывает более широкие внутренние представления модели.
- Moir не требует внешних данных и работает как готовый компонент поверх любого ковариационного редактора, что важно, поскольку обучающие корпусы большинства современных языковых моделей закрыты.
- На Qwen3-8B после 20 000 пакетных правок AlphaEdit точность на GSM8K с Moir, 79,9% против 10,9% при использовании Википедии как референса; метод проверен также на OLMo-2 и Llama-3.1 (7, 8 млрд параметров).
Почему это важно
Редактирование знаний позиционируется как дешёвая альтернатива полному переобучению модели: обновить один факт вместо того, чтобы заново прогонять весь цикл предобучения и постобучения. Но если каждая такая правка исподволь роняет способность модели решать математику и писать код, метод непригоден для продакшена, а именно это исследователи наблюдали у существующих ковариационных редакторов. Moir устраняет корень проблемы, несоответствие между референтным корпусом редактора и реальным рабочим распределением модели, а не просто маскирует симптом.
Кому это важно
В первую очередь, командам, которые поддерживают уже развёрнутые языковые модели в продакшене и должны оперативно обновлять факты (даты, имена, статусы) без дорогого полного переобучения: инженерам ML-инфраструктуры и исследователям методов редактирования знаний. Также это важно для тех, у кого нет доступа к исходным обучающим корпусам модели, а таких большинство, поскольку Moir не требует внешних данных.
Как это применить
Moir, не отдельный редактор, а замена одного компонента внутри существующих ковариационных редакторов вроде MEMIT и AlphaEdit: вместо того чтобы строить ковариационную матрицу сохранения по внешнему тексту, Moir строит её по образцам, которые генерирует сама редактируемая модель, а затравку для генерации берут не как обычный запрос, а как случайный токен словаря, чтобы обойти шаблонные инструктивные ответы. Заявлено, что это готовый компонент, который можно подключить к существующему пайплайну редактирования без переделки остальной схемы. Код или готовый инструмент в тексте не упоминаются, судить о простоте интеграции на практике можно будет только по релизу реализации.
Можно ли доверять
Это препринт arXiv, то есть результаты пока не прошли рецензирование в независимом журнале или на конференции. При этом методология выглядит основательной: метод проверен на трёх разных семействах моделей (OLMo-2, Llama-3.1, Qwen-3, 7, 8 млрд параметров), поверх двух разных редакторов (MEMIT и AlphaEdit) и в двух режимах правок (пакетном и последовательном), то есть не подогнан под одну узкую конфигурацию. Разрыв в результатах (79,9% против 10,9% на GSM8K) достаточно большой, чтобы не списывать его на шум эксперимента, но подтверждение независимыми группами и рецензирование ещё впереди.
Риски и подводные камни
Эксперименты ограничены моделями с 7, 8 млрд параметров, неясно, сохранится ли эффект на значительно более крупных или совсем маленьких моделях. Метод по-прежнему работает поверх существующих ковариационных редакторов и наследует их ограничения: Moir улучшает сохранность способностей модели, но не решает остальные проблемы редактирования знаний, например надёжность самой вставленной правки при перефразировках вопроса. Работа пока не прошла независимое рецензирование, а состав авторов и их принадлежность к организациям в доступных данных не указаны, что не позволяет оценить, кто именно стоит за исследованием.