Слияние ИИ-моделей стирает распознавание вреда, но сохраняет отказы
Слияние моделей (model merging), способ объединить возможности нескольких отдельно дообученных моделей без дополнительного обучения, просто смешав их веса. Метод дешёвый и популярный, но исследователи проверили: сохраняет ли он одновременно РАЗНЫЕ типы безопасного поведения, или одно вытесняет другое.
Для контролируемого эксперимента взяли базовую модель Gemma-3-1B-IT и дообучили её двумя способами: одну версию, на датасете CARES (классификация уровня вреда контента), другую, на датасете WildJailbreak (устойчивость к обходу защит, то есть умение отказывать на провокационные запросы). Затем эти две версии слили четырьмя стандартными методами: Linear, SLERP, TIES и DARE-TIES, и проверили результат на трёх метриках: точность классификации вреда, устойчивость к атакам (джейлбрейкам) и готовность отвечать на безобидные запросы.
Результат оказался резко асимметричным и одинаковым для всех четырёх методов слияния: устойчивость к джейлбрейкам почти не пострадала, слитые модели сохранили 81-85% отказов на атаки, а точность классификации вреда по CARES обвалилась максимум до 12.9%. То есть при слиянии один тип «безопасного» поведения (отказ отвечать) фактически подавил другой (распознавание степени вреда).
Авторы проверили очевидную гипотезу, что два поведения противоречат друг другу на уровне весов, и она не подтвердилась: векторы задач (task vectors) для двух дообучений почти ортогональны, косинусное сходство между ними всего 0.011, то есть направления изменений весов практически не пересекаются. Дело оказалось не в направлении, а в масштабе: дообучение на отказах даёт значительно большие по величине изменения весов на каждом слое сети, чем дообучение на классификации. Методы слияния, чувствительные к величине (магнитуде) векторов, при объединении автоматически отдают предпочтение более «крупным» изменениям, то есть отказам, и почти полностью теряют более «тихие» изменения, отвечающие за классификацию.
Вывод авторов: стандартное слияние моделей может незаметно схлопнуть тонкое распознавание вреда в грубый повсеместный отказ, если связанные с безопасностью векторы задач сильно различаются по масштабу, даже когда сами поведения логически не конфликтуют.
Ключевые факты
- Базовую модель Gemma-3-1B-IT дообучили двумя способами: для классификации уровня вреда (датасет CARES) и для устойчивости к джейлбрейкам (датасет WildJailbreak)
- Два дообучения слили четырьмя методами, Linear, SLERP, TIES, DARE-TIES, и сравнили результат по всем четырём
- После слияния устойчивость к атакам сохранилась на уровне 81-85%, а точность классификации вреда упала максимум до 12.9%
- Векторы двух задач почти ортогональны (косинусное сходство 0.011), то есть противоречия направлений нет
- Причина асимметрии, разный масштаб изменений весов: дообучение на отказах даёт заметно большие по величине изменения на каждом слое, и магнитудо-чувствительные методы слияния отдают предпочтение именно им
Почему это важно
Слияние моделей, распространённый в индустрии способ дёшево объединить возможности нескольких дообученных версий без повторного обучения с нуля. Работа показывает, что это не нейтральная с точки зрения безопасности операция: слияние способно незаметно уничтожить одну функцию безопасности (различение степени вреда), сохранив при этом видимость другой (отказ на явные атаки), и со стороны результат будет выглядеть безопасным, хотя ключевая защита фактически исчезла.
Кому это важно
Командам, которые собирают продакшен-модели из нескольких отдельно дообученных версий ради экономии вычислений; специалистам по модерации контента и trust & safety, которые полагаются на классификацию вреда как на самостоятельный защитный слой; исследователям alignment и безопасности ИИ, изучающим побочные эффекты техник объединения моделей.
Как это применить
Перед выпуском слитой модели проверять оба типа поведения раздельными тестами, а не считать, что раз модель отказывает на джейлбрейки, значит с безопасностью всё в порядке. Перед выбором метода слияния имеет смысл сравнить величину (магнитуду) task-векторов для каждого дообучения: если один из них систематически крупнее, магнитудо-чувствительные методы (Linear, SLERP, TIES, DARE-TIES) рискуют его переиграть; такие расхождения стоит нормализовать или компенсировать вручную.
Можно ли доверять
Это контролируемый экспериментальный кейс на небольшой модели (Gemma-3-1B-IT, около 1 миллиарда параметров) и на одной конкретной паре датасетов (CARES и WildJailbreak), поэтому напрямую переносить цифры на крупные модели или другие пары задач без проверки нельзя. При этом вывод подкреплён не только метриками качества, но и прямыми измерениями в пространстве весов, косинусным сходством и магнитудами task-векторов, что делает предложенное объяснение механизма достаточно убедительным.
Риски и подводные камни
Главный риск, ложное чувство защищённости: команда может решить, что слитая модель безопасна, потому что она по-прежнему отказывает на джейлбрейки, не заметив, что параллельно она почти перестала различать степень вредности контента. Если такую слитую модель используют как классификатор вреда в модерации или в качестве фильтра, слияние способно тихо обнулить именно эту функцию, оставив лишь иллюзию работающей защиты.