DDO защищает open-weight ИИ-модели от джейлбрейка обманом атакующих

Исследователи представили Decoy Direction Optimization (DDO), способ защитить открытые (open-weight) языковые модели от джейлбрейка методом Refusal Feature Ablation (RFA), также известным как «абляция» (abliteration). RFA работает так: в модели ищут линейное «направление отказа» в остаточном потоке (residual stream) и вычитают его, после этого модель перестаёт отказывать в вредных запросах, но сохраняет остальные способности; обычная защита от такой атаки требует заново дообучать модель на каждый новый чекпойнт, а это дорого по вычислениям.
DDO обходится без дообучения базовой модели и применяется уже после её выпуска. Метод построен на простом наблюдении: атаки типа RFA находят направление отказа с помощью контрастных методов оценки. Вместо того чтобы прятать настоящий механизм отказа, DDO намеренно встраивает в нейроны MLP модели мощный нелинейный «ложный» (decoy) сигнал. Когда атакующий пытается вычислить направление отказа, этот сигнал искажает его оценщик и заставляет его вместо настоящего механизма безопасности удалить безобидный, ортогональный признак, сам механизм отказа при этом остаётся нетронутым. Авторы доказывают теоретическую (спектральную) границу, формализующую этот эффект.
DDO проверили на шести семействах моделей: под стандартной атакой RFA доля успешных атак (ASR) во всех случаях оказалась ниже 10%. На модели Llama-3-8B-Instruct при более сильных адаптивных многоэтапных атаках DDO показал результат, сопоставимый со специально дообученными защитами: 65% против 58% ASR в худшем случае. Против атаки на уровне весов под названием Heretic DDO снизил долю успешных атак с 88,7% до 18%. При этом по стоимости вычислений на одну конфигурацию DDO дешевле обученных базовых защит в 30, 450 раз.
Ключевые факты
- DDO, постфактум-защита от джейлбрейка типа RFA/abliteration: правит веса уже готовой модели без дообучения базовой сети.
- Механизм: встраивает ложный сигнал в нейроны MLP, который обманывает контрастные оценщики атакующего, вместо того чтобы прятать истинное направление отказа.
- Авторы доказали спектральную границу, теоретически объясняющую, почему обман работает.
- На шести семействах моделей доля успешных атак (ASR) под стандартной RFA держится ниже 10%.
- На Llama-3-8B-Instruct: 65% против 58% ASR при адаптивных многоэтапных атаках (сопоставимо с обученными защитами) и снижение ASR атаки Heretic с 88,7% до 18%, при затратах в 30, 450 раз ниже, чем у обученных базовых решений.
Почему это важно
Джейлбрейк через удаление направления отказа (RFA/abliteration), дешёвый и распространённый способ снять защиту с открытых моделей: достаточно найти в весах линейное «направление отказа» и вычесть его, сохранив остальные способности модели. Стандартный ответ, дообучать модель заново на каждый новый чекпойнт, что дорого и не масштабируется на разработчиков, выпускающих много версий. DDO предлагает дешёвую правку весов уже готовой модели вместо повторного дообучения.
Кому это важно
Разработчикам и лабораториям, выпускающим открытые (open-weight) модели и заинтересованным защитить их от расчехления без дорогого повторного дообучения каждого чекпойнта, а также исследователям безопасности ИИ, изучающим атаки на уровне весов и защиту от них.
Как это применить
DDO, постфактум-правка весов: применяется к уже обученной модели, без изменения архитектуры и без дообучения базовой сети. По данным авторов, вычислительная стоимость такой правки на одну конфигурацию в 30, 450 раз ниже, чем у альтернативных защит, требующих полноценного дообучения.
Можно ли доверять
Материал, препринт, выложенный на Hugging Face Papers; в самой аннотации не указаны ни имена авторов, ни организация, ни статус публикации (конференция, рецензирование). Все цифры, из собственной оценки авторов на выбранных ими атаках и моделях; какая-либо независимая проверка результатов не упоминается, а конкретные шесть семейств моделей в тексте не названы.
Риски и подводные камни
Защита и атака здесь, гонка вооружений: сама работа показывает, что более сильная адаптивная атака (65% ASR на Llama-3-8B-Instruct) уже приближается к результатам специально обученных защит, то есть DDO не даёт абсолютной гарантии. Обобщаемость на модели и атаки за пределами тестового набора не подтверждена независимо, а список из шести проверенных семейств моделей в источнике не раскрыт.