NEEDLE: метод удаляет бэкдоры из языковых моделей без дообучения

NEEDLE: метод удаляет бэкдоры из языковых моделей без дообучения

Бэкдор-атаки внедряют в большие языковые модели (LLM) на этапе обучения: когда во входном тексте появляется определённый триггер, модель начинает вести себя нежелательным образом. Существующие способы защиты пытаются убрать бэкдор, но, как отмечают авторы, при этом непреднамеренно сдвигают распределение ответов модели на безобидные запросы. Это может ухудшить и качество работы модели, и её безопасность.\n\nАвторы предлагают NEEDLE, метод целевого удаления бэкдора, не требующий дообучения. Он работает, когда триггер уже выявлен. По векторам активаций метод оценивает два объекта: направление бэкдора и подпространство отказа (refusal subspace, связанное с отказами модели отвечать на нежелательные запросы). Затем последовательно применяется ортогонализация весов (weight orthogonalisation): она подавляет бэкдор и одновременно не даёт измениться представлениям, связанным с отказами. NEEDLE не нужны ни чистая эталонная модель, ни исходные отравленные обучающие данные.\n\nОценка проводилась на нескольких семействах моделей и типах атак. По заявлению авторов, NEEDLE показывает самый низкий средний показатель успешности атак (Attack Success Rate, ASR) среди оцениваемых защит, включая 0% на сложных атаках с внедрением кода. При этом у него самая низкая KL-дивергенция (мера сдвига выходного распределения модели) и минимальные изменения возможностей и безопасности модели.\n\nВ доступном описании не названы конкретные модели, виды атак кроме внедрения кода, список сравниваемых защит и числа по KL-дивергенции и тестам возможностей, так что оценить масштаб преимущества по одной аннотации нельзя.

Ключевые факты

  • NEEDLE, метод целевого удаления бэкдора из LLM без дообучения; он запускается после того, как триггер выявлен.
  • Принцип: по векторам активаций оцениваются направление бэкдора и подпространство отказа, затем последовательно применяется ортогонализация весов, чтобы подавить бэкдор и не изменить представления, связанные с отказами.
  • Не требуются ни чистая эталонная модель, ни исходные отравленные обучающие данные.
  • По заявлению авторов, у NEEDLE самый низкий средний ASR среди оцениваемых защит, в том числе 0% на сложных атаках с внедрением кода.
  • Также заявлены самая низкая KL-дивергенция и минимальные изменения возможностей и безопасности модели.

Почему это важно

Типичная проблема защит от бэкдоров, как её описывают авторы, в побочном эффекте: удаляя бэкдор, они сдвигают поведение модели на обычных запросах, из-за чего могут страдать качество и безопасность. NEEDLE нацелен именно на это: он подавляет бэкдор, стараясь не менять представления, связанные с отказами. Заявленный результат, 0% успешных атак с внедрением кода при минимальных изменениях возможностей и безопасности.

Кому это важно

Исследователям безопасности языковых моделей и тем, кто использует чужие обученные модели и опасается, что в них заложен бэкдор. Метод рассчитан на случай, когда доступны только сама модель и выявленный триггер: чистая эталонная модель и исходные отравленные данные не нужны.

Как это применить

Из описания следует только общая схема: при известном триггере оценить по активациям направление бэкдора и подпространство отказа, затем последовательно применить ортогонализацию весов. Дообучение не требуется. О выпуске кода, наборов данных или о том, как именно выявляется триггер, в описании не говорится, поэтому практическое применение зависит от полного текста статьи.

Можно ли доверять

Все результаты, заявления авторов, приведённые в аннотации к статье. Она сообщает лишь одно число: 0% ASR на сложных атаках с внедрением кода. Конкретные модели, остальные типы атак, состав сравниваемых защит, значения KL-дивергенции и показатели возможностей и безопасности в ней не раскрыты, поэтому утверждение о лучшем среднем результате по одной аннотации перепроверить нельзя.

Риски и подводные камни

Метод начинает работу только после выявления триггера, так что бэкдор с неизвестным триггером этим подходом сам по себе не закрывается. Показатель 0% заявлен для атак с внедрением кода, а не для всех типов атак. Сравнение идёт с теми защитами, которые авторы включили в оценку, и их набор в аннотации не указан.