SAILS: метод подбора отравленных данных поднимает успех бэкдор-атак на LLM до 80%

SAILS: метод подбора отравленных данных поднимает успех бэкдор-атак на LLM до 80%

Авторы препринта разбирают, как обычно оценивают устойчивость языковых моделей к бэкдор-атакам через дообучение: в чистые данные для файнтюна подмешивают небольшое число «отравленных» примеров, которые связывают триггер с нужным злоумышленнику поведением модели. Стандартная практика, зафиксировать число таких примеров и выбрать их случайно из пула кандидатов. Авторы показывают, что это сильно занижает реальную уязвимость: на трёх разных сценариях бэкдор-атак на LLaMA-3-8B, при полностью зафиксированных модели, чистых данных и числе отравленных примеров, успех атаки колебался от 3% до 80%, и разница объяснялась только тем, какой именно набор примеров был выбран.

Чтобы находить такие наиболее эффективные наборы, авторы формализуют отбор отравленных примеров как задачу оптимизации на множествах с ограниченным числом обращений к «оракулу» (то есть к проверке реального результата атаки) и предлагают метод SAILS (Set-level Audit-Informed Iterative Learned Selection). SAILS обучает модель-оценщик, которая умеет предсказывать эффективность набора примеров, на нескольких сотнях прогонов «дообучить модель и проверить результат». Затем эта оценка используется, чтобы ранжировать миллионы возможных наборов-кандидатов, и только небольшой шорт-лист лучших из них проверяется полноценным дообучением и тестом.

По заявлению авторов, SAILS поднимает успех атаки на отложенных (held-out) данных в среднем на 30 процентных пунктов по сравнению с сильнейшими из существующих методов отбора, основанных на оценке влияния примеров. Метод переносится с экспериментов на малом масштабе на полноценное дообучение и, по их словам, работает не только для базового случая, но и для бэкдоров в генерации кода, в агентных сценариях и для атак, у которых есть доступ к модели только через API, без доступа к внутренностям обучения.

Ключевые факты

  • При одинаковом числе отравленных примеров успех бэкдор-атаки на LLaMA-3-8B колебался от 3% до 80%, разница зависела только от того, какой именно набор был выбран.
  • Стандартная практика оценки, фиксированное число случайно выбранных отравленных примеров, занижает реальную наихудшую уязвимость модели, по выводу авторов.
  • Метод SAILS учится оценивать наборы примеров по нескольким сотням прогонов «дообучение + проверка», затем ранжирует миллионы кандидатов и полноценно тестирует только небольшой шорт-лист лучших.
  • SAILS поднимает успех атаки в среднем на 30 процентных пунктов по сравнению с сильнейшими существующими методами отбора на основе влияния примеров.
  • Метод переносится с малого масштаба дообучения на полный и, по заявлению авторов, работает для бэкдоров в генерации кода, агентных сценариях и атак только через API.

Почему это важно

Работа ставит под сомнение то, как индустрия вообще измеряет уязвимость языковых моделей к бэкдор-атакам через отравление данных для дообучения. Если при одном и том же числе вредоносных примеров успех атаки может отличаться в разы, от 3% до 80%, в зависимости только от выбора конкретного набора, то оценки, построенные на случайной выборке примеров, систематически занижают реальный худший случай. Это меняет саму методологию проверки безопасности: недостаточно зафиксировать «сколько» отравленных примеров подмешано, важно ещё и «какие именно».

Кому это важно

В первую очередь, исследователям безопасности ИИ и red-team-командам, которые оценивают устойчивость моделей к атакам через отравление обучающих данных. Также это касается компаний, дообучающих открытые модели на внешних или собранных из разных источников данных: если оценка риска строится на случайной выборке примеров, она может недооценивать реальную опасность. Косвенно это касается и разработчиков платформ для файнтюна через API, где напрямую данные для обучения не видны, а метод, по словам авторов, работает и для такого сценария.

Как это применить

SAILS описан как инструмент аудита, а не готовый продукт: чтобы им воспользоваться, нужно сначала прогнать несколько сотен циклов «дообучить модель на пробном наборе, проверить результат атаки», чтобы обучить модель-оценщик наборов. После этого оценщик может отранжировать миллионы возможных комбинаций отравленных примеров, а полноценной, дорогой проверке (повторному дообучению и тесту) подвергается только небольшой шорт-лист наиболее перспективных наборов. В тексте не раскрыто, ни во сколько именно обходится такой цикл по времени или вычислениям, ни как SAILS соотносится по стоимости с методами, с которыми он сравнивается.

Можно ли доверять

Источник, страница препринта на Hugging Face Papers с текстом аннотации; в самой аннотации не названы ни авторы, ни организация, ни дата публикации, эти данные взяты из карточки статьи на Hugging Face. Приведённые цифры (диапазон 3, 80%, прирост на 30 процентных пунктов, «несколько сотен» прогонов, «миллионы» кандидатов), заявления самих авторов из аннотации, без независимой проверки; полный текст статьи с деталями методики и экспериментов в пересказ не входил.

Риски и подводные камни

Метод по своей природе двусторонний: инструмент, который эффективнее находит наборы данных для успешной бэкдор-атаки, одновременно снижает планку для тех, кто такую атаку проводит, при условии, что у атакующего есть возможность прогнать несколько сотен циклов дообучения и проверки на своих кандидатах. В тексте не описано, что конкретно представляют собой триггер и целевое поведение модели в экспериментах, а также нет сравнения вычислительной стоимости SAILS с базовыми методами, это ограничивает возможность оценить его практичность и реальный дополнительный риск.