Учёные показали: логи маршрутизации MoE-моделей выдают данные дообучения

Языковые модели архитектуры Mixture-of-Experts (MoE, «смесь экспертов») при работе формируют информацию о маршрутизации: какие эксперты были выбраны для обработки текста. Такие данные могут записываться в журналы или выдаваться наружу для мониторинга, отладки, анализа нагрузки и аудита безопасности. В отличие от обычных ответов модели, эта телеметрия показывает кусочек её внутренних вычислений. Отсюда вопрос о приватности: можно ли по ней понять, использовался ли конкретный пример при дообучении развёрнутой модели?

Авторы статьи предлагают атаку определения членства (membership inference), дополненную данными маршрутизатора. Она объединяет привычные сигналы из выходов модели с агрегированными признаками маршрутизации. Классификатор членства обучается на независимо дообученных теневых моделях (shadow models), а затем применяется к целевой модели.

Оценка проведена на трёх MoE-архитектурах и трёх предметных областях данных, то есть в девяти конфигурациях. Телеметрия маршрутизатора стабильно улучшала результат по сравнению с сильным ансамблем сигналов из выходов модели: доля верно распознанных обучающих примеров (TPR) при 1% ложных срабатываний (FPR) росла на 2,7-9,4 процентного пункта во всех девяти случаях.

Утечка сохраняется при полном дообучении, обучении с замороженным маршрутизатором, LoRA и инструктивной настройке (instruction tuning). Она заметна и в урезанных условиях: когда доступны только дискретные выборы экспертов, когда телеметрия ограничена или когда есть всего одна теневая модель.

Механистический анализ показывает, что утечке не нужна «память» именно маршрутизатора. Дообучение вносит информацию о членстве в скрытые представления модели, а маршрутизатор выдаёт проекцию этого сигнала, даже если его параметры заморожены. Искажение телеметрии уменьшает дополнительную утечку лишь по мере того, как падает точность самой телеметрии. Вывод авторов: телеметрия маршрутизатора может превратить служебный сигнал в дополнительную поверхность для атак на приватность дообученных MoE-моделей.

Ключевые факты

  • Предложена атака определения членства на дообученные MoE-модели: сигналы из выходов объединяются с агрегированными признаками маршрутизации, а классификатор обучается на теневых моделях.
  • Прирост TPR при 1% FPR над сильным ансамблем сигналов из выходов, 2,7, 9,4 процентного пункта во всех девяти конфигурациях (три MoE-архитектуры × три области данных).
  • Утечка сохраняется при полном дообучении, замороженном маршрутизаторе, LoRA и инструктивной настройке, а также при дискретных выборах экспертов, ограниченной телеметрии и одной теневой модели.
  • Причина, не память маршрутизатора: дообучение вносит информацию о членстве в скрытые представления, а маршрутизатор показывает её проекцию.
  • Искажение телеметрии снижает утечку только тогда, когда падает её точность.

Почему это важно

Данные маршрутизации обычно считаются безобидной служебной информацией: их пишут в логи, чтобы следить за работой модели, искать ошибки, оценивать нагрузку и проверять безопасность. Статья утверждает, что такой сигнал сам по себе открывает дополнительный канал утечки: по нему можно судить, входил ли пример в дообучающую выборку. Прирост в 2,7-9,4 процентного пункта TPR при 1% FPR получен поверх сильного ансамбля сигналов из выходов, то есть это не сравнение с заведомо слабой базой.

Кому это важно

Командам, которые дообучают MoE-модели на чувствительных данных (внутренних документах, клиентских данных) и при этом собирают или отдают наружу телеметрию маршрутизации. Также специалистам по приватности и безопасности ИИ, которые оценивают атаки определения членства, и тем, кто строит системы мониторинга и аудита MoE-моделей.

Как это применить

Прямых рекомендаций по защите в тексте нет, кроме наблюдения, что искажение телеметрии помогает лишь ценой её точности. Практический вывод для читателя осторожный: при оценке рисков дообученной MoE-модели стоит учитывать не только её ответы, но и то, кто и с каким уровнем детализации видит данные маршрутизации. Подробности методики, названия архитектур и областей данных в доступном тексте не раскрыты.

Можно ли доверять

Это препринт на arXiv, судя по доступному тексту, только аннотация. Все утверждения принадлежат авторам статьи и не подтверждены независимо. Сама цифра прироста относится к девяти экспериментальным конфигурациям; абсолютные значения TPR и названия моделей и наборов данных в тексте не приведены, поэтому оценить масштаб реальной угрозы по аннотации трудно.

Риски и подводные камни

Результаты получены в лабораторных условиях с теневыми моделями; в тексте не сказано, что какой-либо реальный сервис раскрывает такую телеметрию или уязвим к атаке. Не стоит читать прирост в процентных пунктах как долю всех «раскрытых» примеров: речь о TPR при фиксированных 1% ложных срабатываний. Защитное искажение телеметрии, по словам авторов, снижает утечку лишь вместе с её полезностью для мониторинга, так что полностью избавиться от компромисса не получится.

«Наши результаты показывают, что телеметрия маршрутизатора может превратить операционный сигнал в дополнительную поверхность для атак на приватность дообученных MoE-моделей.»

— из аннотации статьи