Утечка приватности в split-LLM обучении: градиент выдаёт реальные данные

В статье разобран случай на архитектуре split-LLM обучения из двух узлов: доверенный локальный узел (TLN) отправляет защищённые активации недоверенному облачному узлу (UCN); UCN возвращает свой выход; TLN, у которого хранится приватная функция потерь, в ответ отправляет облаку градиент этого выхода. В батч, который видит облако, подмешаны декои, фиктивные строки вперемешку с реальными, и функция потерь их игнорирует. Из-за этого градиент по декой-строкам получается ровно нулевым, а по расположению нулей в возвращённом градиенте облако может точно определить, какие строки батча были настоящими.
Авторы проверили это по протоколу, зафиксированному заранее: сначала внедрили утечку известной силы, чтобы убедиться, что метод её обнаруживает; затем прогнали контроль с перемешанными метками, чтобы убедиться, что метод не сообщает об утечке там, где её нет; порог обнаружения тоже задали до запусков. На всех девяти случайных запусках (сидах) нулевые градиенты безошибочно указали на реальные строки, 4096 из 4096 кадров за прогон. Отдельная атака на содержимое кадра дополнительно восстановила примерно на одно верно угаданное слово больше на каждые сто по сравнению с базовым угадыванием (прирост точности +0,65, 1,50 процентного пункта); контроль с перемешанными метками при этом не восстановил ничего, то есть найденная утечка не артефакт метода, а реальный канал.
Эксперимент повторили на конфигурации, которая укладывается в бюджет по качеству модели, то есть утечка не привязана к искусственной настройке, которую никто не стал бы разворачивать на практике, а сохраняется и в реалистичном варианте. При этом на обоих наборах данных каждый такой прогон проходил стандартную проверку приватности прямого канала и проверку качества, то есть по этим двум тестам система выглядела безопасной, и проваливал проверку только тогда, когда в неё включали возвращаемый градиент.
Закрыть утечку удалось клиппингом и добавлением шума к каждой строке градиента; цена этой защиты, рост кросс-энтропии на отложенной выборке примерно на 0,01 ната. Авторы прямо оговаривают, что это не делает систему безопасной в целом: пять классов атак, включая атаки, накапливающие наблюдения за много шагов обучения, в этой работе не измерялись вовсе.
Ключевые факты
- В split-LLM обучении доверенный узел возвращает недоверенному облаку градиент; из-за нулевого градиента на декой-строках облако безошибочно определило реальные строки в 4096 из 4096 кадров на каждом из девяти запусков (сидов)
- Атака на содержимое кадра восстановила примерно на одно верно угаданное слово больше на каждые сто по сравнению с базовым угадыванием (+0,65, 1,50 процентного пункта), а контроль с перемешанными метками не восстановил ничего
- Результат воспроизвели на конфигурации, укладывающейся в бюджет по качеству модели, утечка не ограничена искусственной, нереалистичной настройкой
- Все такие прогоны проходили стандартную проверку приватности прямого канала и проверку качества и проваливали проверку только после того, как в неё включали возвращаемый градиент
- Клиппинг и добавление шума к каждой строке градиента закрыли утечку ценой роста кросс-энтропии на отложенной выборке примерно на 0,01 ната, но пять классов атак, включая атаки, копящие наблюдения за много шагов обучения, авторы не проверяли вовсе
Почему это важно
Работа показывает конкретную дыру в том, как обычно проверяют приватность систем split-LLM обучения: аудит смотрит на прямой канал (что уходит в облако) и на качество модели, но не на обратный канал, градиент, который доверенный узел возвращает облаку. В этом случае обратный канал безошибочно (4096 из 4096) выдавал, какие строки были реальными, а какие декоями, при том что оба стандартных теста система проходила. Это значит, что «прошла проверку приватности» для таких архитектур пока не гарантирует отсутствия утечки, гарантирует только отсутствие утечки там, где искали.
Кому это важно
Тем, кто строит или проверяет системы, где обучение модели разделено между доверенным локальным узлом (например, для защиты чувствительных данных) и недоверенным облачным, включая случаи с медицинскими или финансовыми данными, где вычисления вынесены в чужое облако. Так же, специалистам по безопасности и аудиторам, которые разрабатывают протоколы проверки приватности для подобных архитектур, и командам, которые продают split-обучение как способ сохранить конфиденциальность данных при обучении в облаке.
Как это применить
Практический вывод: в аудит приватности split-обучения нужно включать не только прямой канал и качество модели, но и возвращаемый градиент, именно там был найден канал утечки в этой работе. Авторы также показали рабочую меру защиты: клиппинг и добавление шума к каждой строке градиента закрыли конкретно эту утечку через декои, при измеренной цене, рост кросс-энтропии на отложенной выборке примерно на 0,01 ната. Это стоит применять как один из слоёв защиты, а не как полное решение, см. следующую главу.
Можно ли доверять
Методология самой проверки выглядит аккуратной: протокол зафиксировали заранее, добавили позитивный контроль (утечку известной силы, чтобы убедиться, что метод её видит) и негативный контроль (перемешанные метки, чтобы убедиться, что метод не видит утечку там, где её нет), а порог обнаружения задали до запусков, это снижает риск того, что находка объясняется артефактом метода измерения. При этом в тексте статьи не названы ни авторы, ни организации, ни издание или площадка публикации, ни конкретные названия двух использованных наборов данных, независимо проверить эти детали по самому тексту нельзя, и относиться к препринту стоит с обычной для такого случая осторожностью.
Риски и подводные камни
Предложенная защита (клиппинг и шум в градиенте) закрывает ровно найденный канал утечки через декои, она не является общей гарантией безопасности системы. Авторы прямо пишут, что пять классов атак, включая атаки, накапливающие наблюдения за много шагов обучения, в этой работе вообще не измерялись. Значит, у системы могут оставаться другие, непроверенные каналы утечки данных, и внедрение одной этой меры защиты не означает, что split-LLM обучение в целом безопасно для приватных данных.