DiSCO защищает генераторы изображений от вредного контента, не меняя саму модель

Генераторы изображений по тексту иногда выдают вредный контент, сцены насилия, откровенную обнажённую натуру и тому подобное. Проблему усиливают атаки red teaming: специально подобранные запросы, которыми проверяют систему на прочность. Большинство существующих защит рассчитаны на белый ящик, они меняют текстовый энкодер, редактируют веса модели или вмешиваются в процесс генерации, и поэтому не работают с закрытыми, проприетарными моделями, до внутренностей которых стороннему разработчику не добраться. Более широкие по применимости защиты по принципу «чёрного ящика» переписывают запрос пользователя силами отдельной языковой модели, но, по словам авторов DiSCO, не справляются с отдельным классом случаев, тем, что они называют «доброкачественной состязательной проблемой» (benign adversarial problem): запрос выглядит лингвистически безопасным, без явно вредных слов, но всё равно приводит к вредной генерации, просто потому, что так устроено то, что модель «выучила» из своих обучающих данных.
Авторы предлагают DiSCO, защиту, которая работает сразу, без обучения под конкретную модель, целиком на уровне запроса, как отдельный подключаемый модуль: он ставится поверх готовой системы, не переобучая и не дообучая саму модель и не получая доступа к её внутренностям. Работает это так: к исходному запросу пользователя добавляется безопасный суффикс. Варианты суффикса перебирает лучевой поиск (beam search) и оценивает контрастно, по тому, к каким изображениям, «безопасным» и «небезопасным», приводит каждый вариант; оба набора изображений для сравнения генерирует сама целевая модель. Суффикс, который сильнее сдвигает результат в сторону «безопасных» изображений, побеждает, а весь процесс повторяется с адаптивной обратной связью, пока итоговое изображение не станет безопасным.
На бенчмарке I2P (наборе запросов для проверки генераторов изображений на устойчивость к вредному контенту) при нескольких видах атак red teaming DiSCO снижает долю запросов, которые всё же обходят защиту и приводят к вредному изображению (в терминах источника, ASR), на 37,7% для моделей без какой-либо защиты и на 25,13% для моделей, которые уже используют другую защиту. При этом метод сохраняет смысловое соответствие исходному запросу и даже повышает связность итогового изображения.
Поскольку DiSCO, чёрный ящик и не привязан к архитектуре конкретной модели, его можно применить к любой системе генерации изображений по тексту, вообще не трогая саму модель. Это особенно важно для закрытых, проприетарных сервисов, где сторонний разработчик не может ни переобучить модель, ни получить доступ к её внутренностям.
Ключевые факты
- DiSCO, защита от вредного контента (насилие, откровенная нагота) для генераторов изображений по тексту, которая работает как чёрный ящик: без переобучения, без дообучения и без доступа к внутренностям модели, целиком на уровне запроса.
- Метод нацелен на «доброкачественную состязательную проблему»: запросы, которые выглядят безопасными по формулировке, но всё равно вызывают вредную генерацию из-за того, что «знает» сама модель, с такими запросами не справлялись прежние защиты по принципу «чёрного ящика» (переписывание запроса силами отдельной языковой модели).
- DiSCO дополняет запрос пользователя безопасным суффиксом: варианты перебирает лучевой поиск (beam search) и оценивает контрастно, по тому, к «безопасным» или «небезопасным» изображениям приводит каждый вариант; оба набора изображений генерирует сама целевая модель, а процесс идёт с адаптивной обратной связью до безопасного результата.
- На бенчмарке I2P при нескольких видах атак red teaming DiSCO снижает долю успешных вредных запросов (в терминах источника, ASR) на 37,7% для моделей без защиты и на 25,13% для моделей, уже имеющих другую защиту, сохраняя смысловое соответствие запросу и повышая связность изображения.
- Поскольку DiSCO не зависит от архитектуры модели и работает как чёрный ящик, его можно подключить к любой системе генерации изображений по тексту без изменения самой модели, включая закрытые, проприетарные сервисы.
Почему это важно
Вредный контент (насилие, откровенная нагота), постоянная проблема генераторов изображений по тексту, и атаки red teaming делают её острее: злоумышленники специально подбирают запросы, чтобы обойти фильтры. Большая часть существующих защит рассчитана на белый ящик, то есть на доступ к весам и внутренностям модели, а значит, принципиально не работает с закрытыми, проприетарными системами. Более гибкие защиты по принципу «чёрного ящика» (переписывание запроса силами отдельной языковой модели) существуют, но, как показывают авторы DiSCO, они пропускают отдельный класс атак, запросы, которые выглядят лингвистически безопасными, но всё равно провоцируют вредную генерацию из-за того, что «знает» сама модель о своих обучающих данных. DiSCO закрывает именно этот пробел, оставаясь при этом полностью чёрным ящиком: без переобучения, без дообучения, без доступа к модели изнутри.
Кому это важно
Компаниям и разработчикам, которые строят продукты поверх чужих, закрытых генераторов изображений (например, через API) и не могут ни переобучить модель, ни получить доступ к её весам, но обязаны фильтровать вредный контент. Платформам и сервисам, которым нужен дополнительный слой модерации поверх уже существующей защиты, DiSCO показывает эффект даже на моделях, которые уже как-то защищены. Исследователям безопасности и специалистам по red teaming, которые изучают, как обходят текущие фильтры генераторов изображений и какие классы атак, в частности, «доброкачественные состязательные» запросы, остаются непокрытыми.
Как это применить
DiSCO ставится поверх готового пайплайна генерации как отдельный подключаемый модуль на уровне запроса: не нужно ни переобучать модель, ни дообучать её, ни получать доступ к её весам, только перехватывать текст запроса и дополнять его безопасным суффиксом перед тем, как он уходит в модель. Поскольку это чёрный ящик и метод не привязан к архитектуре, его можно подключить к любой системе генерации изображений по тексту, включая закрытые, проприетарные сервисы, куда нет доступа изнутри. Источник не называет ни конкретную протестированную модель, ни то, выложен ли код или демо, судить о готовности метода к внедрению по одной аннотации нельзя.
Можно ли доверять
Работа опубликована как препринт, материал на Hugging Face Papers, и в доступном тексте, аннотации, не указаны ни конкретные авторы, ни организация, ни дата публикации: имя, которое стоит у карточки материала на Hugging Face, это техническая метка отправителя публикации, а не подпись автора из самого текста. Не назван и конкретный генератор изображений, на котором проверяли метод, не назван и ни один конкретный существующий метод защиты, с которым сравнивали DiSCO, в тексте они упомянуты только обобщённо, как «существующие защиты» и «уже защищённые модели». Результат заявлен на одном бенчмарке, I2P. Полную оценку методики и результатов даёт только чтение полного текста статьи, а не аннотации.
Риски и подводные камни
Цифры снижения, 37,7% и 25,13%, получены на одном бенчмарке (I2P) и не обязательно переносятся на другие типы атак или другие генераторы изображений. Аннотация не называет ни модель, на которой ставился эксперимент, ни конкретный метод защиты, с которым сравнивали DiSCO, поэтому по одной аннотации нельзя оценить, насколько выигрыш обусловлен именно новизной DiSCO, а не слабостью взятого для сравнения базового варианта. Источник не упоминает ни выпуск кода, ни весов модели, ни демо-версии DiSCO, значит, пока не ясно, может ли кто-то, кроме авторов, воспроизвести или использовать метод.