FlowGuard предлагает защиту мультимодальных ИИ от межмодальных атак
Мультимодальные большие языковые модели получают дополнительную поверхность для атак: злоумышленник может распределить вредоносное намерение между разными модальностями и тем самым обойти защиту, которая проверяет каждую из них по отдельности. Авторы работы предлагают использовать как сигнал не сами входные или выходные данные, а согласованность внутреннего рассуждения модели по тексту и изображению.
В основе метода FlowGuard лежит наблюдение: для безопасных запросов предсказания текстового и визуального компонентов совместимы, а после их объединения это поведение стабилизируется. Манипуляция, напротив, нарушает согласованность и приводит к аномальному поведению мультимодальной системы. FlowGuard работает во время вывода и отслеживает этот процесс объединения модальностей.
Вместо одной числовой метрики уверенности метод строит FlowVectors, вдохновлённые частичной декомпозицией информации. Они измеряют избыточную информацию между модальностями, их синергию и преобладание одной из модальностей, чтобы проверить, сохраняется ли согласованность объединённого предсказания с семантическими свидетельствами из отдельных модальностей. Классификатор обучают только на безопасных данных. На не виденных ранее атаках FlowGuard, по данным авторов, уменьшил долю успешных атак с более чем 90% до менее чем 15%, потерял менее 3% полезности и сократил задержку до шести раз по сравнению с существующими защитами.
Ключевые факты
- Межмодальная атака может распределять вредоносное намерение между текстом и изображением, обходя проверки каждой модальности по отдельности.
- FlowGuard во время вывода наблюдает, согласуется ли объединённое предсказание модели с отдельным текстовым и визуальным анализом.
- FlowVectors оценивают избыточность, синергию и преобладание одной модальности вместо использования одной метрики уверенности.
- Классификатор обучается только на безопасных данных; на не виденных ранее атаках успешность атак снизилась с более чем 90% до менее чем 15%.
- Авторы сообщают о потере полезности менее 3% и сокращении задержки до шести раз по сравнению с существующими защитами.
Почему это важно
Защита мультимодальных моделей не может ограничиваться независимой проверкой текста и изображения: вредоносное намерение можно распределить между ними. Работа предлагает контролировать внутреннее объединение модальностей, где такая манипуляция проявляется как нарушение согласованности.
Кому это важно
Метод относится к разработчикам и операторам мультимодальных больших языковых моделей, которым нужна защита от вредоносных запросов с текстом и изображениями без существенного ухудшения полезности и задержки.
Как это применить
FlowGuard предназначен для работы во время вывода. Он сравнивает внутреннее предсказательное поведение текстового и визуального компонентов с результатом их объединения и подаёт признаки FlowVectors в одноклассовый классификатор, обученный на безопасных данных.
Можно ли доверять
Заявленные результаты основаны на экспериментах авторов: на не виденных ранее атаках доля успешных атак снизилась с более чем 90% до менее чем 15%, а потеря полезности составила менее 3%. Это описание исследовательской работы, а не сведения о внедрении метода в готовый продукт.
Риски и подводные камни
Эффективность FlowGuard показана для не виденных ранее атак в описанных авторами экспериментах. Из предоставленного текста не следует, как метод поведёт себя при других типах атак, данных или архитектурах мультимодальных моделей.