SecOPD снижает успешность prompt injection в Qwen3.6-27B с 94% до 9%

SecOPD снижает успешность prompt injection в Qwen3.6-27B с 94% до 9%

Prompt injection, внедрение вредоносной инструкции в данные, которые ИИ-агент читает со стороны (сайт, файл, письмо), с расчётом, что агент выполнит её вместо задачи пользователя, считается угрозой номер один для ИИ-агентов. Существующие методы защитного дообучения (на основе DPO или GRPO) оценивают весь ответ модели целиком одним сигналом, из-за чего модель не может понять, какие именно токены в её ответе небезопасны. В результате защищённые такими методами модели всё равно почти всегда поддаются адаптивным атакам: успешность атак (ASR) у них держится на уровне, близком к 100%.

Исследователи (первый автор, Йибо Пэн, Yibo Peng, с соавторами) предложили метод Secure On-Policy Distillation (SecOPD). Модель получает на вход сэмпл с внедрённой инструкцией и генерирует ответ (rollout); затем каждый токен этого ответа оценивает исходная (ещё не дообученная) модель, по тому, как она ответила бы на тот же запрос без внедрённой инструкции, то есть на «чистый» вход. Так дообучение получает точный, токен-level сигнал о том, где именно ответ модели отклонился в сторону выполнения атаки, а не одну усреднённую оценку на весь ответ.

Защищённая методом SecOPD модель Qwen3.6-27B показала ASR 9,0% против современных адаптивных атак PISmith, против 94,0% у предыдущего лучшего метода защиты, Meta-SecAlign, на той же атаке. Устойчивость сохранилась и в сценарии, которого не было в обучении: при вызове инструментов агентом (agentic tool calling) SecOPD дал ASR 4,7% против 5,5% у Meta-SecAlign. Код и веса дообученной модели выложены в открытый доступ на GitHub и Hugging Face.

Ключевые факты

  • SecOPD, метод защитного дообучения ИИ-моделей от адаптивных prompt injection с оценкой на уровне отдельных токенов ответа, а не всего ответа целиком (как в DPO/GRPO)
  • На бенчмарке адаптивных атак PISmith SecOPD снизил ASR у Qwen3.6-27B до 9,0% против 94,0% у предыдущего лучшего метода Meta-SecAlign
  • В новом для модели сценарии, вызов инструментов ИИ-агентом, ASR составил 4,7% против 5,5% у Meta-SecAlign, то есть устойчивость перенеслась на незнакомую область
  • До SecOPD защищённые дообучением модели всё равно почти всегда (ASR около 100%) поддавались адаптивным prompt injection
  • Код метода и дообученная модель Qwen3.6-27B-SecOPD выложены в открытый доступ на GitHub и Hugging Face

Почему это важно

Prompt injection называют угрозой номер один для ИИ-агентов: агент, который читает внешние данные, веб-страницы, файлы, письма, можно заставить выполнить вредоносную инструкцию, спрятанную в этих данных, вместо задачи пользователя. Прежние методы защитного дообучения оценивали ответ модели целиком одним сигналом и потому не умели точно указать, какие токены ответа небезопасны, отсюда почти 100%-я успешность адаптивных атак даже против «защищённых» моделей. SecOPD решает именно эту проблему: даёт токен-level сигнал вместо усреднённого, и на тестовой модели Qwen3.6-27B это снижает успешность атак с 94% до 9%.

Кому это важно

В первую очередь, разработчикам ИИ-агентов и продуктов, которые дают модели доступ к внешним данным (браузер, почта, файлы, вызов инструментов): именно они рискуют получить агента, выполняющего чужие инструкции. Также, командам безопасности и исследователям, работающим над защитой LLM от adaptive prompt injection, поскольку метод и веса модели выложены в открытый доступ и его можно проверить и переиспользовать напрямую.

Как это применить

Код метода и дообученная модель Qwen3.6-27B-SecOPD опубликованы в открытом доступе на GitHub (github.com/pppyb/SecOPD) и Hugging Face (huggingface.co/pybbb/Qwen3.6-27B-SecOPD), то есть подход можно воспроизвести или применить дообучение к своей модели без обращения к авторам. В тексте источника не указаны ни стоимость обучения, ни требуемые вычислительные ресурсы, ни сроки, это придётся оценивать самостоятельно при внедрении.

Можно ли доверять

Результаты пока опираются на одну публикацию без указания авторской принадлежности к конкретному институту (в тексте не названы ни организация, ни дата публикации) и проверены на одном конкретном бенчмарке атак (PISmith) и одной модели (Qwen3.6-27B). В плюс, то, что метод перенёсся на не встречавшийся в обучении сценарий (вызов инструментов агентом) с сопоставимым результатом, и то, что код и модель открыты для независимой проверки, а не только заявлены на словах.

Риски и подводные камни

Источник не приводит сравнения SecOPD с защитами, отличными от Meta-SecAlign, не описывает, что представляет собой сам бенчмарк PISmith, и не раскрывает долю ложных срабатываний, то есть случаев, когда защищённая модель отказывается выполнять легитимные инструкции пользователя. Результаты получены на одной модели и одном классе атак; адаптивные атаки по определению развиваются в ответ на защиты, так что нынешние 9% ASR не гарантия устойчивости против будущих, ещё не описанных техник обхода.

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.