GPT-5 оказалась самой уязвимой к атаке PlanFlip на ИИ-агентов
В многоагентных системах на базе LLM обычно есть агент-Планировщик, который разбивает цель на последовательность подзадач, а агенты-Исполнитель и Критик выполняют и проверяют результат. Исследователи показали, что этап планирования, критическая точка атаки: одна-единственная инъекция в контекст Планировщика запускает каскадное усиление и одновременно портит все последующие подзадачи.
Авторы представили фреймворк PlanFlip из четырёх атак типа prompt injection на этапе планирования: подмена цели (GoalSubstitution, PF-1), инверсия приоритетов (PriorityInversion, PF-2), засорение контекста (ContextPollution, PF-3) и подмена роли (RoleConfusion, PF-4). Каждая атака маскируется под правдоподобный вывод инструмента, чтобы обойти фильтры по ключевым словам.
Фреймворк проверили на девяти передовых LLM в 3479 эпизодах и получили три ключевых вывода. Во-первых, мощность модели не защищает, а наоборот, усиливает уязвимость: GPT-5 показала самую высокую долю успешных атак (ASR = 0.68) среди всех протестированных моделей, что опровергает представление, будто более сильные модели безопаснее по умолчанию. Во-вторых, однородные конвейеры (когда Планировщик и Критик построены на одной и той же базовой модели) подвержены «слепому пятну коррелированных агентов»: у GPT-4o и Llama-3.3-70B доля успешных атак близка к нулю, но при этом скрытность атаки (Stealth) равна 1.00, а смещение плана (StepShift) больше нуля, атака перестраивает план, а Критик на той же базовой модели всё равно докладывает, что план не изменился (это подтвердили два независимых судьи-модели с семантическим отклонением от -0.20 до -0.32 при коэффициенте корреляции r = 0.943). В-третьих, модели с явным рассуждением сопротивляются инъекциям: DeepSeek-R1 показала нулевое смещение плана (StepShift = 0.00) при всех типах атак.
Авторы также предложили два метода защиты, GoalAnchorCheck (D1, привязка к исходной цели) и CrossAgentConsensus (D2, сверка через независимого агента), которые обнаруживают до 100% атак и превосходят базовые методы защиты на той же базовой модели в 15 из 16 сценариев. Главный вывод исследования: разнородность моделей в конвейере, обязательное условие безопасности многоагентных систем, а резервирование в рамках одной и той же базовой модели не даёт защиты от атак на этапе планирования.
Ключевые факты
- PlanFlip, четыре атаки типа prompt injection на этапе планирования (подмена цели, инверсия приоритетов, засорение контекста, подмена роли), замаскированные под вывод инструментов
- Проверка на девяти передовых LLM в 3479 эпизодах: GPT-5 показала самую высокую долю успешных атак (ASR = 0.68), сильнее модель не значит безопаснее
- Однородные конвейеры (Планировщик и Критик на одной базовой модели, например GPT-4o или Llama-3.3-70B) дают ложное чувство защищённости: атака почти всегда остаётся незамеченной, хотя план искажён
- DeepSeek-R1 с явным рассуждением полностью устояла перед всеми атаками (нулевое смещение плана)
- Предложенные защиты GoalAnchorCheck и CrossAgentConsensus детектируют до 100% атак и работают лучше проверок на той же базовой модели в 15 из 16 сценариев
Почему это важно
Многоагентные ИИ-системы с разделением ролей на Планировщика, Исполнителя и Критика становятся стандартной архитектурой для сложных автоматизированных задач. Исследование показывает, что этап планирования, не второстепенная, а критическая точка отказа: одна инъекция в контекст Планировщика заражает все последующие шаги, а более мощные модели оказались более, а не менее уязвимы к такой атаке.
Кому это важно
Разработчикам и командам безопасности, которые строят или эксплуатируют многоагентные ИИ-пайплайны с архитектурой «Планировщик, Исполнитель, Критик», особенно если система принимает внешние данные (вывод инструментов, результаты поиска, содержимое файлов) на этапе формирования плана.
Как это применить
Авторы советуют не полагаться на одну и ту же базовую модель для Планировщика и проверяющего его Критика: такая связка не замечает подмену плана, даже когда доля успешных атак кажется низкой. Рекомендуется разнородность моделей в конвейере и внедрение предложенных проверок, GoalAnchorCheck (сверка плана с исходной целью) и CrossAgentConsensus (сверка через независимого агента на другой базовой модели).
Можно ли доверять
Работа опубликована как препринт на arXiv без указания принадлежности авторов к организации и без отметки о рецензировании; в тексте нет прямой атрибуции авторам по имени. При этом методология выглядит основательной: девять протестированных моделей, 3479 эпизодов, отдельные метрики (доля успешных атак, скрытность, смещение плана) и перекрёстная проверка результатов двумя независимыми моделями-судьями с высокой согласованностью (r = 0.943).
Риски и подводные камни
Публикация детализирует конкретные типы инъекций (подмена цели, инверсия приоритетов, засорение контекста, подмена роли) и то, как они маскируются под вывод инструментов, это одновременно и материал для защиты, и потенциальный шаблон для реальных атак. Кроме того, даже предложенные защиты не дают стопроцентной гарантии во всех сценариях, а модели с рассуждением (типа DeepSeek-R1) показали устойчивость только против протестированных в этой работе атак, не факт, что это распространяется на другие типы инъекций.
«Разнородность моделей, обязательное условие безопасности многоагентных систем; резервирование в рамках одной и той же базовой модели не даёт защиты от атак на этапе планирования»
— авторы исследования PlanFlip (arXiv 2607.16199)