В протоколе MCP нашли слабое место: взломанный ИИ-агент заражает другие

В протоколе MCP нашли слабое место: взломанный ИИ-агент заражает другие

По данным Ars Technica, массовое внедрение ИИ-агентов в миллионах организаций открывает атакующим новые возможности: заставить агентов выполнять вредные действия, например выгружать содержимое баз данных и чувствительную деловую и личную информацию.

За последние пять месяцев Google и ещё четыре организации, у которых мало общего, кроме использования ИИ-агентов, признали уязвимости такого типа. Суть в том, что один агент внутри атакованной сети используется для распространения вредных инструкций другим внутренним агентам. Приём, особая форма инъекции промптов (prompt injection), которая нацелена не на языковую модель, а на конкретного агента, например отвечающего за перевод или анализ данных. Защитные ограничения (guardrails) внутри таких агентов, если они вообще есть, часто слабые и передают инструкции дальше по цепочке. Поскольку следующий агент явно доверяет первому, он выполняет указания.

Независимый исследователь Syed Anas Mohiuddin протестировал агентов организаций, среди которых Google, JP Morgan Chase, Weviate, Rapid7, межведомственная цифровая дирекция правительства Франции и федеральное правительство США. Его атаки, доказывающие работоспособность метода (proof-of-concept), используют пробелы в доверии в MCP (Model Context Protocol). Этот стандарт, один из способов, которыми ИИ-приложения и агенты общаются друг с другом внутри корпоративной сети.

Многим узкоспециализированным агентам не хватает защитных ограничений, которые обычно смягчают худшие последствия инъекции промптов. К тому же серверы MCP хранят учётные данные каждого агента, а агенты устроены так, чтобы доверять любому другому внутреннему агенту. В итоге эксплойт, который языковая модель отклонила бы, срабатывает. Во многих случаях хорошо составленные промпты, нацеленные на нужного агента, приводят к подделке запросов на стороне сервера (server-side request forgery), уязвимости, из-за которой веб-сервер выполняет несанкционированные сетевые запросы.

Ключевые факты

  • За последние пять месяцев Google и ещё четыре организации признали уязвимости, при которых один взломанный внутренний агент передаёт вредные инструкции другим агентам.
  • Независимый исследователь Syed Anas Mohiuddin построил proof-of-concept атаки на агентов Google, JP Morgan Chase, Weviate, Rapid7, межведомственной цифровой дирекции Франции и федерального правительства США.
  • Атака, особая форма инъекции промптов: она бьёт не по языковой модели, а по конкретному агенту (например, для перевода или анализа данных), а следующий агент доверяет первому.
  • Серверы MCP хранят учётные данные каждого агента, а агенты по замыслу доверяют друг другу, поэтому эксплойт, отклонённый моделью, срабатывает.
  • Во многих случаях удачный промпт приводит к подделке запросов на стороне сервера (SSRF).

Почему это важно

Проблема касается не одной программы, а способа, которым агенты доверяют друг другу внутри сети. По описанию Ars Technica, защита на уровне языковой модели здесь не срабатывает: эксплойт, который модель отклонила бы, проходит, потому что агент слепо доверяет другому внутреннему агенту. Статья отдельно отмечает, что уязвимости такого рода за пять месяцев признали Google и ещё четыре организации, а масштаб внедрения агентов исчисляется миллионами организаций.

Кому это важно

Командам безопасности и разработчикам, которые строят или внедряют внутренних ИИ-агентов, особенно связанных через MCP. Среди организаций, чьих агентов тестировал исследователь, Google, JP Morgan Chase, Weviate, Rapid7, межведомственная цифровая дирекция правительства Франции и федеральное правительство США: то есть и коммерческие компании, и госструктуры.

Как это применить

Из описания следует, что стоит проверить, какие защитные ограничения есть у узкоспециализированных агентов (перевод, анализ данных и т. п.), как они передают инструкции друг другу и где в MCP-серверах хранятся учётные данные агентов. Рекомендаций по защите во фрагменте статьи нет: он обрывается, и меры противодействия там не приведены. Раздел статьи называется «Неожиданно и трудно смягчить».

Можно ли доверять

Это пересказ фрагмента статьи Ars Technica; полный текст не рассматривался. Атаки описаны как proof-of-concept, о реальной эксплуатации в природе во фрагменте не сказано. Цитат исследователя или компаний, идентификаторов CVE, оценок опасности и сведений об исправлениях нет. Из текста не видно, какие именно из перечисленных организаций признали уязвимости: он отдельно перечисляет протестированных агентов и отдельно говорит о Google и четырёх других организациях.

Риски и подводные камни

Среди описанных рисков, выгрузка содержимого баз данных и чувствительной деловой и личной информации. Опасность усиливает то, что у многих узкоспециализированных агентов нет защитных ограничений, а серверы MCP хранят учётные данные каждого агента. Результатом удачной атаки во многих случаях (но не во всех) становится подделка запросов на стороне сервера. Не стоит переносить выводы на все системы: названия конкретных протестированных агентов и продуктов во фрагменте не указаны.