Claude Code Opus 5: исследователь нашёл обход Auto Mode, атака срабатывает в 80% случаев
Claude Code, ИИ-агент Anthropic для написания и выполнения кода. Компания делает большую ставку на его встроенный защитный классификатор Auto Mode как на главную защиту пользователей от атак типа prompt injection: режим недавно стал включён по умолчанию, и Anthropic делала громкие заявления о его эффективности.
Иоганн Рехбергер, которого автор поста называет одним из самых авторитетных сегодня исследователей атак типа prompt injection, нашёл способ обойти Auto Mode в Claude Code, работающем на модели Opus 5 (именно так процесс назван в заголовке материала; подробнее об этой связи текст не говорит). По собственному заявлению Рехбергера, без указания выборки или методики измерения, атака срабатывает в 80% случаев. Механика: Claude Code обманом заставляют скачать и распаковать zip-архив, после чего агент выполняет код с импортом модуля base64, не замечая, что тот же импорт заодно подгружает и запускает извлечённый из архива локальный файл struct.py с вредоносным содержимым.
В части тестовых прогонов Рехбергера защита не просто пропускала атаку, а мешала её устранению: Claude обнаруживал компрометацию и пытался завершить вредоносный процесс, но Auto Mode блокировал именно команду очистки. Как формулирует автор поста, сам защитный механизм стал частью отказа: классификатор разрешил создание вредоносного процесса, но затем заблокировал команду, предназначенную для его остановки.
Саймон Уиллисон, автор поста с разбором находки, говорит, что согласен с выводом Рехбергера: единственный безопасный способ запускать агентов при любом риске столкнуться с целенаправленной атакой, песочница. Он повторяет конкретные рекомендации: запускать автономных агентов-разработчиков в контейнере, виртуальной машине или песочнице на уровне операционной системы; ограничивать им исходящий сетевой трафик; вести мониторинг их действий; и не давать среде выполнения агента доступ к домашним каталогам, SSH-ключам и облачным учётным данным.
Ключевые факты
- Иоганн Рехбергер, по характеристике автора поста один из самых авторитетных сегодня исследователей атак типа prompt injection, нашёл обход защитного классификатора Auto Mode в Claude Code (в заголовке материала, версия Opus 5); по собственному заявлению Рехбергера атака срабатывает в 80% случаев, выборка и методика измерения не раскрыты.
- Механика атаки: Claude Code обманом заставляют скачать и распаковать zip-архив, после чего агент выполняет код с импортом base64, не замечая, что тот же импорт запускает извлечённый из архива локальный файл struct.py с вредоносным содержимым.
- В части прогонов Auto Mode само мешало защите: когда Claude обнаруживал компрометацию и пытался остановить вредоносный процесс, классификатор блокировал именно команду очистки, пропустив запуск вредоноса, но не дав его прервать.
- Anthropic недавно сделала Auto Mode режимом по умолчанию и делала громкие заявления о его эффективности против атак типа prompt injection; ответа или комментария компании на находку Рехбергера в материале нет.
- Саймон Уиллисон, автор поста, соглашается с выводом Рехбергера: единственный безопасный способ запускать агентов при риске целенаправленной атаки, песочница: контейнер, виртуальная машина или изоляция на уровне ОС, плюс ограничение исходящего трафика, мониторинг и отсутствие доступа к домашним каталогам, SSH-ключам и облачным учётным данным.
Почему это важно
Anthropic делает Auto Mode главной защитой пользователей Claude Code от атак типа prompt injection: режим недавно стал включён по умолчанию, и компания делала громкие заявления о его эффективности. Находка Рехбергера бьёт по этому доверию с двух сторон: во-первых, показывает конкретный воспроизводимый способ обхода с высокой заявленной частотой срабатывания (80% случаев по словам самого исследователя); во-вторых, и это существеннее, показывает, что сам защитный механизм в части случаев мешал устранению уже случившегося взлома, блокируя команду на остановку вредоносного процесса. Для инструмента, который всё активнее работает без постоянного присмотра человека, это удар именно по той функции, которая должна такую автономность оправдывать.
Кому это важно
В первую очередь, тем, кто запускает Claude Code в Auto Mode без постоянного контроля человека, особенно на задачах, где агент имеет дело с недоверенным содержимым: чужими архивами, страницами, репозиториями. Также, самой Anthropic, чьи громкие заявления об эффективности Auto Mode находка ставит под вопрос, и специалистам по безопасности ИИ-агентов, для которых это ещё один задокументированный случай, когда защитный классификатор сам становится частью отказа.
Как это применить
Уиллисон присоединяется к рекомендации Рехбергера: не полагаться на Auto Mode как на единственную защиту. Конкретные меры, запускать автономных агентов-разработчиков в контейнере, виртуальной машине или песочнице на уровне операционной системы; ограничивать им исходящий сетевой трафик; вести мониторинг их действий; и не открывать среде выполнения агента доступ к домашним каталогам, SSH-ключам и облачным учётным данным.
Можно ли доверять
Частично, с оговорками. Автор поста характеризует Рехбергера как одного из самых авторитетных сегодня исследователей атак типа prompt injection, но цифра «80% случаев», это его собственное заявление без указания выборки или методики измерения. Материал не раскрывает, в чём именно заключались громкие заявления Anthropic об эффективности Auto Mode и когда именно режим стал включён по умолчанию, не приводит ответа или комментария Anthropic и не поясняет, относится ли уязвимость конкретно к модели Opus 5 или к Auto Mode как таковому, другие версии Claude Code или другие модели в тексте для сравнения не названы.
Риски и подводные камни
Механика атаки использует то, что при распаковке zip-архива агент выполняет код с импортом модуля base64, не замечая, что тот же импорт заодно подгружает и запускает извлечённый из архива локальный файл struct.py с вредоносным содержимым. Ключевой риск не только в том, что классификатор пропускает такую подмену, но и в том, что в части прогонов он же блокировал команду Claude на остановку уже запущенного вредоносного процесса, то есть защита здесь не нейтральна, а активно мешает исправлению. Команды, которые считают Auto Mode достаточной защитой и запускают Claude Code без дополнительной изоляции, рискуют получить именно этот сценарий: агент не может сам прервать то, что уже пошло не так.
«Классификатор разрешил создание вредоносного процесса, но затем заблокировал команду, предназначенную для его остановки!»
— Саймон Уиллисон, simonwillison.net