Anthropic включает auto mode по умолчанию в Claude Code

Anthropic включает auto mode по умолчанию в Claude Code

Anthropic делает auto mode, режим, в котором Claude Code выполняет действия без запроса подтверждения на каждом шаге, режимом по умолчанию для новых сессий в тарифах Pro, Max и Team начиная с 14 августа. Об этом в своём блоге написал независимый обозреватель Саймон Уиллисон, опираясь на новую статью Anthropic с оценками безопасности auto mode.

На неформальной беседе (Fireside Chat) на конференции AI Engineer World's Fair сотрудники Anthropic Кэт Ву и Тарик Шихипар рассказали, что практически каждый сотрудник компании внутри пользуется auto mode. По словам Ву, компания «практически нейтрализовала все атаки», и по ключевым категориям риска, prompt injection (внедрение вредоносных инструкций через контент, который обрабатывает агент) и утечка данных, риски «значительно ниже, чем у среднего человека-ревьюера».

Опубликованные оценки включают тест на 1053 платных тестерах: в середине сессии одно из обычных приглашений подтвердить действие незаметно подменялось на явно опасную команду, и фиксировалось, одобрит ли её тестировщик. Отказались выполнить опасное действие лишь 13,6% людей-тестировщиков. Auto mode, по расчётам Anthropic, заблокировал бы 89% тех же опасных действий, то есть в оставшихся 11% случаев не предотвратил бы их.

Отдельно Anthropic заказала у сторонней компании Trajectory Labs оценку защиты от непрямого prompt injection: та протестировала последние публично доступные на 17 июля 2026 года версии Claude Code и Codex на 72 сценариях внедрения инструкций, скрытых от самой Anthropic. Из 720 попыток атаки ни одна не увенчалась успехом против моделей Claude Fable 5, Opus 5 и Sonnet 5, работающих в auto mode.

Уиллисон соглашается, что auto mode, решение лучше, чем требовать от человека постоянно нажимать «ОК» (усталость от подтверждений реальна и сама по себе безопасности не гарантирует), но остаётся скептичен насчёт заявлений о prompt injection: он хочет независимого подтверждения результатов и приводит гипотетический пример атаки через вредоносный пакет, который инструктирует агент сначала выполнить команду вида uvx fetch-model-files . под видом загрузки файлов моделей для тестов, а затем запустить сами тесты, при этом сам fetch-model-files может незаметно похищать данные. Уиллисон признаётся, что не понимает, как какая-либо версия auto mode защитила бы от подобной атаки через цепочку поставок.

Ключевые факты

  • С 14 августа auto mode станет режимом по умолчанию для новых сессий Claude Code на тарифах Pro, Max и Team.
  • В тесте на 1053 платных тестерах лишь 13,6% людей отказались выполнить незаметно подменённую опасную команду; auto mode заблокировал бы 89% таких действий, но не оставшиеся 11%.
  • Сторонняя лаборатория Trajectory Labs проверила защиту от непрямого prompt injection на 72 сценариях против Claude Code и Codex: из 720 попыток атаки ни одна не прошла против Claude Fable 5, Opus 5 и Sonnet 5 в auto mode.
  • Саймон Уиллисон хочет независимого подтверждения результатов и указывает на риск атаки через вредоносный пакет в цепочке поставок, от которой auto mode может не защитить.

Почему это важно

Anthropic делает auto mode стандартным поведением Claude Code, ссылаясь на собственные оценки безопасности: в тесте с людьми только 13,6% тестировщиков отказались выполнить опасную команду, тогда как auto mode заблокировал бы 89% таких действий, а в тесте на prompt injection ни одна из 720 атак стороннего оценщика не прошла против auto mode. Для отрасли, где риск бесконтрольных действий агента и внедрения вредоносных инструкций сдерживал массовое использование ИИ-агентов, это заявка на снятие главного барьера.

Кому это важно

Разработчикам и командам, использующим Claude Code на тарифах Pro, Max и Team, с 14 августа поведение по умолчанию меняется для всех новых сессий. Важно и техническим руководителям и специалистам по безопасности, оценивающим риски внедрения ИИ-агентов в рабочие процессы компании.

Как это применить

С 14 августа 2026 года auto mode становится настройкой по умолчанию для новых сессий Claude Code на тарифах Pro, Max и Team; тем, кто хочет сохранить прежнее поведение с подтверждением каждого шага, нужно явно переключить настройку обратно вручную.

Можно ли доверять

Оценки, не независимые в строгом смысле: тест на 1053 тестерах и статья с результатами опубликованы самой Anthropic, а проверку prompt injection делала сторонняя Trajectory Labs, но по заказу Anthropic и по 72 сценариям, скрытым лишь от самой Anthropic, а не выбранным независимо. Саймон Уиллисон прямо пишет, что хотел бы увидеть независимое подтверждение, прежде чем поверить, что проблема prompt injection для Claude Code решена.

Риски и подводные камни

Даже в лучшем случае, по собственным данным Anthropic, auto mode не остановил бы 11% опасных действий, которые пропустили человеческие тестировщики. Уиллисон приводит пример атаки через вредоносный пакет с инструкцией сначала выполнить команду вроде uvx fetch-model-files . под видом загрузки моделей, а затем, тесты; такой пакет мог бы незаметно похитить данные, и он не уверен, что какая-либо версия auto mode способна распознать подобную атаку через цепочку поставок.