Cloudflare разрешила блокировать ИИ-обучение, сохраняя поиск

До сих пор у владельцев сайтов не было хорошего выбора: разрешить обход своего контента для обучения ИИ-моделей или потерять видимость в поисковой выдаче. Дилемма существовала потому, что часть крупнейших организаций интернета использует краулеры смешанного назначения, один и тот же бот одновременно индексирует страницы для поиска и собирает данные для обучения модели: откажешь ему в одном, теряешь и другое. Cloudflare представила настройку «Disallow AI Training» («запретить обучение ИИ»): она публикует в robots.txt запрет именно на обучение, через механизм «Bot Preference Sync» (синхронизация предпочтений по ботам), а поисковая индексация тем же краулером продолжается как прежде. Работает это только для краулеров, которых Cloudflare признаёт «подотчётными» (статус «Accountable»): Applebot, Googlebot и Bingbot, краулеры Apple, Google и Microsoft, уже соответствуют этому статусу или обязались привести краулер в соответствие к определённому сроку.
Разница видна по собственной статистике Cloudflare: поисковых ботов блокирует менее 1% сайтов сети, почти никто, а какой-либо механизм блокировки обучения включили 17% сайтов. Именно этот разрыв, по словам Cloudflare, и показал, что нужен не общий переключатель «блокировать ИИ», а более гранулярные настройки.
Один robots.txt эту задачу не решает: опубликовать его может кто угодно, но файл не способен ни определить, кто именно сканирует сайт, ни понять зачем, ни остановить краулер, который его просто игнорирует. Решить это может только сеть уровня Cloudflare, публикуя предпочтение сайта, распознавая и классифицируя краулеры по поведению, блокируя тех, кто запрет игнорирует, и показывая в сервисе Cloudflare Radar, что каждый оператор делает на практике. С июля Cloudflare вела переговоры с операторами краулеров напрямую; по её словам, почти все согласились, что у владельцев сайтов должны быть контроль и прозрачность в отношении использования их контента и уверенность, что выбор будет соблюдаться. Так появился статус «Accountable»: оператор получает его, если выполняет или обязуется выполнить четыре условия, дать сайтам механизм отказа от обучения через robots.txt или аналогичный стандарт; дать механизм отказа от попадания в ИИ-сводки, сегодня напрямую у самого оператора, а со следующего года, и через единую настройку в Cloudflare; показывать на уровне конкретного URL, какие страницы были доступны для обучения, и метрики о том, как контент появлялся в поиске; и гарантировать, что отказ от обучения не повлияет на обычную поисковую выдачу.
Apple, Google и Microsoft подтвердили, что их смешанные краулеры Applebot, Googlebot и Bingbot соответствуют этим требованиям. Отдельно статус «Accountable» получили краулеры Amazon, Anthropic, Meta и OpenAI, но по другой причине: у этих компаний поисковые и обучающие краулеры изначально разведены как разные боты, поэтому блокировка их обучающего краулера в принципе не затрагивает поиск.
Cloudflare делит поведение ботов на три категории контроля: «Search» (поиск), обход для построения поискового индекса, «Training» (обучение), обход для обучения или дообучения модели, и «Agent» (агент), визиты по прямому поручению человека, например чат-боты, подгружающие страницу по запросу, или браузерные ИИ-агенты. Для каждой категории на уровне домена доступна одна из настроек: «Allow», пропускать всех, кого не блокирует другое правило или правило WAF; «Disallow AI Training», доступна только для категории «Training», публикует запрет в robots.txt через «Bot Preference Sync», оставляет подотчётные смешанные краулеры доступными для поиска и блокирует все остальные обучающие краулеры, включая отдельные обучающие боты Amazon, Anthropic, Meta и OpenAI, не трогая при этом поиск; «Block on pages with ads», блокирует краулеров, включая смешанные, только там, где Cloudflare обнаружила рекламу; «Block», блокирует всех краулеров, включая смешанные, полностью. Раньше «Block» и «Block on pages with ads» не применялись к смешанным краулерам именно потому, что заодно резали бы и поиск; теперь, когда для обучения появилась отдельная «Disallow AI Training», оба этих правила распространяются на смешанные краулеры тоже, то есть блокируют поиск наравне с обучением. Настройки для запрета обучения отдельно на страницах с рекламой нет: Cloudflare умеет определять такие страницы, но их список слишком велик и слишком часто меняется, чтобы перечислить его в robots.txt. Нет пока и настройки запрета для категории «Agent», в интернете ещё не сложился стандарт, как явно выражать такое предпочтение агентам; Cloudflare обещает вернуться к вопросу по мере развития таких стандартов, как «ai-prefs».
Изменения в продуктах «Bot Management» (управление ботами) и «AI Crawl Control» (контроль ИИ-краулеров) вступают в силу с 15 сентября (год в источнике не указан). Настройка «Block AI Bots» («блокировать ИИ-ботов») уходит в прошлое в пользу более гранулярных «Search», «Training» и «Agent»; «Managed Robots.txt» (управляемый robots.txt) заменяется на «Bot Preference Sync», включавшие его клиенты переводятся на новую систему автоматически; «Disallow AI Training» становится частью рекомендуемой конфигурации для некоторых новых доменов. Для подавляющего большинства владельцев сайтов делать ничего не нужно, текущие настройки переносятся сами: домены, никогда не включавшие гранулярные настройки, мигрируют на основе своего прежнего параметра «Block AI Bots», а домены, где эти настройки уже были включены, сохраняют прежний практический эффект, в частности, прежний выбор «Block» или «Block on pages with ads» для категории «Training» становится «Disallow AI Training». Есть только один случай, где нужно действовать: кто хочет убрать смешанные краулеры полностью, включая из поиска, должен теперь явно выбрать «Block», иначе Applebot, Bingbot и Googlebot продолжат индексировать сайт для поиска как обычно. Для новых доменов с 15 сентября Cloudflare при подключении предлагает один из двух готовых наборов настроек, какой именно, зависит от того, зарабатывает ли сайт на рекламе: для рекламных сайтов пресеты строже, потому что доход от рекламы требует живого посетителя, а обучающий или агентский визит просто заменяет собой этот визит, и рекламу в результате никто не видит.
У каждого из трёх операторов свой набор инструментов уже сегодня. Applebot даёт отказаться от обучения правилом «Disallow» для токена «Applebot-Extended» в robots.txt, позволяет выразить отказ от ИИ-сводок директивой «nosnippet» в HTML-коде страницы и поддерживает пометку контента как платного, чтобы исключить его из генеративной выдачи; инструмента видимости на уровне URL у Apple пока нет, но её команда поделилась с Cloudflare деталями решения, которое готовит на следующий год. Googlebot даёт отказ директивой «Google-Extended» в robots.txt, переключателем в панели вебмастера, исключающим контент из генеративных результатов поиска, и метриками о том, как контент появляется в поиске и в ИИ-сводках; Google уже работает над дополнительными инструментами видимости на уровне URL для «Google-Extended» и рассчитывает выпустить их в ближайшие недели. У Bingbot гранулярные настройки и прозрачность, в Webmaster Tools (инструментах для вебмастеров); сегодня отказ от обучения выражается тегом «NOARCHIVE», а Microsoft только строит поддержку такого же предпочтения через сам robots.txt на уровне домена, с целевым сроком в начале 2027 года. Пока эта поддержка не заработала, выбор «Disallow AI Training» в Cloudflare не передаёт предпочтение «без обучения» в Bing через robots.txt автоматически, точно так же вела себя и прежняя настройка «Block» для категории «Training», которая тоже не распространялась на Bingbot как смешанный краулер; чтобы отказаться от обучения в Bing уже сейчас, клиентам Cloudflare нужно, помимо тега «NOARCHIVE», использовать инструмент Bing «Block URLs» (блокировка URL) или «Content Removal» (удаление контента). Apple, Google и Microsoft заявили Cloudflare, что отказ от обучения не влияет на позиции сайта в поиске.
Cloudflare считает обучение и ИИ-сводки разными вопросами: сегодня отказ от попадания в сводки настраивается отдельно у каждого оператора, а цель компании на начало следующего года, дать сайтам одну настройку на своей стороне вместо этого. Текст объявления обрывается на полуслове в разделе о дальнейших планах по ИИ-сводкам, так что подробности этой части неизвестны.
Ключевые факты
- Новая настройка Cloudflare «Disallow AI Training» блокирует в robots.txt только обучение ИИ, оставляя «подотчётные» смешанные краулеры доступными для поисковой индексации.
- Apple (Applebot), Google (Googlebot) и Microsoft (Bingbot) уже соответствуют статусу «Accountable» или обязались привести краулер в соответствие к определённому сроку; отдельно этот статус получили и обучающие краулеры Amazon, Anthropic, Meta и OpenAI, потому что у них поиск и обучение изначально разведены на разных ботах.
- По данным Cloudflare, поисковых ботов блокирует менее 1% сайтов сети, а ботов для обучения ИИ, 17%.
- С 15 сентября старые настройки «Block» и «Block on pages with ads» впервые начинают затрагивать и поиск у смешанных краулеров; кто хочет убрать их из поиска тоже, должен явно выбрать «Block».
- У Bingbot запрет на обучение через сам robots.txt ещё не работает, Microsoft целится на начало 2027 года, а до этого отказ в Bing нужно оформлять отдельно тегом «NOARCHIVE» и инструментами Bing.
Почему это важно
До сих пор технической возможности развести поиск и обучение у одного и того же краулера не было: правило либо выключает бота целиком, либо не выключает вовсе, а часть крупнейших операторов интернета годами использовала для сайтов именно такого смешанного бота. Cloudflare, стоящая перед огромной долей интернета как сеть и защита от ботов, закрывает этот пробел не только технически, новой настройкой, но и институционально: публичным, проверяемым списком операторов, которые обязались её соблюдать. Ключевое здесь не сама настройка, а то, что три крупнейших оператора смешанных краулеров интернета, Apple, Google и Microsoft, впервые публично, с конкретным (хотя бы приблизительным) сроком согласились не наказывать сайт потерей поиска за отказ отдавать контент на обучение.
Кому это важно
Прежде всего, владельцам сайтов на Cloudflare, которые живут с рекламы, подписки или прямых отношений с читателем: у них впервые появляется рабочий рычаг, а не просто запись в robots.txt, которую можно игнорировать. Дальше, операторам смешанных краулеров, Apple, Google и Microsoft, которые теперь публично числятся «подотчётными» и попадают под наблюдение Cloudflare Radar. Отдельно это касается компаний с обучающими краулерами, Amazon, Anthropic, Meta и OpenAI: по умолчанию новая настройка блокирует именно их, если сайт явно не разрешил иное. И косвенно, читателям тех же сайтов: следующим шагом Cloudflare называет такой же контроль над тем, сколько контента сайта попадает в ИИ-сводки, а не только идёт ли он на обучение.
Как это применить
Большинству сайтов на Cloudflare делать ничего не нужно: практический эффект прежних настроек сохраняется автоматически при миграции. Действовать нужно только тем, кто хочет полностью убрать смешанные краулеры, включая из поиска, для этого требуется явно выбрать «Block», иначе Applebot, Bingbot и Googlebot продолжат индексировать сайт как обычно. Для новых доменов с 15 сентября Cloudflare сама предложит один из двух готовых наборов настроек в зависимости от того, зарабатывает ли сайт на рекламе, и его можно поменять в любой момент. Вне Cloudflare те же цели по каждому оператору достигаются напрямую: у Apple, правилом «Disallow» для токена «Applebot-Extended» и директивой «nosnippet» для ИИ-сводок, у Google, директивой «Google-Extended» и переключателем в панели вебмастера, у Bing, тегом «NOARCHIVE» плюс инструментами «Block URLs» или «Content Removal», потому что поддержка отказа от обучения через сам robots.txt у Bing заработает только к началу 2027 года.
Можно ли доверять
Это блог самой Cloudflare про её же новый продукт: компания одновременно автор технологии и автор рассказа о том, насколько ответственно её соблюдают крупные операторы, включая собственных клиентов и конкурентов. В тексте нет ни одного названного по имени человека, ни автора, ни представителя компании: всё написано от институционального «мы». Утверждения о том, что отказ от обучения не влияет на позиции в поиске, это заявления Apple, Google и Microsoft в пересказе Cloudflare, а не независимо измеренный результат. Обе ключевые цифры, доля сайтов, блокирующих поиск, и доля, блокирующая обучение, собственная статистика Cloudflare по собственным клиентам, без внешней проверки. При этом конкретика, точные названия директив, разбивка требований по пунктам, разница в статусе краулеров, читается как инженерное описание, а не как голый маркетинг. Сам текст обрывается на полуслове в разделе про дальнейшие планы по ИИ-сводкам, так что эту часть проверить не на чем.
Риски и подводные камни
У Bing поддержка запрета обучения через сам robots.txt ещё не работает (цель Microsoft, начало 2027 года), и включение «Disallow AI Training» в Cloudflare сегодня не останавливает обучение Bingbot автоматически: нужно отдельно ставить тег «NOARCHIVE» и обращаться к инструментам Bing напрямую, этот пробел легко пропустить. У Apple пока нет инструмента, показывающего, какие именно страницы сайта реально пошли на обучение, обещанное решение выйдет только «на следующий год». Для краулеров-агентов (чат-боты, подгружающие страницу по запросу, браузерные ИИ-агенты) настройки отказа нет вообще, в интернете ещё нет общепринятого способа выразить такое предпочтение. Вся система по-прежнему держится на доверии к самим операторам и на классификации Cloudflare, кто «смешанный», кто «подотчётный», а для тех, кто не подотчётен, единственный рычаг это блокировка, а не гарантия соблюдения правил. И ни этот текст, ни сама настройка ничего не говорят о контенте, который уже пошёл на обучение до того, как владелец сайта поставил запрет, речь только о будущем обходе.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.