15 сентября Cloudflare обновил правила доступа ИИ-ботов к сайтам. Блокируя сбор данных для обучения, можно заодно закрыть поиск: некоторые боты выполняют обе задачи. Я разобрал исследование Seensure по 1 046 сайтам. После обновления запросы от имени обучающих ботов стали блокировать чаще, а поисковых — реже. Это тест с подставленными именами, поэтому он не доказывает доступ настоящих краулеров. Настройки стоит проверить по категориям, а реальный доступ — по логам запросов.

Какие настройки Cloudflare разделяют доступ для поиска и обучения нейросетей

Cloudflare AI делит ИИ-трафик на три категории: Search (индексирует контент, чтобы отвечать на вопросы), Agent (действует в реальном времени от имени человека, например ChatGPT-User) и Training (забирает контент для обучения модели). Для каждой категории есть три режима: блокировать везде, блокировать на страницах с рекламой, не блокировать. Это доступно на всех тарифах, включая бесплатный (changelog от 1 июля). С 15 сентября у Training появился четвёртый режим, Disallow AI Training.

С 15 сентября новым доменам при подключении предлагается готовый набор настроек. Для сайта с рекламой Search разрешён, Training идёт в режиме Disallow AI Training, Agent блокируется на страницах с рекламой (блог Cloudflare). Старый переключатель Block AI Bots объявлен устаревшим, настройки существующих сайтов переносятся в новые категории по таблице из того же блога. Фразы о том, что новое умолчание включили всем бесплатным сайтам, я в документах Cloudflare не нашёл.

Как исследователи проверяли доступ ИИ-ботов к сайтам

Seensure продаёт мониторинг доступа ИИ-краулеров к сайтам, интерес у компании есть. Зато слабые места данных они описывают сами: сайты в основном молодые: 894 взяты из журналов свежих сертификатов, 152 — из каталога агентств. За Cloudflare стоят 746 из них, 300 — без него. За день до изменения и через день после каждый сайт опрашивали десятью запросами подряд: браузер, восемь ботов и снова браузер для контроля шума.

Пробник Seensure подписывается в User-Agent именем GPTBot и добавляет свой заголовок X-SeenSure-Probe (описание проверки). В прошлом исследовании авторы сами писали, что Cloudflare проверяет подлинность краулера по IP, обратному DNS или подписи, а строка user agent ничего не доказывает. На странице с новыми результатами этой оговорки нет, вывод мой: цифры показывают ответ на самозваного бота, а не на краулер OpenAI.

Что показала проверка сайтов с имитацией ИИ-ботов после обновления Cloudflare

Доля отказов (HTTP 400 и выше) среди сайтов, ответивших браузеру, по таблице Seensure:

Краулер

Категория

До

После

ClaudeBot

Training

19,9%

22,8%

GPTBot

Training

18,9%

22,0%

PerplexityBot

Search

16,0%

3,2%

OAI-SearchBot

Search

16,9%

3,0%

ChatGPT-User

Agent

16,4%

2,8%

Claude-SearchBot

Search

15,4%

2,4%

Perplexity-User

Agent

14,9%

2,2%

Claude-User

Agent

14,7%

1,5%

Обычный браузер

контроль

0,0%

0,0%

Обоим обучающим ботам стали отказывать примерно на три пункта чаще. Каждый из шести остальных потерял около 13 пунктов. Сайты без Cloudflare и повторный запрос браузера не сдвинулись, а любое из восьми изменений больше фонового дрейфа, то есть разницы между двумя повторами тех же запросов за четыре дня перед первой проверкой. Если оставить только сайты за Cloudflare из журналов сертификатов, все шесть поисковых и агентских ботов просели на 20–22 пункта: в общей цифре сдвиг разбавлен сайтами без Cloudflare.

Обещание Cloudflare и сдвиг отказов по трём категориям ботов: обучение — чаще, агенты и поиск — в разы реже
Совпало с анонсом только обучение: агенты и поиск ушли вниз.

Seensure прямо пишет, что агенты сдвинулись в обратную сторону от того, что предсказывает ужесточение умолчаний, а сильнее всего сдвинулся поиск, который трогать не собирались. Seensure причину не называет, в материалах Cloudflare, которые я нашёл, объяснения тоже нет. Моя гипотеза ничем не проверена: новая схема иначе обрабатывает самозваных ботов.

Правило из анонса, реклама плюс Cloudflare, задело бы около 0,7% сайтов в более широком наборе Seensure. Из 3 535 рассмотренных хостов ответили 2 090, и Cloudflare вместе с рекламой нашлись у 15. Авторы называют это нижней оценкой: молодые домены реже показывают рекламу.

Весь веб эти сайты не представляют, Seensure предупреждает об этом сам. Сравнение до и после одно, с разницей в два дня, повтор обещан в декабре.

Как проверить блокировку Cloudflare для ИИ-ботов на своём сайте

Восемь имён ведут себя по-разному, поэтому проверять надо каждое. Этот скрипт ходит на страницу браузером и восемью именами и печатает код ответа и наличие заголовка cf-ray, то есть был ли на пути Cloudflare.

#!/usr/bin/env bash
# запуск: ./probe.sh адрес-вашей-страницы
url="$1"
UAS=("Mozilla/5.0 (X11; Linux x86_64) Chrome/130.0 Safari/537.36"
  GPTBot OAI-SearchBot ChatGPT-User ClaudeBot Claude-SearchBot
  Claude-User PerplexityBot Perplexity-User)
for ua in "${UAS[@]}"; do
  hdr=$(curl -s -o /dev/null -D - -m 10 -A "$ua" "$url")
  code=$(printf '%s' "$hdr" | grep -i '^HTTP/' | tail -1 | awk '{print $2}')
  ray=$(printf '%s' "$hdr" | grep -ci '^cf-ray:')
  printf '%-20s %s cf-ray=%s\n' "${ua:0:20}" "$code" "$ray"
  sleep 0.3
done

-D - выводит заголовки в stdout, -o /dev/null отбрасывает тело, grep считает cf-ray. Код берётся из последней статусной строки: сайт за Cloudflare может сначала прислать 103 Early Hints.

Подставить user agent GPTBot значит получить ответ для непроверенного бота, поэтому скрипт показывает правила для имени, а не доступ настоящего краулера. Заголовок cf-ray был у 94,5% отказов у Seensure, но он говорит лишь, что Cloudflare стоял на пути: 403 мог вернуть и сервер сайта. Настоящий доступ видно в логах сервера по IP краулеров и в разделе AI Crawl Control панели Cloudflare.

Режимы лучше выставить явно: в Security Settings → Configure AI bot policies задать Search, Training и Agent по отдельности. Search отвечает за обход для ИИ-поиска, и сайту, которому нужна видимость в ответах, его не блокируют; по данным Cloudflare, поисковых ботов блокирует меньше 1% сайтов. Для смешанных краулеров Applebot, Bingbot и Googlebot выбирайте Disallow AI Training: режим Block с 15 сентября отключает их целиком, вместе с поиском. Для Bingbot есть исключение: запрет обучения через robots.txt Microsoft планирует поддержать к началу 2027 года. До этого режим Disallow AI Training такой запрет ему не передаёт; для Bing действует мета-тег NOARCHIVE.

Почему разрешение в robots.txt не гарантирует ИИ-боту доступ к сайту

Cloudflare сам пишет, что директива robots.txt сама по себе проблему не решает: её может опубликовать кто угодно. Краулер, который соблюдает robots.txt, попадает на страницу, только когда открыты и robots.txt, и правило. Того, кто robots.txt игнорирует, остановит только правило.

Три места, где запрос краулера может остановиться: robots.txt, правило Cloudflare или WAF и сервер сайта
Robots.txt краулер читает сам, а правило Cloudflare и сервер сайта решают за него.

В августовском исследовании Seensure кроме 624 сайтов проверил 14 сайтов агентств, где сервер отказывал краулеру. Их правила называли только старые user agent, новых имён вроде Claude-SearchBot, Claude-User и Perplexity-User не упоминало ни одно. У двух из них robots.txt разрешал краулер, которому сервер отдавал 403.

Список имён в правилах сервера и в robots.txt стоит хотя бы раз сверить с восемью именами из таблицы Seensure.

Если у вас за Cloudflare есть логи настоящих GPTBot и OAI-SearchBot до и после 15 сентября, напишите в комментариях, сдвинулись ли отказы им так же, как пробнику. Без таких логов непонятно, какая часть сдвига относится к живым краулерам.

Комментарии (2)


  1. gotham_engineer
    08.10.2026 07:38

    Доброго времени суток) Гипотеза насчет проверки подлинности краулеров выглядит наиболее правдоподобно..сloudflare уже давно умеет валидировать оригинальные ip и обратные DNS для крупных игроков так сказать ( вроде OpenAI или google). Тот факт, что в тесте Seensure просели именно поисковые и агентские боты, которые отправлялись обычным curl с подмененным User-Agenт = доказывает что WAF начал жестче отсекать самозванцев. Настоящих ботов эти изменения, скорее всего, вообще не затронули. Скрипт полезный ваш, спасибо, наглядно показывает, как сайт выглядит для простейших парсеров)


  1. ig_novvv Автор
    08.10.2026 07:38

    Спасибо за замечание! Да, Cloudflare умеет проверять подлинность ботов, и одной строки User-Agent для этого недостаточно.

    Гипотеза правдоподобная, но сам результат теста ещё не доказывает, что сработала именно проверка подлинности. Причину блокировки нужно смотреть в Security Events. Утверждать, что настоящих краулеров изменения не затронули, по этому тесту тоже нельзя.

    Вы точно обозначили разницу: скрипт показывает реакцию сайта на запросы с разными User-Agent с нашего IP. Для проверки доступа настоящих ботов нужны их подтверждённые запросы в логах и сведения о сработавших правилах