Cloudflare 9 月 15 日改了默认值:帮顾客下单的 AI 代理可能进不来了

一个开关拆成了三个,7 月就改完了

以前 Cloudflare 那边只有一个”拦 AI bot”的开关,按下去所有带 AI 字样的爬虫一起挡。7 月改了,变成 Search、Agent、Training 三类,每类独立开关,可以只拦其中一类。

三类的定义是 Cloudflare 自己写的,照抄过来:Search 是”索引你的内容、以便之后回答关于它的问题的爬虫”;Agent 是”实时代表某个人执行的自动化行为,比如聊天类的抓取 bot”;Training 是”把你的内容拿去训练或微调模型的爬虫”。

这个拆法比原来那种”训练爬虫 / 检索爬虫”两分法多出来的,就是 Agent 这一类。检索爬虫和 Agent 听起来像一回事,其实差在时机:Search 是提前把你的页面收进索引,等以后有人问再答;Agent 是此刻有个真人在跟 AI 说话,AI 现场去打开你那个链接。前者挡了你晚点还有机会被收,后者挡了就是这个买家当场看不到你的商品页。

Cloudflare 分类定义买家那头正在干什么9 月 15 日新默认值
Search索引内容,以便之后回答相关问题还没提问,内容先被收进索引放行
Agent实时代表某个人执行的自动化行为,比如聊天类抓取 bot正在跟 AI 对话,AI 现场打开你的页面带广告的页面上拦
Training拿内容去训练或微调模型无对应动作,抓走的内容进模型带广告的页面上拦

有一条得写清楚:同时做 Search 和 Training 的多用途爬虫,会被 Training 那条默认规则拦掉。Cloudflare 的原话就到这儿,没有点名具体是哪几个爬虫,别自己往下推。

拆开管的好处是你终于能做出”内容不给训练,但买家的 AI 助手随便进”这种配置。原来那个单一开关做不到,要么全拦要么全放,很多店为了保住 AI 里的曝光,只能连训练一起放行。现在这两件事可以分开决定。

9 月 15 日那条默认值,管的是谁

这条默认值有两个限定词,缺一个意思就变了。

第一个限定词是”新接入”。9 月 15 日起新接到 Cloudflare 的域名,拿到的是新默认值。已经在用的老客户设置不动,除非自己主动选了新默认值;在 9 月 15 日之前,老客户随时可以退出。

第二个限定词是”带广告的页面”。新默认值不是全站拦,是在展示广告的页面上,把归到 Training 或 Agent 的 bot 拦掉,Search 照常放行。

所以要担心的是这几种情况。你换了服务商、做了迁移,或者代运营重新给你接了一遍 Cloudflare,这就算新接入。你自己在后台顺手点了”用新默认值”。你的博客、测评、导购这类内容页挂了广告位或者联盟带货组件。这里面占了任何一条,都得回去看一眼实际设置。

没中的也别直接跳过。默认值这种东西改过一次就会再改,而且后台开关显示的状态跟边缘层实际执行的未必一致,看一眼的成本是五分钟。

Agent 这一类离你的成交最近

一个买家在 ChatGPT 里说”帮我看看这条裙子还有没有 M 码、多少钱”,AI 会现场去打开你那个商品页读价格和库存。这个动作落在 Agent 这一类里。它被拦掉,买家收到的是”我打不开这个页面”,然后 AI 转头去说另一家。

这跟 Search 被拦的后果不一样。Search 被拦是慢性的,你从索引里一点点掉出去,两三个月后才发现被提及次数下来了。Agent 被拦是当场的,买家这一次购物对话里你直接出局,而且你在任何后台都看不到这笔丢掉的生意,因为它连一次页面访问都没产生。

更麻烦的是这两类在你的日志里长得不太像能区分开的样子。很多 bot 的 User-Agent 里并不写自己属于哪一类,归类是 Cloudflare 那边做的判断。所以想知道哪个 bot 被划进了 Agent,只能进后台打开那一栏看它列出来的名单,不能凭 bot 名字猜。

Agent 类的请求还有个特点,量很小。一个买家一次对话可能就打你三五个请求,在日志里跟正常流量比几乎看不出来。流量面板上不会有异常曲线可看,得自己进后台翻设置,再拿真实对话去测一遍。

自查清单:进后台看哪几处

第一步,确认域名确实在 Cloudflare 后面,并且找到 AI Crawl Control 这个功能。深链是 dash.cloudflare.com 里 /:account/:zone/ai 这个地址,直接打开比一层层翻菜单快。打不开的话,先排查是套餐里没有这一项,还是你这个账号角色的权限不够。

第二步,看 Search、Agent、Training 三个开关分别是什么状态。重点是 Agent 那一栏,确认它现在是放行还是拦截。如果你是 9 月 15 日之后接入的,默认值已经生效,这里大概率不是你想要的状态。

第三步,看 Cloudflare 在 Agent 这一类下面列了哪些 bot,抄下来。这份名单就是权威答案,你想放行哪几个、要不要整类放行,都得对着它决定。别用”OAI-SearchBot 应该算 Search”这种推测来配置规则。

第四步,去 WAF 和防火墙规则里再看一遍。AI Crawl Control 是一层,你或者上一任运维写的自定义规则是另一层,两层的结论可能对不上。常见的情况是后台显示放行、实际请求在边缘被某条自定义规则掐掉,只看开关状态是查不出来的。

第五步,如果你的站有广告位或者联盟组件,把挂了这些东西的页面单独列出来。新默认值只在这类页面上生效,所以商品详情页干净、内容页被拦,这种半开半关的状态最容易漏掉。

怎么验证一个真买家的 AI 助手能打开你的商品页

最直接的验证是拿真实入口测。复制一个商品页链接,粘到 ChatGPT 和 Perplexity 里,让它读出价格、尺码或者库存状态。它要是答出了页面上的具体数字,说明 Agent 那一类的抓取过来了;它要是说打不开这个链接或者内容拿不到,那就是被挡在外面了。

用 curl 伪造 User-Agent 去试这一步不太靠得住。很多 bot 走的是验证过的 IP 段,你从一台普通机器发一个伪造 UA 的请求,被 403 掉也可能是因为 IP 对不上,而不是因为这个 bot 类别被拦了,容易得出一个虚惊一场的结论。用真实的 AI 对话去测,测的是买家实际会走的那条路。

服务器日志还是主线证据。把你在第三步抄下来的那份 Agent bot 名单拉出来,看它们最近的请求返回的是 200 还是 403。日志会老老实实告诉你 bot 到底进没进来,比后台开关的显示可信。

带广告的页面和不带广告的页面各测一遍。新默认值只在前者生效,只测商品详情页会漏掉一半的问题。改完配置之后隔几天再测一次,抓取恢复和 AI 重新把你纳进答案都需要时间。

相关文章

Google Content API 关停了:不迁到 Merchant API,你的商品流 9 月起开始报错

Content API for Shopping 已于 2026 年 8 月 18 日关停,9 月 1 日起请求开始渐进式报错。替代品是 Merchant API,商品上传、库存管理、账号管理、跟 Google Ads 打通都搬了过去。这篇讲怎么在半小时内查清自己走的是不是旧 API、流断了之后哪些东西会黑掉、以及来不及迁移时那张延期表单怎么用。

AI 流量控制方案横评 2026:Cloudflare、Akamai、Vercel 的分类口径差在哪

Cloudflare 在 2026 年 7 月把 AI 爬虫拆成 Search、Agent、Training 三类分别管控,Akamai 分成训练爬虫、搜索爬虫、fetcher,Vercel 的 AI bots 规则集按训练、搜索、用户触发抓取分。三家切法几乎一样,名字和默认动作不一样。这篇按选型角度对比,最后给三种卖家的配置建议。