正文

4001140439

爬虫开关设错,AI 就搜不到你的独立站

252026.09
来源:本站 行业动态 2026-09-25 阅读:1 GEO AI搜索优化 外贸独立站 Cloudflare

做 AI搜索优化 时最容易被忽略的一环是 AI 爬虫权限。2026 年 9 月 15 日起,Cloudflare 已把 AI 爬虫拆成搜索、训练、Agent 三类独立开关,新域名默认值改为「搜索放行、训练与 Agent 拦截」。照旧一键全封的站点,很可能在不知情的情况下把自己从 ChatGPT、Perplexity 的实时答案里删掉。

三类开关,损失大小完全不对称

  • 搜索类(Googlebot、Bingbot、OAI-SearchBot、PerplexityBot):抓取建索引,用户搜索后能看到你的链接,是「被找到」通路。
  • 训练类(GPTBot、ClaudeBot、CCBot、Bytespider):抓取用于训练或微调模型,是「影响模型长期认知」通路,反馈慢且难测量。
  • Agent 类(ChatGPT-User、Perplexity-User):用户当场提问时即时取页,用于生成带引用的回答,是「当场被引用」通路。

三者有一个关键的不对称:封训练类是长期、低精度的损失,模型对你的认知少一点,一时看不出来;封搜索类和 Agent 类是即时、具体的损失——买家提问的那一刻,你的页面进不了候选池。对绝大多数外贸独立站来说,要限制就限制训练类,把检索与引用通路留着,这是配置的总原则。

各引擎怎么控制

各厂商开关形式不统一,照抄同行的 robots.txt 极易出错。截至 2026 年 9 月:停 Google 训练与 grounding,拒绝 `Google-Extended` 即可,不影响搜索排名;管 Google 搜索与 AI Overviews 露出,旋钮是 Googlebot 抓取权限与 `nosnippet` 摘要指令。OpenAI 把训练与搜索拆成 `GPTBot` 与 `OAI-SearchBot`,Anthropic 亦然。

这里有个被误传极广的说法要更正:拒绝 `Google-Extended` 并不会让你退出 AI Overviews。 Google 在 Search Central 文档里写明,该 token「不是排名信号,也不影响内容出现在 Google 搜索中」,它只约束 Googlebot 已抓到的数据能否用于训练 Gemini 与 Vertex AI;决定 AI Overviews 资格的是 Googlebot 能否抓取、页面有无 snippet 资格。换言之,Google 侧对 AI搜索可见度 有分量的开关只有两个方向:把 Googlebot 放进来,再用摘要指令控制露出粒度。 用 Google-Extended 去「屏蔽 AI」,是在错的旋钮上拧。这也是我们 Google SEO 全案服务 审计时必查的一步。

新默认值里藏着一个误伤风险

Cloudflare 已把 Googlebot、Applebot、Bingbot 归为「混合用途爬虫」(同一 user agent 既做搜索索引、又参与训练),并在文档中说明:任何拦截训练类的配置,会连带拦截搜索与训练二合一的那类爬虫条目。 也就是说,管理层嘴上说的是「只关训练」,落到 robots.txt 层面,Googlebot 存在被误伤的可能。

还需说清一点:robots.txt 是声明,不是访问控制,只对愿意遵守的爬虫生效,已有记录显示部分爬虫在站点拒绝后仍通过未声明代理访问。

出海站的配置自查清单

按我们做出海站与 Google 优化的经验,建议按此顺序过:

  1. 确认 Googlebot 与 Bingbot 未被误封。 若因「AI 偷内容」关掉这两个,等于同时失去传统搜索、AI Overviews 和 Copilot 三条通路。
  2. 训练类单独关,检索类保持开。 关掉 GPTBot、ClaudeBot、CCBot、Bytespider,保留 OAI-SearchBot、PerplexityBot,这是「省流量、不丢引用」的核心配置。
  3. Agent 类保持放行。 很多运营看到「AI 抓取量暴涨」就顺手封了 ChatGPT-User,后果是 ChatGPT 当场回答不再引用你的页。
  4. 读完自动生成的 robots.txt 再上线,并纳入季度复查。 爬虫名称与职能边界并不稳定,今天写得对的名单两个季度后可能已失效。

四项里真正影响效果的是第 2、3 项——保留检索与 Agent 通路,封掉训练,其余为防误操作的安全网。

最后提醒一句:这轮变更不应被理解成「做了就能被 AI 推荐」。爬虫放行只是入场券,能否被引用仍取决于内容是否具备信息增益、是否结构化、是否有可交叉验证的可信表述。它解决的是「有没有资格进候选池」,而非「AI 会不会选你」——这也是我们坚持把爬虫权限审计与内容资产建设放在同一张清单的原因。

常见问题

封掉 AI 爬虫会影响 Google 排名吗?

分开看:封训练类且有独立 token 时对排名无影响;但在 Cloudflare 上直接 Block 训练类,因 Googlebot 等属混合用途爬虫,存在连带风险,改完必须实测。

Google-Extended 到底控制什么?

它控制 Googlebot 已抓取的数据能否用于训练和 grounding Gemini 与 Vertex AI。Google 官方说明它不是排名信号,不影响内容是否出现在搜索里,也不决定 AI Overviews 资格——它是训练开关,非可见度开关。

封掉 ChatGPT 的爬虫,会让 ChatGPT 不再推荐我吗?

要看封哪一个。封 `OAI-SearchBot` 会使站点不再出现在 ChatGPT 搜索的答案里;封 `GPTBot` 只影响模型训练,两个 token 必须分开决策。

robots.txt 拒绝后,爬虫就真的不来了吗?

不一定,它只对遵守规则的爬虫有效,真要强制拦截需在 WAF 层做限制。建议按季度比对日志与当前 robots.txt。

这两件事要做对,前提是站点结构本身可抓取、可索引,这也是 外贸独立站建设 阶段的功课。

Copyright © 2005- Sagetessa.com All rights reserved.
苏州贤哲互联科技有限公司版权所有 | 苏ICP备19006806号-1 | 苏公网安备32058102001872 | lcons by lcons8 | 数据保护 | 隐私政策
网警可信网站身份验证网站认证防黑联盟CyberVadis国际安全认证