简短回答:查三处。第一,打开 你的域名/robots.txt,看有没有挡 OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、Bingbot 这些「检索爬虫」。第二,如果你的域名接了 Cloudflare,看它的 AI 爬虫设置。第三,用 curl 带上爬虫的名字请求一次首页,看回 200 还是 403。Shopify 默认的 robots.txt 不挡 AI 爬虫,问题多半出在后来加的规则和自己套的 CDN 上。

先分清:检索爬虫要放行,训练爬虫可以挡

爬虫就是自动访问网页、把内容带回去的程序。各家 AI 公司都把爬虫分成了两类:一类在回答问题时去搜、去读(检索),一类收集内容训练模型(训练)。想出现在 AI 的回答里,要放行的是检索类。训练类挡不挡,按各家官方说法,不影响你出现在回答里。

AI要放行(检索)挡了不影响回答(训练)注意
ChatGPT 搜索OAI-SearchBotGPTBot挡了 OAI-SearchBot,就不会出现在 ChatGPT 搜索的回答里,最多剩一个导航链接。两个开关互相独立。
PerplexityPerplexityBot(PerplexityBot 本身不用于训练)Perplexity-User 是用户提问时的临时访问,官方说它一般不看 robots.txt。
Google AI 概览 / AI ModeGooglebotGoogle-Extended用的就是 Google 搜索的索引,没有单独的 AI 爬虫。
Gemini AppGooglebot,且别挡 Google-Extended无Google 说 Google-Extended 也管 Gemini App 联网回答时能不能用你的内容。
CopilotBingbot(没有单独的训练开关)别给想被引用的页面加 noarchive 或 nocache。
ClaudeClaude-SearchBot、Claude-UserClaudeBotAnthropic 说只认 robots.txt,按 IP 屏蔽不一定可靠。
Apple(Siri、Spotlight)ApplebotApplebot-Extendedrobots.txt 没提 Applebot、但提了 Googlebot 时,Applebot 照 Googlebot 的规则走。

表里每一格都来自各家自己的爬虫说明页,链接在文末「来源」。

看 robots.txt:有没有点名挡检索爬虫

robots.txt 是放在网站根目录的一个文本文件,告诉爬虫哪些地方别来。在浏览器里打开 你的域名/robots.txt 就能看到。要找的是这种写法(示意):

User-agent: OAI-SearchBot
Disallow: /

User-agent: *
Disallow: /

第一段只挡 OAI-SearchBot;第二段挡所有爬虫,连 Googlebot 一起挡了。只要检索爬虫的名字下面跟着 Disallow: /,这扇门就是关的。

Shopify 店:每个店都有默认的 robots.txt。Shopify 帮助页列的默认规则只挡后台、购物车、结账、账户、订单和带筛选、排序参数的集合页,商品、集合、页面、博客、政策页都允许抓取。我们 2026 年 10 月 8 日打开了 Shopify 官方 Dawn 主题演示店的 robots.txt,里面只有 User-agent: * 和 adsbot-google 两组规则,没有挡任何 AI 爬虫。

如果你的 robots.txt 跟默认的不一样,多半是有人在主题里加了 robots.txt.liquid。位置是:Shopify 后台 → 在线商店 → 主题 → 「⋯」→ 编辑代码 → templates 文件夹。Shopify 建议用 Liquid 增删规则,不要整份换成纯文本;想回到默认,删掉这个文件就行。改动立刻生效,但 Shopify 也说了,爬虫不一定马上反应(Shopify 说明)。

WordPress / WooCommerce:WordPress 默认生成的 robots.txt 只挡后台 /wp-admin/,不挡 AI 爬虫。插件、主机商和 CDN 都可能改过它,以你实际打开看到的为准。

看 Cloudflare:有没有替你挡了

很多独立站前面接了 Cloudflare 做加速和防护(这类服务叫 CDN)。它可以在 robots.txt 之外,直接把爬虫拦下来。

  • 2025 年 7 月 1 日起,新接入 Cloudflare 的域名,注册时就会被问要不要允许 AI 爬虫,Cloudflare 自己称之为「默认屏蔽」(新闻稿)。
  • Cloudflare 现在把 AI 爬虫分成三类:Search(建索引,以后回答问题用)、Agent(替用户实时访问,比如聊天里的抓取)、Training(训练模型)。2026 年 9 月 15 日起,新域名的默认是:Training 和 Agent 在有广告的页面上被挡,Search 放行(Cloudflare 文档)。既做搜索又做训练的爬虫,在任何「挡训练」的设置下都会被挡。
  • 它的「managed robots.txt」打开后,会在你的 robots.txt 前面插一段挡 AI 爬虫的规则。文档里的示例挡了 Amazonbot、Applebot-Extended、Bytespider、CCBot、ClaudeBot、Google-Extended、GPTBot 和 meta-externalagent。其中挡 Google-Extended 这一条会影响 Gemini App。想在 Gemini App 里被引用,就别开这项,自己写 robots.txt。

去哪看:Cloudflare 后台 Security → Settings,筛选 Bot traffic,看「Configure AI bot policies」三类各是 Block 还是 Allow,以及 Bot Fight Mode 开没开。再到 AI Crawl Control 的 Crawlers 标签,逐个看爬虫是 Allow 还是 Block;Metrics 标签能按状态码看,免费版只显示最近 24 小时(Cloudflare 文档)。

Shopify 店:Shopify 说,网络层的爬虫管理由 Shopify 直接处理,你不需要做什么;它不建议在 Shopify 前面再套一层代理,也不为这种配置提供支持。所以 Shopify 店主要查的是:有没有自己在前面套过 Cloudflare。

示例:Shopify 社区有店主问,Cloudflare 2025 年 7 月起的默认 AI 爬虫拦截,会不会影响 Shopify 店和 AI 购物助手找到商品。按 Shopify 的官方说法,没自己套 Cloudflare 的店,网络层由 Shopify 管。

用 curl 假装成爬虫请求一次:只是粗测

curl 是 Mac 和 Linux 自带的命令行工具。-A 后面跟的是爬虫的名字(user agent),下面两个是 OpenAI 和 Perplexity 官方文档里写的原文:

$ curl -s -o /dev/null -w "%{http_code}\n" \
    -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot" \
    https://theme-dawn-demo.myshopify.com/
200
$ curl -s -o /dev/null -w "%{http_code}\n" \
    -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" \
    https://theme-dawn-demo.myshopify.com/
200

真实输出:Shopify 官方 Dawn 主题演示店,2026 年 10 月 8 日。把网址换成你自己的店。

  • 200:这次请求通了。
  • 403、503,或者跳到验证页:被拦了。把 -o /dev/null -w … 换成 -sI 看响应头;如果有 cf-mitigated: challenge,Cloudflare 文档说这就是它的验证页。

为什么只是粗测:Cloudflare 认定「已验证的爬虫」,靠的是加密签名、爬虫公司公布的 IP 段或反向 DNS,不只看 user agent。你从自己电脑发的请求,IP 不在 OpenAI 公布的范围里。所以结果两头都可能不准:你被挡了,真爬虫可能能进;你通了,按 IP 设的规则照样可能挡住真爬虫。最终以服务器或 CDN 日志里真爬虫的状态码为准。OpenAI、Perplexity、Anthropic 都公布了各自爬虫的 IP 列表,可以拿来核对日志里的访问是不是真的。

最省事:一行命令全查一遍

geo-score 是我们开源的检查工具(MIT 协议,电脑上有 Python 3 就能跑,不用另装别的)。它会读你的 robots.txt,再用十个检索爬虫的 user agent 各请求几页,看有没有被区别对待,还会看正文是不是要等 JavaScript 跑完才出来:

$ curl -sL https://raw.githubusercontent.com/jianruntech/geo-score/v1.8.0/cli/geo_score.py \
    | python3 - yourstore.com --brief

报告第一组「Reachable」就是门槛,三行分别是:robots.txt 有没有放行、检索爬虫实际能不能访问、正文是不是服务端直接给出。拿上面那家演示店跑一遍:

  Reachable 13/15
   ✓ Crawlers allowed in robots.txt   5/5
   ✓ Reachable to retrieval agents    5/5
   ◐ Main content server-rendered     3/5

真实输出(只截了 Reachable 这一组):Shopify 官方 Dawn 主题演示店,geo-score 1.8.0,2026 年 10 月 8 日。前两行满分,说明门是开的;第三行只拿了一部分:抽查的页面里,只有一部分页面的正文直接写在服务器返回的 HTML 里。geo-score 也是从你的电脑发请求,上一节说的局限一样适用。

查到被挡了,怎么改

  1. robots.txt:删掉检索爬虫名字下面的 Disallow: /。Shopify 改 robots.txt.liquid,或者直接删掉它回到默认。
  2. Cloudflare:AI bot policies 里 Search 设为 Allow;AI Crawl Control 里把上表的检索爬虫设为 Allow。如果 Bot Fight Mode 在拦它们,注意 Cloudflare 说这个模式没法用 WAF 自定义规则绕开,要么关掉,要么换成 Super Bot Fight Mode,把「Verified bots」设为 Allow。
  3. 训练爬虫:挡不挡由你定。只有 Google-Extended 例外,它会影响 Gemini App。
  4. 改完当天复测:重跑 geo-score 和 curl。OpenAI 和 Perplexity 说 robots.txt 改动大约一天内在它们系统里生效;它们什么时候回来重新抓你的页面,没有官方时间,见新页面多久能被收录。

常见问题

挡了 GPTBot,是不是就不会出现在 ChatGPT 里了?

不会。OpenAI 说 GPTBot 管训练,OAI-SearchBot 管搜索,两个设置互相独立。可以挡 GPTBot、放行 OAI-SearchBot。

我用 Shopify,要不要自己接 Cloudflare 来管爬虫?

不用。Shopify 说网络层的爬虫管理它来做,并且不建议在 Shopify 前面套代理。你能管的是 robots.txt.liquid,以及后台「销售渠道 > 智能代理」的设置,见Shopify AI 代理店面:店主该查哪几项。

curl 回了 200,就没问题了吗?

不一定。一是上面说的,这只是从你电脑发的粗测;二是门开了,还要看正文能不能直接读到。有的主题把商品说明放在要等 JavaScript 加载的地方,爬虫拿到的页面可能是空的。geo-score 会单独查这一项。

想知道你的站卡在哪? 用 geo-score 自己测,或者留下官网,48 小时内收到免费速览。

来源

  1. Overview of OpenAI Crawlers(OpenAI),核对于 2026-10-08
  2. Perplexity Crawlers(Perplexity 文档),核对于 2026-10-08
  3. Google's common crawlers(Google),核对于 2026-10-08
  4. AI features and your website(Google Search Central),核对于 2026-10-08
  5. Bing Webmaster Guidelines,核对于 2026-10-08
  6. Does Anthropic crawl data from the web?(Claude 帮助中心),核对于 2026-10-08
  7. About Applebot(Apple 支持),核对于 2026-10-08
  8. Editing robots.txt.liquid(Shopify 帮助中心),核对于 2026-10-08
  9. Shopify Dawn 主题演示店的 robots.txt,核对于 2026-10-08
  10. do_robots()(WordPress 开发者文档),核对于 2026-10-08
  11. Cloudflare 新闻稿,2025-07-01,核对于 2026-10-08
  12. Block AI Bots(Cloudflare 文档),核对于 2026-10-08
  13. Managed robots.txt(Cloudflare 文档),核对于 2026-10-08
  14. Get started with AI Crawl Control(Cloudflare 文档),核对于 2026-10-08
  15. Verified bots(Cloudflare 文档),核对于 2026-10-08
  16. Bot Fight Mode(Cloudflare 文档),核对于 2026-10-08
  17. Super Bot Fight Mode(Cloudflare 文档),核对于 2026-10-08
  18. Detect a Challenge Page response(Cloudflare 文档),核对于 2026-10-08
  19. Cloudflare's new default AI-crawler blocking policy(Shopify 社区),核对于 2026-10-08
  20. geo-score(GitHub,MIT 协议),核对于 2026-10-08