WordPress / WooCommerce 独立站怎么做 GEO

WordPress / WooCommerce 独立站做 GEO,先让 AI 爬虫进得来、读得到,再一个买家问题写一页回答。重点查四处:爬虫实际拿到的 robots.txt,「不索引」和「即将推出」开关,Cloudflare 的 AI 爬虫设置,正文是否要等 JavaScript 才出来。这几处几天修完,回答页通常几周开始出现在 AI 回答里。

GEO(生成式引擎优化)就是让 ChatGPT、Google AI 概览、Perplexity 这类 AI 在回答买家问题时,找得到、读得懂、愿意引用你的页面。AI 回答前会当场上网搜,再派爬虫(替 AI 上网读页面的程序)打开搜到的页面读正文。WordPress 站的麻烦在于:同一件事,WordPress 本身、插件、主机、缓存、CDN 每一层都能改,你在后台看到的设置,不一定是爬虫实际碰到的。下面按层说我们查什么、改什么。

怎么核的:标「真实输出」的内容,来自我们 2026-10-08 用 WordPress Playground 在本机起的三个全新测试站(WordPress 7.1.3、WooCommerce 11.2.0、默认主题 Twenty Twenty-Five,各建了一个 399 美元的商品):一个保持默认,一个勾上「不索引」,一个打开「即将推出」(整站模式)。其余事实都链到 WordPress、WooCommerce、Google、Cloudflare 等的官方页面。

爬虫拿到的是哪一份 robots.txt

robots.txt 是放在网站根目录、告诉爬虫哪里别去的文本文件。WordPress 默认没有这个文件,是访问 /robots.txt 时由 do_robots() 临时生成一份「虚拟」的:只挡后台 /wp-admin/,放行 admin-ajax.php,不挡任何 AI 爬虫。WordPress 5.5 起,这份文件末尾还会加一行指向自带的 sitemap(do_robots() 文档,WordPress 5.5 sitemap 说明)。装了 WooCommerce,它也会往里加几行。测试站的 robots.txt 是这样的:

User-agent: *
Disallow: /wp-content/uploads/wc-logs/
Disallow: /wp-content/uploads/woocommerce_transient_files/
Disallow: /wp-content/uploads/woocommerce_uploads/
Disallow: /*?add-to-cart=
Disallow: /*?*add-to-cart=
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: http://127.0.0.1:9400/wp-sitemap.xml

真实输出:本机全新测试站,2026-10-08。前五条 Disallow 是 WooCommerce 加的,挡的是日志、临时文件、下载文件目录和「加入购物车」网址(WooCommerce 源码 class-woocommerce.php);后面是 WordPress 自己的。没有一行挡 AI 爬虫。

会改它的有四层,爬虫最后拿到的,是叠加后的结果:

谁在改怎么改的要注意
WordPress 和 WooCommerce虚拟文件每次访问时生成,挡后台和几个 WooCommerce 目录。不挡 AI 爬虫,这一层通常没问题。
其他插件SEO 插件、安全插件可以通过 robots_txt 过滤器改那份虚拟文件,也可能在根目录写一个实体文件。几个插件都在改时,以浏览器里打开的为准。
根目录的实体文件有人上传过 robots.txt服务器直接发这个文件,WordPress 不再生成。插件里的 robots 设置从此不生效,你在后台改了也白改。
Cloudflaremanaged robots.txt在你的 robots.txt 前面插一段,挡一批训练用的 AI 爬虫。WordPress 的虚拟文件也返回 200,同样会被插(Cloudflare 文档)。插进来的那段挡了 Google-Extended,会影响 Gemini App 引用你。

第三行的依据:WordPress 官方文档写明,旧版靠 robots.txt 挡爬虫的做法「只在根目录没有 robots.txt 时才有效」;WordPress 给 Apache 的标准重写规则也是「请求的文件真实存在,就直接发文件」(Settings Reading Screen,WordPress .htaccess 说明)。第四行:Cloudflare 文档写明,源站的 robots.txt 返回 200 就在前面拼上它那段,没有就替你生成一份;我们的测试站,虚拟 robots.txt 返回的就是 200(Cloudflare managed robots.txt 文档)。

所以别看插件设置页,直接在浏览器打开 你的域名/robots.txt。看 OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、Bingbot 这些检索爬虫下面有没有 Disallow: /。哪些该放行、哪些训练爬虫可以挡,见怎么查 AI 爬虫进不进得了你的独立站。

两个开关会让爬虫什么都读不到

「建议搜索引擎不索引本站点」。位置在 WordPress 后台「设置 → 阅读」,英文后台叫 Discourage search engines from indexing this site。WordPress 5.3 起,勾上它,每页的 <head> 里会多一行 noindex, nofollow,WordPress 自带的 sitemap 也会被关掉(Settings Reading Screen,WordPress 5.5 sitemap 说明)。noindex 的意思是「别收录这页」:Google 的 AI 概览只用已收录的页面(AI features and your website),Bing 也写明 noindex 的页不会出现在 Copilot 里(Bing Webmaster Guidelines)。

这个开关只看 robots.txt 是查不出来的。我们在测试站上勾上它:robots.txt 只少了最后那行 Sitemap:,其余照旧;每页多了 <meta name='robots' content='noindex, nofollow' />;/wp-sitemap.xml 返回 404(真实输出,2026-10-08)。如果你的店是先在测试站(staging)上建好、再整站搬到正式域名的,这个选项可能跟着一起搬了过去。查法:打开任意一页,右键看源代码,搜 noindex。

WooCommerce 的「即将推出」模式。英文后台叫 Coming soon,位置在「WooCommerce → 设置 → 站点可见性」(Site visibility)。按 WooCommerce 文档,新装 WooCommerce、走完开店向导的店,默认就处在这个模式:没登录的访客只能看到一个「即将上线」页面,爬虫也是没登录的访客。如果 WordPress 本身也是新装的(文档按 fresh_site 标记、建站的管理员账号注册不到一个月来判断),默认整站都挡;不满足的,比如 WordPress 早就在用、后来才装 WooCommerce,默认只挡商店、购物车、结账等几个商店页,文章照常能看。本来就已上线的店默认是「已上线」(Live),不受影响。要关掉,改成「已上线」。WooCommerce 还提醒,切到已上线以后,服务器缓存可能让旧页面再挂一阵子,要清缓存(WooCommerce Coming soon mode)。

这个开关更难发现。我们在测试站上打开它,没登录时打开商品页:服务器照样返回 200,网页标题还是商品名,可正文只有一句「Demo Store is coming soon」,商品说明一个字都没有,商品的结构化数据也没了,页面上却没有 noindex(真实输出,2026-10-08)。只看状态码和标题看不出问题,要看正文。

缓存、防火墙和 Cloudflare 有没有替你挡

很多 WordPress 站前面接了 Cloudflare(一种 CDN,做加速和防护),它能在 robots.txt 之外直接把爬虫拦下。按 Cloudflare 文档,2026 年 9 月 15 日起新接入的域名默认在有广告的页面上挡 Training(训练)和 Agent(买家提问时替他实时打开页面)两类 AI 爬虫,Search(检索)放行。我们的做法:Search 放行;Agent 也放行,Anthropic 说挡了它家的 Claude-User,你在用户发起的搜索里可能更难被看到(Claude 帮助中心);Training 挡不挡你定,只有 Google-Extended 例外,挡了它,Gemini App 联网回答时就用不了你的内容(Google 爬虫说明)。Cloudflare 后台去哪看、怎么自己测,见怎么查 AI 爬虫进不进得了你的独立站。

主机商的防火墙、安全插件也可能把陌生的爬虫当成攻击拦下来。Perplexity 的爬虫文档专门写了怎么在 Cloudflare WAF 和 AWS WAF 里放行它的爬虫,OpenAI 也公布了爬虫的 IP 段,建议站长按 IP 放行(Perplexity Crawlers,Overview of OpenAI Crawlers)。各家防火墙规则不一样,以服务器或 CDN 日志里真爬虫拿到的状态码为准。改完任何设置,记得清页面缓存和 CDN 缓存,不然爬虫拿到的可能还是旧的。

正文在不在服务器返回的 HTML 里

WordPress 的页面是服务器每次访问时用 PHP 现做出来的(WordPress 文档:Create pages),主题和大多数页面在服务器上就生成好了 HTML,这一点比纯前端的站省心。但页面构建器(拖拽排版的插件)里有的组件、「加载更多」、部分区块,是浏览器跑完 JavaScript 才去取内容的。Google 会执行 JavaScript,但它自己也说,服务端渲染仍然值得做,因为「不是所有爬虫都能运行 JavaScript」(JavaScript SEO basics)。OpenAI、Perplexity、Anthropic 的爬虫说明都没写它们会不会执行 JavaScript。

自己查:从回答页里抄一句正文,用 curl 取一次页面,看能不能搜到。结果是 0,说明这句话不在服务器返回的 HTML 里:

$ curl -sL https://yourstore.com/your-answer-page/ | grep -c "抄来的那句话"

结构化数据:WooCommerce 已经在输出,先查有没有重复

结构化数据是写在网页代码里、给搜索引擎看的商品说明。WooCommerce 核心自己就会输出:商品页有 Product(带 Offer;多规格且价格不同时是 AggregateOffer),有评价时带 Review 和 AggregateRating;面包屑有 BreadcrumbList;商店页设成首页时还有 WebSite。这些都写在页脚的一段 JSON-LD 里,是服务器直接给出的(WooCommerce 源码 class-wc-structured-data.php)。测试站的商品页上正好一段 JSON-LD,里面是 BreadcrumbList、Product 和 Offer,价格 399.00 美元和页面上显示的一致(真实输出,2026-10-08)。

问题常出在叠加:SEO 插件或主题再输出一份自己的,同一个商品就有两份 Product,价格、库存还可能对不上。反过来,WooCommerce 的商品标记挂在商品模板的 woocommerce_single_product_summary 钩子上,主题或页面构建器把商品页整个重做以后,这段可能就没了。两种情况都要实际查:

$ curl -sL https://yourstore.com/product/your-product/ | grep -o '"@type": *"Product"' | wc -l

测试站上这行的结果是 1,正好。2 或更多,说明有两份,留一份,并且和页面上显示的价格一致;0 就用 Google 的 Rich Results Test 再查一次,标记可能是 JavaScript 生成的。也别把期望放太高:Google 说出现在 AI 概览不需要专门的结构化数据(AI features and your website);微软说它可能让 Copilot 理解得更清楚,但不保证被引用(Bing Webmaster Guidelines 第 14 条)。细节见结构化数据对 AI 回答有没有用。

sitemap 只留一份,IndexNow 开一个

sitemap(网站地图)是列出全站网址的文件。WordPress 5.5 起自带一份,地址是 /wp-sitemap.xml,每个子 sitemap 默认最多 2,000 个网址;插件可以用 wp_sitemaps_enabled 过滤器把它关掉,换成自己的,地址也就变了(WordPress 5.5 sitemap 说明)。我们会确认:只有一份在工作,robots.txt 里的 Sitemap: 行指向的就是它,并且在 Google Search Console 和 Bing Webmaster Tools 都提交过。

IndexNow 是「我有新页面了」的通知协议。参与的引擎有 Bing、Yandex、Naver 等,没有 Google(IndexNow 参与引擎清单);Copilot 用的就是 Bing 的索引(Bing Webmaster Guidelines)。WordPress 上可以用 Bing 站长团队发布的 IndexNow Plugin,发布、更新、删除文章时自动推送;Cloudflare 的 Crawler Hints 也支持 IndexNow;IndexNow 官方 FAQ 也说 WordPress 可以通过 SEO 插件支持它(IndexNow FAQ)。开一个就够。ChatGPT 会不会因此更快看到你,OpenAI 没说过。

回答页放在哪:一般建成文章

WordPress 有两种内容:文章(post)按时间排,进 RSS,可以分类、打标签;页面(page)不按时间排,默认不进 RSS、不能分类,可以分层级,适合「关于我们」这类长期不变的内容(WordPress 文档:Create pages)。

回答页我们默认建成文章:它天然有发布日期,能署作者、归到分类里。我们要求每页有真人署名和准确的更新日期,用文章最省事。「尺码怎么选」「保修怎么算」这种要挂在导航里、长期不变的,建成页面也行。别把回答塞进商品描述:商品页写参数,回答页回答一个具体问题,两边互相加链接。一个真问题写一页,不是每种问法写一页。写法见怎么写一页 AI 愿意引用的回答。

速度:只管影响抓取的那部分

Google 抓一个站的速度会跟着服务器走:响应稳定,抓得多;变慢、返回 5xx 错误或 429(请求太多),就抓得少。Google 也说,「抓取预算」主要是 100 万页以上、每周更新,或 1 万页以上、每天更新的大站要操心的事,这两个数只是粗略的划分(Optimize your crawl budget)。没到这个量的店,我们只查两件事:爬虫来的时候会不会被慢查询拖到超时或报错;筛选和排序生成的网址有没有失控。

WooCommerce 的筛选和排序用 orderby、filter_ 开头、min_price / max_price 这些参数(WooCommerce 源码 class-wc-query.php),属性一多,组合出来的网址数不清。Google 建议:这类网址不需要被收录,就用 robots.txt 挡掉(Managing crawling of faceted navigation URLs)。示意,按你站上实际的参数改:

User-agent: *
Disallow: /*?*orderby=
Disallow: /*?*filter_
Disallow: /*?*min_price=

页面测速分数本身,我们不拿来当 GEO 的交付物。

我们具体改什么、交什么

顺序固定:先门槛,再内容,最后复测。前一步没做好,后面的都看不出效果。

  1. 测基线,逐层核对

    用 geo-score 跑一次分,再按上面几层逐个看:爬虫实际拿到的 robots.txt、noindex 和「即将推出」、Cloudflare 和主机的拦截、正文在不在 HTML 里、商品页的结构化数据有几份、sitemap 有几份。

    交付:问题清单,每条写明在哪一层、怎么改,按几天、几周、几个月分好。

  2. 修门槛

    放行检索爬虫,关掉误开的开关,只留一份 sitemap 并提交到 Search Console 和 Bing,开 IndexNow,商品标记去重、和页面一致,按需挡掉筛选网址。

    交付:改动清单(每一处改了哪个设置或文件、怎么撤回),改前改后的 geo-score 分数。一般几天。AI 什么时候回来重新抓,由它们自己定。

  3. 一个问题,写一页回答

    从客服记录、商品评论、Search Console 的搜索词里挑买家真问的具体问题,在你的 WordPress 里建成文章,署名、带日期,和对应的商品页互相链接。

    交付:页面本身和每页的事实核对表。价格、参数、保修由你确认后才发布。

  4. 每月复测

    同一组问题定期去问各家 AI,记下有没有提到你、引用的是哪一页;每月用 geo-score 复测一次。

    交付:月报。验收只看 AIV 分(geo-score 按公开量表算的 0–100 分,你自己能复跑)。

需要你给什么权限

  • WordPress 管理员账号,或者你的开发配合。装插件、改主题、处理 robots.txt 要管理员权限。请在「用户 → 添加用户」单独给我们建一个账号,做完删掉,别给你自己的密码。
  • 只写回答页的话,权限可以小一点。WooCommerce 的「商店管理员」(Shop Manager)能改 WooCommerce 全部设置,也能写文章和页面,但比管理员少;WordPress 的「编辑」能发布和管理所有人的文章(WooCommerce 角色说明,WordPress 角色说明)。
  • 用了 Cloudflare 的,给一个成员账号。要看 AI 爬虫设置、AI Crawl Control 和状态码。
  • 主机后台或 SFTP,只在需要时给。根目录有实体 robots.txt、要清服务器缓存时才用得上;不方便给,就由你的开发或主机商照清单做。
  • Google Search Console 和 Bing Webmaster Tools 的查看权限。用来提交 sitemap、看哪些页被收录。
  • 先备份。动手前请你或主机商做一次完整备份;有测试站(staging)的,先在测试站改。

价格:诊断 ¥5,888 起,一次;季度服务 ¥15,000 起,每季度,包括上面四步。页面数量按你的品类报价,写进合同。每档包括什么见价格页。

只装插件够不够?几种做法比一比

做法能解决解决不了什么时候选它
只装 SEO 插件和 IndexNow 插件自己做sitemap、标题和描述、基础结构化数据、通知 Bing。不替你查 Cloudflare 和主机挡没挡爬虫、正文在不在 HTML 里,也不写回答页。geo-score 公开量表里的三项门槛已经满分,团队里有人写内容:插件就够了,不用找我们。
让建站公司或开发照清单改按次付上面几层的门槛问题都能改。一般不负责选问题、写回答页、定期复测。只有门槛问题,团队里有开发。
诊断¥5,888 起,一次完整报告、买家问题清单、各家 AI 现在怎么答、按优先级排好的修改清单。不动手改。想先看清楚,再让自己的团队做。
季度服务¥15,000 起,每季度修门槛、每季度一批回答页、每月复测和月报。不承诺排名、流量和上榜,不做品类大词。想把一个品类的长尾问题做下来。

表里的服务内容截至 2026-10-08,以价格页为准。

这些情况,先别找我们

  • 门槛已经过了,你也有人写。geo-score 的三项门槛满分(判据见公开量表),团队能按这篇的写法自己写回答页,装好插件、照我们的免费指南做就行。
  • 店还没上线,或者商品、价格还没定。回答页里的事实要稳定,先把店开起来。
  • 想要「几天上 ChatGPT」「保证排名」,或者只想抢「best running shoes」这种品类大词。我们不卖这些结果。时间怎么说见新页面多久能被收录、出现在 AI 回答里。
  • 想一次铺几百页换词页、或者买链接。我们不做,见我们不做的事。
  • 既不能给后台权限,也没有开发能配合。门槛改不了,后面的回答页也上不去。这种情况只建议买诊断,拿报告找人改。

常见问题

我已经装了 SEO 插件,还要做 GEO 吗?

看门槛过没过。SEO 插件管 sitemap、标题和标记,管不到 Cloudflare、主机防火墙,也不会替你写回答页。先用 geo-score 测一次:门槛满分、有人写内容,插件就够了。

WordPress 要不要装一个 llms.txt 插件?

不急。截至 2026-10-08,没有哪家主流 AI 搜索官方说过回答时会读网站的 llms.txt;Google 明说它的搜索忽略这类文件,放了既不帮忙也不伤害(Google 生成式 AI 优化指南)。装了无害,但别指望它带来引用,详见llms.txt 对独立站有没有用。

网站是在测试站建好、再搬到正式域名的,上线后要查什么?

查三处。「设置 → 阅读」里的「建议搜索引擎不索引本站点」有没有跟着搬过来、还勾着;「WooCommerce → 设置 → 站点可见性」是不是「已上线」;打开 你的域名/robots.txt,看有没有测试站带过来的 Disallow: /。改完清一次页面缓存和 CDN 缓存,再用 geo-score 复测。

回答能不能直接写在商品描述里?

不建议。商品描述写参数和卖点,一个具体问题(示例:「500 美元以内适合车居的户外电源怎么选」)单独写一篇文章,两边互相链接。这样一页只答一个问题,AI 搜到时更容易整段引用。

商品页要不要加 FAQ 结构化数据?

不必为它专门加。Google 从 2026 年 5 月 7 日起不再展示 FAQ 富结果(Google Search Central 文档更新记录)。常见问题写给读者看就好;WooCommerce 自带的 Product 标记保持一份、和页面一致,更要紧。别的标记见结构化数据对 AI 回答有没有用。

你们要我的 WordPress 管理员密码吗?

不要你的密码。请在「用户 → 添加用户」给我们单独建一个账号,做完删掉。只写回答页的,商店管理员或编辑权限就够。

多久能看到效果?

门槛几天修完,修完当天就能用 geo-score 复测;为一个具体问题写的回答页,通常几周能看到被收录、开始出现在 AI 回答里;品类大词按月算,我们不卖这个结果。为什么是这个节奏,见新页面多久能被收录、出现在 AI 回答里。

来源

  1. do_robots()(WordPress 开发者文档),核对于 2026-10-08
  2. Settings Reading Screen(WordPress 文档),核对于 2026-10-08
  3. Apache HTTPD / .htaccess(WordPress 开发者文档),核对于 2026-10-08
  4. New XML Sitemaps Functionality in WordPress 5.5(make.wordpress.org),核对于 2026-10-08
  5. Create pages(WordPress 文档),核对于 2026-10-08
  6. Roles and Capabilities(WordPress 文档),核对于 2026-10-08
  7. WooCommerce Coming soon mode(WooCommerce 文档),核对于 2026-10-08
  8. Roles and Capabilities(WooCommerce 文档),核对于 2026-10-08
  9. class-woocommerce.php(WooCommerce 源码,GitHub),核对于 2026-10-08
  10. class-wc-structured-data.php(WooCommerce 源码,GitHub),核对于 2026-10-08
  11. class-wc-query.php(WooCommerce 源码,GitHub),核对于 2026-10-08
  12. Block AI Bots(Cloudflare 文档),核对于 2026-10-08
  13. Managed robots.txt(Cloudflare 文档),核对于 2026-10-08
  14. Crawler Hints(Cloudflare 文档),核对于 2026-10-08
  15. Google's common crawlers(Google),核对于 2026-10-08
  16. AI features and your website(Google Search Central),核对于 2026-10-08
  17. Google's Guide to Optimizing for Generative AI Features on Google Search(Google Search Central),核对于 2026-10-08
  18. Understand JavaScript SEO basics(Google Search Central),核对于 2026-10-08
  19. Optimize your crawl budget(Google),核对于 2026-10-08
  20. Managing crawling of faceted navigation URLs(Google),核对于 2026-10-08
  21. Google Search Central 文档更新记录(FAQ 富结果 2026-05-07 起不再展示),核对于 2026-10-08
  22. Rich Results Test(Google),核对于 2026-10-08
  23. Bing Webmaster Guidelines,核对于 2026-10-08
  24. IndexNow Plugin(Bing 站长团队发布,WordPress 插件目录),核对于 2026-10-08
  25. IndexNow FAQ(indexnow.org),核对于 2026-10-08
  26. IndexNow 参与引擎清单(indexnow.org),核对于 2026-10-08
  27. Overview of OpenAI Crawlers(OpenAI),核对于 2026-10-08
  28. Perplexity Crawlers(Perplexity 文档),核对于 2026-10-08
  29. Does Anthropic crawl data from the web?(Claude 帮助中心),核对于 2026-10-08
  30. geo-score(GitHub,MIT 协议),核对于 2026-10-08

先免费看看你的 WooCommerce 店卡在哪一层

留下官网,两天内收到速览:robots.txt、noindex、「即将推出」、Cloudflare、正文直出逐项看过,告诉你先修什么。

留官网,领免费速览
微信jianrun-ai
邮件hello@jianruntech.com
回复48 小时内