外贸网站换主题后如何复查AI爬虫可读性?从HTML、导航和Schema入手

浏览进度条

外贸网站换主题后,最先复查的不是“页面好不好看”,而是公开页面在 HTML、导航和 Schema 层面有没有断。菜单、产品卡片、首屏正文、canonical、robots meta、JSON-LD 一旦被新主题改掉,搜索和 AI 相关 crawler 看到的可能就不是你以为的页面。

这篇只讲外贸网站换主题 AI 爬虫可读性复查。
不讲主题选购,不讲插件对比,也不承诺复查后一定被收录或引用。

先抽样,不要全站瞎扫

换主题后先抽 8 类 URL:

https://www.example.com/
https://www.example.com/products/
https://www.example.com/products/stainless-steel-valve/
https://www.example.com/case-studies/food-processing-project/
https://www.example.com/faq/
https://www.example.com/about/
https://www.example.com/contact/
https://www.example.com/blog/how-to-choose-industrial-valves/

重点不是数量,而是覆盖模板:首页模板、列表模板、产品详情模板、案例模板、FAQ 模板、About 模板、Contact/RFQ 模板和文章模板。

第一步:看原始 HTML 里有没有正文

很多主题换完后,浏览器里看着正常,但原始 HTML 里只有框架和脚本。Googlebot 能渲染 JavaScript,但渲染不是“无限资源”,也不能据此推断所有 AI crawler 都有同样能力。

先用最朴素的命令看原始 HTML:

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL "$PAGE" | sed -n '1,120p'

再找外贸产品页该出现的关键信息:

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL "$PAGE" |
  grep -Ein 'model|material|specification|application|certification|moq|lead time|packaging|rfq|quote'

如果这些内容只在图片、轮播、异步接口或用户点击后才出现,就要回头查主题模板,而不是先改 robots。

页面 HTML 里应该能看到什么
产品页 型号、材质、规格、应用、MOQ、认证、交期、询盘入口
分类页 产品系列、子类、产品卡片链接
案例页 行业、项目背景、使用产品、交付范围
About / Factory 公司实体、工厂能力、出口市场、资质
Contact / RFQ 公开询盘说明、联系方式或表单入口

第二步:查导航和产品卡片是不是可抓取链接

Google 对链接的要求很直接:重要链接应是可抓取的 <a href>
新主题常见问题,是把菜单、产品卡片或 CTA 做成 onclick 事件,HTML 里没有真实链接。

PAGE="https://www.example.com/"

curl -fsSL "$PAGE" |
  tr '<' '\n' |
  grep -Ein '^a[[:space:]][^>]*href=' |
  sed -n '1,120p'

再抽查产品列表页:

PAGE="https://www.example.com/products/"

curl -fsSL "$PAGE" |
  tr '<' '\n' |
  grep -Ein '^a[[:space:]][^>]*href=.*products|^a[[:space:]][^>]*href=.*product' |
  sed -n '1,120p'

不要只看视觉效果。换主题后要确认这些路径还通:

路径 为什么要查
首页 -> 产品分类 crawler 能进入产品体系
产品分类 -> 产品详情 深层型号能被发现
产品详情 -> FAQ / 案例 产品和采购问题能互相解释
案例 -> 相关产品 应用场景不变孤岛
Contact / RFQ -> 产品页 询盘路径和产品路径能互相支撑

如果导航只剩 javascript:void(0)# 或空链接,主题视觉再好也不稳。

第三步:查 canonical、robots meta 和响应头

换主题可能同时改动 SEO 插件输出、主题模板、页头挂钩和服务器缓存。
上线后先查实际输出。

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL "$PAGE" |
  tr '>' '>\n' |
  grep -Ein 'rel=.canonical.|name=.robots.|application/ld\+json'

再查 HTTP Header:

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -sSIL -L "$PAGE" |
  grep -Ei '^(HTTP/|location:|content-type:|x-robots-tag:)'

重点看:

项目 正常方向 风险信号
canonical 指向当前规范 URL 指向旧主题测试域、旧 URL、首页
robots meta 公开核心页不误加 noindex 全站遗留 noindex
X-Robots-Tag 只用于明确需要控制的资源 服务器全站误加 noindex
状态码 核心页最终 200 403、404、5xx、跳首页

这一步不是重新讲 noindex。
它只回答一个问题:换主题后,线上输出有没有被模板或缓存改坏。

第四步:查 Schema 是否丢失或乱标

结构化数据不是 AI 搜索保证。
它的作用更保守:帮助机器理解页面上已经可见、真实、相关的信息。Google 的结构化数据政策也要求标注内容要与页面可见内容一致。

先看有没有 JSON-LD:

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL "$PAGE" |
  grep -Ein 'application/ld\+json|Organization|Product|Offer|BreadcrumbList|ContactPoint'

换主题后常见问题:

问题 风险
Organization 丢失 公司实体信息变弱
Product 丢失 产品页机器可读信息减少
BreadcrumbList 丢失 层级关系变弱
Schema 里有页面看不到的评分/库存/认证 可能违反结构化数据政策
多语言页面 Schema 仍是旧语言或旧 URL 实体信息不一致

不要为了“AI SEO”乱塞不存在的评分、库存、认证、价格。
外贸产品页通常更适合先保证产品名称、型号、规格、应用、公司名称、联系入口这些真实信息一致。

第五步:查移动端和桌面端内容是否明显不一致

Google Search 使用移动优先索引。换主题后,移动端模板常常被单独压缩、隐藏或懒加载。

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL -A "Mozilla/5.0 (iPhone; CPU iPhone OS 17_0 like Mac OS X) Mobile" "$PAGE" |
  grep -Ein 'model|material|specification|application|certification|moq|lead time|rfq'

再和桌面端对照:

PAGE="https://www.example.com/products/stainless-steel-valve/"

curl -fsSL -A "Mozilla/5.0 (Macintosh; Intel Mac OS X) AppleWebKit/537.36 Chrome/126 Safari/537.36" "$PAGE" |
  grep -Ein 'model|material|specification|application|certification|moq|lead time|rfq'

不是要求移动端和桌面端 HTML 每个字都一样。
但核心产品信息、导航入口和询盘入口不能在移动端消失。

第六步:查 WordPress 主题相关位置

如果是 WordPress 换主题,重点看这些位置:

位置 可能影响
Block theme templates 首页、产品页、文章页模板结构
Navigation block 主导航、页脚导航、移动菜单
Header / Footer template parts 全站链接、公司信息、联系方式
Single / Archive templates 产品详情、分类页、文章页输出
Reading Settings 是否仍阻止搜索引擎索引
SEO 插件输出位置 canonical、robots meta、schema 是否仍进入 <head>

后台看完还不够。
最终一定要回到线上 HTML,用 curl 查实际输出。

第七步:做一张回归表

URL 页面类型 HTML正文 导航链接 canonical robots Schema 移动端 处理
/ 首页 正常 正常 Organization 正常 保持
/products/ 分类页 正常 正常 Breadcrumb 待查 查移动菜单
/products/stainless-steel-valve/ 产品页 缺 MOQ 正常 正常 Product 缺失 正常 补正文和 Schema
/contact/ RFQ 正常 正常 ContactPage 正常 保持

回归表的目的不是给主题打分。
它是让你知道:换主题后,哪些公开内容从“浏览器可见”变成了“机器不稳定可读”。

常见错误

错误做法 更稳的做法
只看浏览器截图 查原始 HTML 和实际响应
导航只做按钮点击 重要路径保留 <a href>
Schema 里补页面没有的信息 只标注真实可见内容
把 JS 渲染能力泛化到所有 AI crawler 只按有官方资料的平台表述
换主题后只查首页 同时查分类、产品、FAQ、案例、RFQ
把复查写成排名保证 只说降低不可读和断链风险

换主题可以让网站变漂亮,也可能把外贸站最关键的产品信息藏起来。复查 HTML、导航和 Schema,是为了确认公开页面还像公开页面。

参考资料

内卷越来越激烈,再不做好独立站,就真的晚了!

添加微信咨询

扫描二维码添加微信客服

联系我们

  • 微信同号: 13077312120
  • Email: service@wphuo.com
  • 地址: 工业设计城智点汇7楼701 佛山市顺德区工业大道32号