外贸产品页如何排查robots.txt误拦截?按目录、参数页和图片资源检查

浏览进度条

外贸产品页的 robots 误拦截排查,不是看“有没有写 AI 爬虫”,而是先把产品目录、参数页、图片和规格书的抓取边界分开。公开产品页要能被抓、能被理解、能被规范化;私密图纸、内部资料和报价附件要靠真正的访问控制,不靠 robots.txt 冒充安全层。

外贸站做产品页 AI SEO,最常见的低级失误不是内容写得差,而是把该公开的产品页关掉了,把不该公开的参数垃圾页放开了。

如果一个买家要找的是公开产品页,你就要先确认这条 URL 能否被正常抓取、是否返回正确状态码、是否被参数组合稀释、是否被图片或规格书的访问规则连带误伤。顺序不能反。

先分四类 URL

类型 典型例子 该怎么想
公开产品目录 /products/ 这是公开获客入口
公开产品详情页 /products/stainless-steel-valve/ 这是买家要看的主页面
参数 / 筛选 / 分页页 ?sort=price?filter=material=316?page=2 先判断有没有独立搜索价值
私密资源 /downloads/private//customer-portal/、内部图纸 这类页面要做权限控制

很多问题都出在这里:一条 Disallow: /products/ 下去,真正的产品页和产品目录一起被关了;或者反过来,筛选组合被无限放开,抓取预算被浪费在无穷参数里。

第一步:先看 robots.txt 具体挡了谁

先看真实线上文件,而不是后台插件面板。

curl -s https://www.example.com/robots.txt
curl -s https://example.com/robots.txt
curl -s https://en.example.com/robots.txt

如果你的站点是外贸产品站,建议先核对这些路径:

User-agent: Googlebot
Allow: /products/
Allow: /products/stainless-steel-valve/
Disallow: /products/*?sort=
Disallow: /products/*?filter=
Disallow: /products/*?page=
Disallow: /downloads/private/
Disallow: /customer-portal/

这只是示例。重点不是照抄,而是看你的公开产品页、参数页和私密页有没有被混到同一层。

Google 的 robots.txt 文档很明确:它主要是抓取控制,不是隐藏页面的万能开关。页面如果真的不该进入搜索结果,通常要看 noindex 或权限控制,而不是只改 robots.txt。

第二步:参数页要按搜索价值分流

外贸产品站最容易堆出一串“看着像页面,其实只是参数”的 URL。

参数类型 例子 常见处理
排序参数 ?sort=price 多半不值得单独索引
追踪参数 ?utm_source=... 通常归一到干净 URL
无意义筛选 ?page=3?color=red 视情况阻止抓取或 noindex
有采购意义的筛选 ?material=316?application=food-processing 可能值得保留,但要有稳定内容和内链

官方的 faceted navigation 指南也建议:没必要被索引的筛选组合,优先防止抓取;有明确价值的组合,再按可抓取、可理解、可维护的方式设计。

<head>
  <link rel="canonical" href="https://www.example.com/products/stainless-steel-valve/">
  <meta name="robots" content="noindex,follow">
</head>

上面这类写法适合“可访问、但不想进结果页”的参数页或薄页。
如果一个参数页本身就是独立采购页面,那就不要随便 noindex,先确认它有没有自己的内容、标题和内链。

第三步:产品图片、CSS、JS、PDF 别一刀切

很多外贸站只盯 HTML 页面,结果把产品图、规格书、前端资源一起挡了。

curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/products/stainless-steel-valve.webp
curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/specs/stainless-steel-valve.pdf
curl -I -A "Googlebot" https://www.example.com/wp-content/themes/your-theme/assets/app.css
curl -I -A "Googlebot" https://www.example.com/wp-content/themes/your-theme/assets/app.js
资源 建议 原因
产品主图 通常开放 页面理解和图片展示都要靠它
规格书 PDF 视公开程度决定 公开资料可开放,私密资料要保护
CSS / JS 不要默认挡 页面渲染常要靠它们
内部图纸 / 报价附件 不应公开 应用权限控制,不靠 robots.txt

Google 的爬虫文档也提到,图片相关爬虫会影响图片、logo、favicon 等展示;如果你把关键资源挡得太死,页面理解和相关展示都会受影响。

第四步:别让 WAF/CDN 把问题伪装成 robots 问题

有时候 robots.txt 是放行的,真正拦的是 WAF、CDN 或安全插件。

curl -I -L https://www.example.com/products/stainless-steel-valve/
curl -I -A "Googlebot" https://www.example.com/products/stainless-steel-valve/
curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/products/stainless-steel-valve.webp

如果普通访问是 200,但模拟抓取就变成 403,优先看:

location /downloads/private/ {
    auth_basic "Restricted";
    auth_basic_user_file /etc/nginx/.htpasswd;
}

这类资源应该靠权限层保护,不要把“请不要抓”写成“安全已完成”。

最后判断

如果是公开产品页,就保留抓取、索引和渲染所需的入口。
如果是排序、过滤、分页噪音,就按搜索价值处理。
如果是产品图、规格书、后台或报价附件,就用权限控制,不要拿 robots.txt 充数。

对外贸企业来说,最值得做的不是把整个产品目录关严,而是把“公开获客页”和“内部资料页”分清楚。

参考资料

内卷越来越激烈,再不做好独立站,就真的晚了!

添加微信咨询

扫描二维码添加微信客服

联系我们

  • 微信同号: 13077312120
  • Email: service@wphuo.com
  • 地址: 工业设计城智点汇7楼701 佛山市顺德区工业大道32号