外贸产品页的 robots 误拦截排查,不是看“有没有写 AI 爬虫”,而是先把产品目录、参数页、图片和规格书的抓取边界分开。公开产品页要能被抓、能被理解、能被规范化;私密图纸、内部资料和报价附件要靠真正的访问控制,不靠 robots.txt 冒充安全层。
外贸站做产品页 AI SEO,最常见的低级失误不是内容写得差,而是把该公开的产品页关掉了,把不该公开的参数垃圾页放开了。
如果一个买家要找的是公开产品页,你就要先确认这条 URL 能否被正常抓取、是否返回正确状态码、是否被参数组合稀释、是否被图片或规格书的访问规则连带误伤。顺序不能反。
先分四类 URL
| 类型 | 典型例子 | 该怎么想 |
|---|---|---|
| 公开产品目录 | /products/ |
这是公开获客入口 |
| 公开产品详情页 | /products/stainless-steel-valve/ |
这是买家要看的主页面 |
| 参数 / 筛选 / 分页页 | ?sort=price、?filter=material=316、?page=2 |
先判断有没有独立搜索价值 |
| 私密资源 | /downloads/private/、/customer-portal/、内部图纸 |
这类页面要做权限控制 |
很多问题都出在这里:一条 Disallow: /products/ 下去,真正的产品页和产品目录一起被关了;或者反过来,筛选组合被无限放开,抓取预算被浪费在无穷参数里。
第一步:先看 robots.txt 具体挡了谁
先看真实线上文件,而不是后台插件面板。
curl -s https://www.example.com/robots.txt
curl -s https://example.com/robots.txt
curl -s https://en.example.com/robots.txt
如果你的站点是外贸产品站,建议先核对这些路径:
User-agent: Googlebot
Allow: /products/
Allow: /products/stainless-steel-valve/
Disallow: /products/*?sort=
Disallow: /products/*?filter=
Disallow: /products/*?page=
Disallow: /downloads/private/
Disallow: /customer-portal/
这只是示例。重点不是照抄,而是看你的公开产品页、参数页和私密页有没有被混到同一层。
Google 的 robots.txt 文档很明确:它主要是抓取控制,不是隐藏页面的万能开关。页面如果真的不该进入搜索结果,通常要看 noindex 或权限控制,而不是只改 robots.txt。
第二步:参数页要按搜索价值分流
外贸产品站最容易堆出一串“看着像页面,其实只是参数”的 URL。
| 参数类型 | 例子 | 常见处理 |
|---|---|---|
| 排序参数 | ?sort=price |
多半不值得单独索引 |
| 追踪参数 | ?utm_source=... |
通常归一到干净 URL |
| 无意义筛选 | ?page=3、?color=red |
视情况阻止抓取或 noindex |
| 有采购意义的筛选 | ?material=316、?application=food-processing |
可能值得保留,但要有稳定内容和内链 |
官方的 faceted navigation 指南也建议:没必要被索引的筛选组合,优先防止抓取;有明确价值的组合,再按可抓取、可理解、可维护的方式设计。
<head>
<link rel="canonical" href="https://www.example.com/products/stainless-steel-valve/">
<meta name="robots" content="noindex,follow">
</head>
上面这类写法适合“可访问、但不想进结果页”的参数页或薄页。
如果一个参数页本身就是独立采购页面,那就不要随便 noindex,先确认它有没有自己的内容、标题和内链。
第三步:产品图片、CSS、JS、PDF 别一刀切
很多外贸站只盯 HTML 页面,结果把产品图、规格书、前端资源一起挡了。
curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/products/stainless-steel-valve.webp
curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/specs/stainless-steel-valve.pdf
curl -I -A "Googlebot" https://www.example.com/wp-content/themes/your-theme/assets/app.css
curl -I -A "Googlebot" https://www.example.com/wp-content/themes/your-theme/assets/app.js
| 资源 | 建议 | 原因 |
|---|---|---|
| 产品主图 | 通常开放 | 页面理解和图片展示都要靠它 |
| 规格书 PDF | 视公开程度决定 | 公开资料可开放,私密资料要保护 |
| CSS / JS | 不要默认挡 | 页面渲染常要靠它们 |
| 内部图纸 / 报价附件 | 不应公开 | 应用权限控制,不靠 robots.txt |
Google 的爬虫文档也提到,图片相关爬虫会影响图片、logo、favicon 等展示;如果你把关键资源挡得太死,页面理解和相关展示都会受影响。
第四步:别让 WAF/CDN 把问题伪装成 robots 问题
有时候 robots.txt 是放行的,真正拦的是 WAF、CDN 或安全插件。
curl -I -L https://www.example.com/products/stainless-steel-valve/
curl -I -A "Googlebot" https://www.example.com/products/stainless-steel-valve/
curl -I -A "Googlebot" https://www.example.com/wp-content/uploads/products/stainless-steel-valve.webp
如果普通访问是 200,但模拟抓取就变成 403,优先看:
location /downloads/private/ {
auth_basic "Restricted";
auth_basic_user_file /etc/nginx/.htpasswd;
}
这类资源应该靠权限层保护,不要把“请不要抓”写成“安全已完成”。
最后判断
如果是公开产品页,就保留抓取、索引和渲染所需的入口。
如果是排序、过滤、分页噪音,就按搜索价值处理。
如果是产品图、规格书、后台或报价附件,就用权限控制,不要拿 robots.txt 充数。
对外贸企业来说,最值得做的不是把整个产品目录关严,而是把“公开获客页”和“内部资料页”分清楚。
参考资料
- Introduction to robots.txt | Google Search Central
- Block Search indexing with noindex | Google Search Central
- Managing crawling of faceted navigation URLs | Google for Developers
- URL Structure Best Practices for Google Search | Google Search Central
- Google’s common crawlers | Google Crawling Infrastructure
- AI features and your website | Google Search Central
- AI Crawl Control with Cloudflare WAF