robots.txt和noindex不是同一层面的二选一配置:前者主要表达 crawler 是否应请求某些路径,后者主要表达页面是否应进入支持该规则的搜索索引。外贸站要先确定目标,再选择控制手段。
这篇只回答一个问题:产品页、RFQ 页、筛选页和确认页,分别应该判断“抓取边界”还是“索引边界”?
先看控制对象
| 需要解决的问题 | 更接近哪一层 | 外贸站常见场景 |
|---|---|---|
| 不希望某类 crawler 继续请求某些 URL | 抓取边界 | 无价值排序参数、测试目录、后台路径 |
| 页面仍可公开访问,但不希望进入支持该规则的索引 | 索引边界 | RFQ thank-you 页、临时确认页、特定公开资源 |
| 不希望客户文件或报价被打开 | 访问权限 | 客户图纸、报价附件、后台、客户门户 |
这里不能把三个目标混成一句“不要让 AI 看到”。robots.txt 不是权限系统,noindex 也不是密码。Google 对 noindex 的处理还要求 crawler 能访问页面并看到这条指令;不同 AI 平台是否支持、如何解释这些规则,则要看各自文档。
外贸页面怎么判断
公开产品页:先避免误伤
产品详情页、产品分类页和应用页通常承担公开推广职责。页面有真实规格、应用、认证或询盘说明时,优先检查是否被错误 Disallow 或误加 noindex,不要为了“做 AI SEO”把正式产品目录整体挡掉。
| 目标 | 判断 |
|---|---|
| 保持产品页作为公开入口 | 不要误挡目录,也不要误加 noindex |
| 减少无价值参数请求 | 只评估明确无采购价值的参数组合 |
| 保护客户专属产品资料 | 不放在匿名公开路径,先做权限控制 |
RFQ 说明页和 thank-you 页:不要一起处理
RFQ 说明页可能解释采购流程、提交资料和服务范围,通常与公开推广有关。提交成功后的 thank-you 页只是流程确认,是否进入索引是另一个判断。
<!-- thank-you 页:如果目标是控制支持该规则的索引 -->
<meta name="robots" content="noindex">
不要因为 thank-you 页不应作为搜索入口,就把整个 /request-a-quote/ 目录一起 Disallow。说明页和确认页承担的任务不同。
参数和筛选页:先问买家是否真的会用
带参数不等于没有搜索价值。按材质、应用行业、认证或产品系列组织的页面,可能是正式采购入口;纯排序、空结果或无限组合,才值得评估抓取或索引控制。
| 页面情况 | 判断重点 |
|---|---|
| 有独立标题、正文和产品集合 | 优先保留公开入口,按页面目标判断是否需要索引控制 |
| 只是排序变化 | 如果目标是减少无效请求,才评估 robots.txt |
| 有稳定采购意图,但暂不希望进入索引 | 评估可被 crawler 看到的 noindex |
| 带客户、会话或报价条件 | 先移出匿名公开路径并加权限 |
不要把“页面带 ?”直接等同于“页面应该被挡”。
两个小例子,说明选择逻辑
如果目标是限制无价值排序 URL 的 crawler 请求,可以表达抓取意图:
User-agent: *
Disallow: /*?sort=
* 和查询参数匹配是否按预期工作,取决于具体 crawler 对 robots 规则的解析能力;不能把这条规则当作权限控制。
如果目标是让公开可访问的确认页退出支持该规则的索引,页面需要输出索引指令:
<meta name="robots" content="noindex">
不要把 Noindex: 当成 Google 支持的 robots.txt 指令,也不要先用 robots.txt 挡住页面,再期待 Googlebot 能看到页面里的 noindex。
什么时候两者都不是答案
有些问题不应该在 robots.txt 和 noindex 之间选择:
| 问题 | 应先处理什么 |
|---|---|
| 客户报价文件不能被打开 | 登录、签名 URL、私有存储或服务器权限 |
| 客户图纸和内部测试报告不能公开 | 文件权限、受控下载或移除公开副本 |
| 后台和客户门户被匿名访问 | 应用鉴权、网络限制和服务器安全 |
如果内容不能被未授权人员看到,就不能依赖搜索引擎是否遵守一份文本文件。
用决策表避免写错
页面类型,是否应公开,主要目标,robots/noindex判断,常见误用
公开产品页,是,保持公开推广入口,不误挡robots且不误加noindex,为了AI SEO整体关闭产品目录
RFQ说明页,是,解释采购流程,按页面价值决定,把说明页和thank-you页一起Disallow
RFQ thank-you页,通常不作为搜索入口,控制索引,让crawler能看到noindex,只在robots.txt里写Noindex
纯排序页,视情况,减少无效请求或控制索引,先明确目标再选择工具,把所有带参数页面一刀切
客户报价文件,否,阻止未授权访问,不把两者当权限方案,只靠robots或noindex保护文件
后台和客户门户,否,阻止未授权访问,不把两者当权限方案,把搜索规则当成鉴权
最后只问三句:
- 我是想减少 crawler 请求,还是控制搜索索引?
- 这个页面是否仍然应该匿名公开?
- 目标平台是否明确支持并处理这条规则?
三句都回答清楚后,再改配置。外贸 AI SEO 的控制边界,重点不是增加更多规则,而是让公开推广页面、索引控制页面和私有业务资料各自归位。