RFQ 页面要不要给 AI 爬虫看,不能一刀切。公开的询盘说明页可以保留被搜索和被理解的机会,但表单提交动作、感谢页、客户数据、报价记录和上传文件必须单独隔离。
robots.txt和noindex管的是公开可见性,不是隐私和权限。
外贸站讨论 RFQ 页面时,最容易混在一起的,其实是四种完全不同的东西:
- 公开的 RFQ 说明页
- 询盘表单的提交动作
- 提交后的 thank-you 页
- 客户数据、报价记录、图纸文件
如果这四层不分开,很多站就会出现一种很怪的局面:该公开的页面没法被搜索到,不该公开的内容却被当成“SEO 页面”处理。
先把边界分清
| 页面 / 资源 | 是否公开 | 该怎么处理 |
|---|---|---|
| RFQ 说明页 | 是 | 保持可抓取、可索引、可理解 |
| RFQ 表单提交接口 | 否 | 走服务端校验和权限控制 |
| thank-you 页 | 通常是公开 URL,但不该做获客页 | 可 noindex,一般不进 sitemap |
| 客户报价记录 | 否 | 必须登录 / 权限保护 |
| 上传图纸 | 否 | 必须权限保护或短期签名访问 |
| 邮箱 / 电话 / 负责人信息 | 视业务而定 | 公开页可展示,敏感字段别混在提交页里 |
这件事的核心,不是“AI 能不能访问”,而是“它访问到的是不是你想公开给买家的那部分内容”。
第一步:公开 RFQ 说明页可以保留搜索入口
如果一个页面是给买家看的 RFQ 说明页,内容通常应该包括:
- 适用产品范围
- 最少需要提交哪些信息
- MOQ、交期、样品、认证、包装要求
- 适合哪些买家类型
- 联系方式和下一步动作
这类页面是公开推广页,不是表单结果页。 只要它本身是公开资料,就应当保持可抓取、可索引,并能被页面文本解释清楚。
OpenAI、Perplexity 和 Anthropic 的官方文档都把搜索型 crawler、用户触发访问和训练型 crawler 分开了。对外贸站来说,这意味着公开 RFQ 说明页可以保留被搜索和被引用的机会,但这不延伸到提交后的数据。
第二步:提交后的内容不要拿 robots.txt 顶着
User-agent: *
Disallow: /rfq/submit/
Disallow: /request-a-quote/submit/
Disallow: /customer-portal/
Disallow: /downloads/private/
<head>
<meta name="robots" content="noindex,follow">
</head>
noindex 适合公开但不该进结果页的 URL,比如 thank-you 页、重复页、内部说明页。
但 noindex 不是隐私措施;它只能影响搜索展示,不能替代鉴权、权限控制或文件访问策略。
Google 的文档也说明了这个边界:noindex 只有在页面能被抓到时才会生效。你不能先把页面挡住,再期待搜索引擎读到 noindex。
第三步:把搜索 crawler、训练 crawler、用户触发访问分开
OpenAI 官方把 OAI-SearchBot、GPTBot、ChatGPT-User 分开说明:
User-agent: OAI-SearchBot
Allow: /request-a-quote/
Allow: /products/
Allow: /faq/
User-agent: GPTBot
Disallow: /
这代表两个不同决策:
- 搜索相关访问能不能进公开 RFQ 说明页;
- 训练相关抓取要不要放行。
Perplexity 也有类似区分:
User-agent: PerplexityBot
Allow: /request-a-quote/
Allow: /faq/
User-agent: Perplexity-User
Allow: /request-a-quote/
Anthropic 的公开说明里同样把 Claude 的访问和用户触发访问分开。对外贸站来说,最重要的是别把“用户发起访问”写成“自动爬虫准入”,也别把训练抓取写成搜索引用开关。
第四步:thank-you 页和表单结果页要降权,不要露数据
User-agent: *
Disallow: /request-a-quote/thank-you/
Disallow: /request-a-quote/success/
<head>
<meta name="robots" content="noindex,follow">
<link rel="canonical" href="https://www.example.com/request-a-quote/">
</head>
如果 thank-you 页只是一个空白确认页,它没有必要承担任何搜索职责。
如果它包含订单号、客户名、报价摘要、附件链接,那就更不能只靠 noindex 处理,必须改成真正的权限访问。
这也是外贸站 RFQ 页面最常见的误区:把“提交成功页”当成普通内容页,结果把本来该私密的东西暴露给了公开索引和缓存。
第五步:WAF / CDN 可以做执行层,但别把它当概念替身
如果你用 Cloudflare 或其他安全层,AI Crawl Control / WAF 可以作为执行层去配合规则:
# 公开 RFQ 说明页可访问
/request-a-quote/
/faq/
/products/
# 提交动作与客户区必须受控
/request-a-quote/submit/
/request-a-quote/thank-you/
/customer-portal/
但执行层只是在帮你落地规则,不是替代规则。
公开页该开放,就开放给公开访问和搜索理解;
提交后页面和客户数据该保护,就老老实实走权限控制。
最后记住
RFQ 页面不是一个页面,而是一组不同风险等级的页面和接口。
公开说明页可以争取 AI 搜索可见性;
提交动作、thank-you 页、客户数据和附件,必须用真正的访问控制处理。
把这条线画清楚,外贸站的 RFQ 页面才算真的在做技术边界管理,而不是把 robots.txt 当万能挡板。
参考资料
- Introduction to robots.txt | Google Search Central
- Block Search indexing with noindex | Google Search Central
- AI features and your website | Google Search Central
- Overview of OpenAI Crawlers
- Perplexity Crawlers
- Does Anthropic crawl data from the web, and how can site owners block the crawler?
- How web search works in Microsoft 365 Copilot Chat and agents
- AI Crawl Control with Cloudflare WAF