RFQ询盘页要不要允许AI爬虫访问?外贸站如何设置边界

浏览进度条

RFQ 页面要不要给 AI 爬虫看,不能一刀切。公开的询盘说明页可以保留被搜索和被理解的机会,但表单提交动作、感谢页、客户数据、报价记录和上传文件必须单独隔离。robots.txtnoindex 管的是公开可见性,不是隐私和权限。

外贸站讨论 RFQ 页面时,最容易混在一起的,其实是四种完全不同的东西:

  1. 公开的 RFQ 说明页
  2. 询盘表单的提交动作
  3. 提交后的 thank-you 页
  4. 客户数据、报价记录、图纸文件

如果这四层不分开,很多站就会出现一种很怪的局面:该公开的页面没法被搜索到,不该公开的内容却被当成“SEO 页面”处理。

先把边界分清

页面 / 资源 是否公开 该怎么处理
RFQ 说明页 保持可抓取、可索引、可理解
RFQ 表单提交接口 走服务端校验和权限控制
thank-you 页 通常是公开 URL,但不该做获客页 noindex,一般不进 sitemap
客户报价记录 必须登录 / 权限保护
上传图纸 必须权限保护或短期签名访问
邮箱 / 电话 / 负责人信息 视业务而定 公开页可展示,敏感字段别混在提交页里

这件事的核心,不是“AI 能不能访问”,而是“它访问到的是不是你想公开给买家的那部分内容”。

第一步:公开 RFQ 说明页可以保留搜索入口

如果一个页面是给买家看的 RFQ 说明页,内容通常应该包括:

  • 适用产品范围
  • 最少需要提交哪些信息
  • MOQ、交期、样品、认证、包装要求
  • 适合哪些买家类型
  • 联系方式和下一步动作

这类页面是公开推广页,不是表单结果页。 只要它本身是公开资料,就应当保持可抓取、可索引,并能被页面文本解释清楚。

OpenAI、Perplexity 和 Anthropic 的官方文档都把搜索型 crawler、用户触发访问和训练型 crawler 分开了。对外贸站来说,这意味着公开 RFQ 说明页可以保留被搜索和被引用的机会,但这不延伸到提交后的数据。

第二步:提交后的内容不要拿 robots.txt 顶着

User-agent: *
Disallow: /rfq/submit/
Disallow: /request-a-quote/submit/
Disallow: /customer-portal/
Disallow: /downloads/private/
<head>
  <meta name="robots" content="noindex,follow">
</head>

noindex 适合公开但不该进结果页的 URL,比如 thank-you 页、重复页、内部说明页。
noindex 不是隐私措施;它只能影响搜索展示,不能替代鉴权、权限控制或文件访问策略。

Google 的文档也说明了这个边界:noindex 只有在页面能被抓到时才会生效。你不能先把页面挡住,再期待搜索引擎读到 noindex

第三步:把搜索 crawler、训练 crawler、用户触发访问分开

OpenAI 官方把 OAI-SearchBotGPTBotChatGPT-User 分开说明:

User-agent: OAI-SearchBot
Allow: /request-a-quote/
Allow: /products/
Allow: /faq/

User-agent: GPTBot
Disallow: /

这代表两个不同决策:

  • 搜索相关访问能不能进公开 RFQ 说明页;
  • 训练相关抓取要不要放行。

Perplexity 也有类似区分:

User-agent: PerplexityBot
Allow: /request-a-quote/
Allow: /faq/

User-agent: Perplexity-User
Allow: /request-a-quote/

Anthropic 的公开说明里同样把 Claude 的访问和用户触发访问分开。对外贸站来说,最重要的是别把“用户发起访问”写成“自动爬虫准入”,也别把训练抓取写成搜索引用开关。

第四步:thank-you 页和表单结果页要降权,不要露数据

User-agent: *
Disallow: /request-a-quote/thank-you/
Disallow: /request-a-quote/success/
<head>
  <meta name="robots" content="noindex,follow">
  <link rel="canonical" href="https://www.example.com/request-a-quote/">
</head>

如果 thank-you 页只是一个空白确认页,它没有必要承担任何搜索职责。
如果它包含订单号、客户名、报价摘要、附件链接,那就更不能只靠 noindex 处理,必须改成真正的权限访问。

这也是外贸站 RFQ 页面最常见的误区:把“提交成功页”当成普通内容页,结果把本来该私密的东西暴露给了公开索引和缓存。

第五步:WAF / CDN 可以做执行层,但别把它当概念替身

如果你用 Cloudflare 或其他安全层,AI Crawl Control / WAF 可以作为执行层去配合规则:

# 公开 RFQ 说明页可访问
/request-a-quote/
/faq/
/products/

# 提交动作与客户区必须受控
/request-a-quote/submit/
/request-a-quote/thank-you/
/customer-portal/

但执行层只是在帮你落地规则,不是替代规则。

公开页该开放,就开放给公开访问和搜索理解;
提交后页面和客户数据该保护,就老老实实走权限控制。

最后记住

RFQ 页面不是一个页面,而是一组不同风险等级的页面和接口。

公开说明页可以争取 AI 搜索可见性;
提交动作、thank-you 页、客户数据和附件,必须用真正的访问控制处理。

把这条线画清楚,外贸站的 RFQ 页面才算真的在做技术边界管理,而不是把 robots.txt 当万能挡板。

参考资料

内卷越来越激烈,再不做好独立站,就真的晚了!

添加微信咨询

扫描二维码添加微信客服

联系我们

  • 微信同号: 13077312120
  • Email: service@wphuo.com
  • 地址: 工业设计城智点汇7楼701 佛山市顺德区工业大道32号