多站点外贸企业如何区分品牌站、产品站和资料站的AI爬虫策略?

浏览进度条

品牌站、产品站和资料站承担的任务不同,不能因为属于同一家外贸企业,就复制同一份 AI 爬虫策略。品牌站先保证公司实体、公开能力、认证和可核验案例信息,产品站先保证可采购内容,资料站则要把公开技术文档与客户文件、报价和内部版本分开。

这里的“品牌站、产品站、资料站”是企业内部的业务角色分类,不是 Google、OpenAI 或 Perplexity 定义的官方站点类型。本文只讲多站点的公开范围、访问边界和记录方式,不讨论域名架构优劣或内容营销打法。

先定义每个站点的业务职责

无论这些内容部署在不同站点还是不同公开路径,先不要按 URL 数量管理,而要回答每个站点负责什么。本文只按业务职责拆分策略,不评价站点架构优劣:

站点角色 常见内容 主要访问目标
品牌站 公司实体、工厂、认证、服务区域、联系方式、案例入口 让访问者理解企业是谁、做什么和服务谁
产品站 产品分类、型号、规格、应用、FAQ、RFQ 说明 让买家找到可采购的产品和下一步入口
资料站 规格书、安装手册、目录、证书、技术文档 让访问者获取已批准公开的资料

真正重要的是业务职责和内容权限要写清楚。

为什么不能复制一份 robots.txt

品牌站允许访问公开 About 页,不代表资料站的客户文件也应该公开。产品站允许访问型号页,也不代表后台、报价接口和内部下载目录可以跟着放开。

每个站点至少分别记录:

记录项 为什么要单站维护
域名或 hostname CDN、证书、缓存和安全规则可能不同
robots.txt 每个站点的公开目录和受限目录不同
sitemap 只能放对应站点希望作为入口的规范 URL
canonical 跨站复制内容时,规范归属可能不同
WAF / 安全动作 一个站点的规则不一定作用于另一个站点
日志位置和格式 不同主机、CDN 或应用可能使用不同字段
负责人 品牌、产品和资料更新可能由不同团队负责

“集团统一开放”不是一个可直接执行的技术动作。正确做法是先建立站点矩阵,再逐站检查。

品牌站:公开实体,但不公开内部资料

品牌站通常承接公司是谁、服务哪些市场、有哪些工厂或能力等问题。可以优先整理:

  • 公司名称和品牌名称;
  • 工厂或办公地点的公开信息;
  • 产品和服务范围;
  • 认证、质量体系和公开案例;
  • 联系方式、服务区域和主要产品入口。

品牌站要避免把内部组织、客户合同、未公开报价、后台地址或测试链接放进公开页面。品牌站的“公开”是公开企业实体信息,不是把企业所有文件都公开。

品牌站的核心 URL 可以单独记录:

BRAND_PUBLIC
/
/about/
/certifications/
/case-studies/
/contact/

BRAND_PROTECTED
/admin/
/login/
/staging/
/customer-files/
/internal/

这只是站点角色记录示例,不是通用安全插件配置。真实受保护路径仍需要认证、权限和服务器或 WAF 层控制。

产品站:先保证可采购内容的入口

产品站的公开重点通常是:

页面 应检查什么
产品分类页 产品集合、分类路径和产品卡片链接
产品详情页 型号、规格、应用、材料或兼容信息
应用页 产品和采购场景之间的关系
FAQ 页 常见选型、交期、认证或使用问题
RFQ 说明页 采购流程、提交条件和公开说明

产品站不应把客户专属价格、报价附件、未发布型号或提交接口当成公开内容。公开产品页和受保护 RFQ 数据是两种不同的访问边界,不能因为 URL 都在同一个站点就合并管理。

产品站可以把公开入口记录成:

PRODUCT_PUBLIC
/products/
/applications/
/faq/
/request-a-quote/

PRODUCT_PROTECTED
/wp-admin/
/login/
/api/submit/
/uploads/private/
/customer-quotes/

站点策略的核心不是“产品站必须开放所有 AI crawler”,而是先确认哪些页面属于公开产品推广内容,再按企业对不同平台和用途的实际选择配置。

资料站:先区分公开版和受限版

资料站最容易出现“公开技术资料”和“客户专属文件”混在一起:

资料类型 处理方向
公开规格书、安装手册、公开目录 可以进入正式公开资料路径
公开认证和标准说明 先确认版本、范围和公开授权
内部测试报告、成本资料 不放公开下载目录
客户图纸、合同附件、定制方案 使用登录、权限或私有存储
未发布产品手册 先留在受控环境,发布后再建立正式入口

robots.txtnoindex 不能替代资料访问权限。一个客户文件如果不应被别人打开,第一步应是限制访问、撤回文件或使用私有存储,而不是只在页面上增加 SEO 标签。

资料站的公开和受限目录可以这样记录:

DOCS_PUBLIC
/catalogs/
/installation-guides/
/certifications/
/product-manuals/public/

DOCS_RESTRICTED
/customer-drawings/
/private-quotes/
/internal-test-reports/
/product-manuals/unreleased/

不同站点的 crawler 策略如何分开记录

OpenAI、Perplexity 和 Anthropic 对 crawler 用途的定义并不完全相同。企业内部记录时至少要把“搜索相关访问”“训练相关抓取”和“用户触发访问”分开,不要把所有 User-Agent 合并成一个“AI 流量”。

可以用站点矩阵表达策略,而不是用一句“全站放行”:

站点角色,站点地址,公开内容,受限内容,搜索相关crawler策略,训练相关crawler策略,用户触发访问,负责人,复查日期
品牌站,https://brand.example.com,实体/认证/案例,内部资料/测试路径,按公开页面决定,单独评估,公开页保持可访问,brand-owner,待定
产品站,https://products.example.com,分类/产品/应用/FAQ/RFQ说明,报价/提交接口/客户文件,按公开产品页决定,单独评估,公开页保持可访问,product-owner,待定
资料站,https://docs.example.com,公开目录/手册/证书,客户图纸/报价/内部版本,只开放已批准资料,单独评估,受限资料仍需权限,docs-owner,待定

表格里的“按公开页面决定”和“单独评估”是有意保留的空位。企业应根据自己的公开授权、风险和平台策略填写,不要把它们替换成无依据的统一答案。

多站点之间如何建立清晰关系

跨站链接可以帮助访问者从品牌站进入产品站、从产品站进入公开资料站,但链接关系必须和页面公开级别一致:

来源 可以链接到 需要注意
品牌站 产品分类、核心产品站、公开案例 目标 URL 要稳定、公开、可访问
产品站 品牌实体、公开规格书、安装说明 不把客户文件或私有下载地址放进公开内链
资料站 对应产品页、品牌主体和公开目录 只回链公开资料和正式产品入口

跨站链接只服务于公开页面之间的清晰导航,不要把客户文件、私有下载地址或内部路径带入公开发现路径。每个站点都要明确自己的正式公开入口和受限资料边界。

逐站检查 robots、sitemap 和核心 URL

准备 sites.txt,每行一个站点根地址:

https://brand.example.com
https://products.example.com
https://docs.example.com

然后逐站检查:

while IFS= read -r site; do
  [ -z "$site" ] && continue
  site="${site%/}"

  printf '\n== %s robots.txt ==\n' "$site"
  curl -sSL "$site/robots.txt" |
    sed -n '1,120p'

  printf '\n== %s sitemap headers ==\n' "$site"
  curl -sSL -D - -o /dev/null "$site/sitemap.xml" |
    grep -Ei '^(HTTP/|content-type:|location:)'
done < sites.txt

默认路径只是示例。实际站点可能使用 sitemap index 或其他地址,应按每个站点的记录表替换。

再抽查公开和受保护路径:

site,type,path
https://brand.example.com,public,/about/
https://brand.example.com,protected,/staging/
https://products.example.com,public,/products/
https://products.example.com,protected,/api/submit/
https://docs.example.com,public,/catalogs/
https://docs.example.com,protected,/customer-drawings/
tail -n +2 site-paths.csv |
while IFS=, read -r site type path; do
  [ -z "$site" ] && continue
  site="${site%/}"

  printf '\n== %s %s %s ==\n' "$site" "$type" "$path"
  curl -sS -D - -o /dev/null "$site$path" |
    grep -Ei '^(HTTP/|location:|content-type:|www-authenticate:|x-robots-tag:)'
done

这只是在授权范围内观察匿名响应,不尝试绕过登录、访问控制或私有下载。

站点职责或公开范围变化后检查什么

出现以下变化时,要重新确认对应站点的策略记录:

  • 品牌站新增产品推广职责,或产品站开始承接品牌实体信息;
  • 新增产品站或资料站;
  • 资料从私有改成公开,或从公开改成受限;
  • 站点之间新增、删除或调整公开入口关系;
  • 某个产品或资料的公开责任从一个站点转移到另一个站点。

逐站检查与职责变化直接相关的内容:

层级 复查内容
站点角色 业务职责是否已经变化
公开范围 页面和文件是否仍符合授权
技术入口 robots、sitemap 和公开 URL 是否仍对应新的职责
安全边界 后台、API、客户文件是否仍受保护
跨站关系 链接目标是否正式且不泄露受限资料
日志线索 不同站点是否分别记录 crawler、路径和状态

日志中的 User-Agent 只是线索,不能单独证明来自对应平台。一个站点有访问记录,也不能推断同一企业的其他站点已经被抓取、索引或引用。

多站点外贸企业区分 AI 爬虫策略,核心不是给品牌站、产品站和资料站贴上固定标签,而是把每个站点的业务职责、公开内容、敏感资料和技术入口分别记录。站点策略分层只能改善治理和访问边界,不能保证平台抓取、索引、AI 引用或询盘。

参考资料

内卷越来越激烈,再不做好独立站,就真的晚了!

添加微信咨询

扫描二维码添加微信客服

联系我们

  • 微信同号: 13077312120
  • Email: service@wphuo.com
  • 地址: 工业设计城智点汇7楼701 佛山市顺德区工业大道32号