品牌站、产品站和资料站承担的任务不同,不能因为属于同一家外贸企业,就复制同一份 AI 爬虫策略。品牌站先保证公司实体、公开能力、认证和可核验案例信息,产品站先保证可采购内容,资料站则要把公开技术文档与客户文件、报价和内部版本分开。
这里的“品牌站、产品站、资料站”是企业内部的业务角色分类,不是 Google、OpenAI 或 Perplexity 定义的官方站点类型。本文只讲多站点的公开范围、访问边界和记录方式,不讨论域名架构优劣或内容营销打法。
先定义每个站点的业务职责
无论这些内容部署在不同站点还是不同公开路径,先不要按 URL 数量管理,而要回答每个站点负责什么。本文只按业务职责拆分策略,不评价站点架构优劣:
| 站点角色 | 常见内容 | 主要访问目标 |
|---|---|---|
| 品牌站 | 公司实体、工厂、认证、服务区域、联系方式、案例入口 | 让访问者理解企业是谁、做什么和服务谁 |
| 产品站 | 产品分类、型号、规格、应用、FAQ、RFQ 说明 | 让买家找到可采购的产品和下一步入口 |
| 资料站 | 规格书、安装手册、目录、证书、技术文档 | 让访问者获取已批准公开的资料 |
真正重要的是业务职责和内容权限要写清楚。
为什么不能复制一份 robots.txt
品牌站允许访问公开 About 页,不代表资料站的客户文件也应该公开。产品站允许访问型号页,也不代表后台、报价接口和内部下载目录可以跟着放开。
每个站点至少分别记录:
| 记录项 | 为什么要单站维护 |
|---|---|
| 域名或 hostname | CDN、证书、缓存和安全规则可能不同 |
| robots.txt | 每个站点的公开目录和受限目录不同 |
| sitemap | 只能放对应站点希望作为入口的规范 URL |
| canonical | 跨站复制内容时,规范归属可能不同 |
| WAF / 安全动作 | 一个站点的规则不一定作用于另一个站点 |
| 日志位置和格式 | 不同主机、CDN 或应用可能使用不同字段 |
| 负责人 | 品牌、产品和资料更新可能由不同团队负责 |
“集团统一开放”不是一个可直接执行的技术动作。正确做法是先建立站点矩阵,再逐站检查。
品牌站:公开实体,但不公开内部资料
品牌站通常承接公司是谁、服务哪些市场、有哪些工厂或能力等问题。可以优先整理:
- 公司名称和品牌名称;
- 工厂或办公地点的公开信息;
- 产品和服务范围;
- 认证、质量体系和公开案例;
- 联系方式、服务区域和主要产品入口。
品牌站要避免把内部组织、客户合同、未公开报价、后台地址或测试链接放进公开页面。品牌站的“公开”是公开企业实体信息,不是把企业所有文件都公开。
品牌站的核心 URL 可以单独记录:
BRAND_PUBLIC
/
/about/
/certifications/
/case-studies/
/contact/
BRAND_PROTECTED
/admin/
/login/
/staging/
/customer-files/
/internal/
这只是站点角色记录示例,不是通用安全插件配置。真实受保护路径仍需要认证、权限和服务器或 WAF 层控制。
产品站:先保证可采购内容的入口
产品站的公开重点通常是:
| 页面 | 应检查什么 |
|---|---|
| 产品分类页 | 产品集合、分类路径和产品卡片链接 |
| 产品详情页 | 型号、规格、应用、材料或兼容信息 |
| 应用页 | 产品和采购场景之间的关系 |
| FAQ 页 | 常见选型、交期、认证或使用问题 |
| RFQ 说明页 | 采购流程、提交条件和公开说明 |
产品站不应把客户专属价格、报价附件、未发布型号或提交接口当成公开内容。公开产品页和受保护 RFQ 数据是两种不同的访问边界,不能因为 URL 都在同一个站点就合并管理。
产品站可以把公开入口记录成:
PRODUCT_PUBLIC
/products/
/applications/
/faq/
/request-a-quote/
PRODUCT_PROTECTED
/wp-admin/
/login/
/api/submit/
/uploads/private/
/customer-quotes/
站点策略的核心不是“产品站必须开放所有 AI crawler”,而是先确认哪些页面属于公开产品推广内容,再按企业对不同平台和用途的实际选择配置。
资料站:先区分公开版和受限版
资料站最容易出现“公开技术资料”和“客户专属文件”混在一起:
| 资料类型 | 处理方向 |
|---|---|
| 公开规格书、安装手册、公开目录 | 可以进入正式公开资料路径 |
| 公开认证和标准说明 | 先确认版本、范围和公开授权 |
| 内部测试报告、成本资料 | 不放公开下载目录 |
| 客户图纸、合同附件、定制方案 | 使用登录、权限或私有存储 |
| 未发布产品手册 | 先留在受控环境,发布后再建立正式入口 |
robots.txt 和 noindex 不能替代资料访问权限。一个客户文件如果不应被别人打开,第一步应是限制访问、撤回文件或使用私有存储,而不是只在页面上增加 SEO 标签。
资料站的公开和受限目录可以这样记录:
DOCS_PUBLIC
/catalogs/
/installation-guides/
/certifications/
/product-manuals/public/
DOCS_RESTRICTED
/customer-drawings/
/private-quotes/
/internal-test-reports/
/product-manuals/unreleased/
不同站点的 crawler 策略如何分开记录
OpenAI、Perplexity 和 Anthropic 对 crawler 用途的定义并不完全相同。企业内部记录时至少要把“搜索相关访问”“训练相关抓取”和“用户触发访问”分开,不要把所有 User-Agent 合并成一个“AI 流量”。
可以用站点矩阵表达策略,而不是用一句“全站放行”:
站点角色,站点地址,公开内容,受限内容,搜索相关crawler策略,训练相关crawler策略,用户触发访问,负责人,复查日期
品牌站,https://brand.example.com,实体/认证/案例,内部资料/测试路径,按公开页面决定,单独评估,公开页保持可访问,brand-owner,待定
产品站,https://products.example.com,分类/产品/应用/FAQ/RFQ说明,报价/提交接口/客户文件,按公开产品页决定,单独评估,公开页保持可访问,product-owner,待定
资料站,https://docs.example.com,公开目录/手册/证书,客户图纸/报价/内部版本,只开放已批准资料,单独评估,受限资料仍需权限,docs-owner,待定
表格里的“按公开页面决定”和“单独评估”是有意保留的空位。企业应根据自己的公开授权、风险和平台策略填写,不要把它们替换成无依据的统一答案。
多站点之间如何建立清晰关系
跨站链接可以帮助访问者从品牌站进入产品站、从产品站进入公开资料站,但链接关系必须和页面公开级别一致:
| 来源 | 可以链接到 | 需要注意 |
|---|---|---|
| 品牌站 | 产品分类、核心产品站、公开案例 | 目标 URL 要稳定、公开、可访问 |
| 产品站 | 品牌实体、公开规格书、安装说明 | 不把客户文件或私有下载地址放进公开内链 |
| 资料站 | 对应产品页、品牌主体和公开目录 | 只回链公开资料和正式产品入口 |
跨站链接只服务于公开页面之间的清晰导航,不要把客户文件、私有下载地址或内部路径带入公开发现路径。每个站点都要明确自己的正式公开入口和受限资料边界。
逐站检查 robots、sitemap 和核心 URL
准备 sites.txt,每行一个站点根地址:
https://brand.example.com
https://products.example.com
https://docs.example.com
然后逐站检查:
while IFS= read -r site; do
[ -z "$site" ] && continue
site="${site%/}"
printf '\n== %s robots.txt ==\n' "$site"
curl -sSL "$site/robots.txt" |
sed -n '1,120p'
printf '\n== %s sitemap headers ==\n' "$site"
curl -sSL -D - -o /dev/null "$site/sitemap.xml" |
grep -Ei '^(HTTP/|content-type:|location:)'
done < sites.txt
默认路径只是示例。实际站点可能使用 sitemap index 或其他地址,应按每个站点的记录表替换。
再抽查公开和受保护路径:
site,type,path
https://brand.example.com,public,/about/
https://brand.example.com,protected,/staging/
https://products.example.com,public,/products/
https://products.example.com,protected,/api/submit/
https://docs.example.com,public,/catalogs/
https://docs.example.com,protected,/customer-drawings/
tail -n +2 site-paths.csv |
while IFS=, read -r site type path; do
[ -z "$site" ] && continue
site="${site%/}"
printf '\n== %s %s %s ==\n' "$site" "$type" "$path"
curl -sS -D - -o /dev/null "$site$path" |
grep -Ei '^(HTTP/|location:|content-type:|www-authenticate:|x-robots-tag:)'
done
这只是在授权范围内观察匿名响应,不尝试绕过登录、访问控制或私有下载。
站点职责或公开范围变化后检查什么
出现以下变化时,要重新确认对应站点的策略记录:
- 品牌站新增产品推广职责,或产品站开始承接品牌实体信息;
- 新增产品站或资料站;
- 资料从私有改成公开,或从公开改成受限;
- 站点之间新增、删除或调整公开入口关系;
- 某个产品或资料的公开责任从一个站点转移到另一个站点。
逐站检查与职责变化直接相关的内容:
| 层级 | 复查内容 |
|---|---|
| 站点角色 | 业务职责是否已经变化 |
| 公开范围 | 页面和文件是否仍符合授权 |
| 技术入口 | robots、sitemap 和公开 URL 是否仍对应新的职责 |
| 安全边界 | 后台、API、客户文件是否仍受保护 |
| 跨站关系 | 链接目标是否正式且不泄露受限资料 |
| 日志线索 | 不同站点是否分别记录 crawler、路径和状态 |
日志中的 User-Agent 只是线索,不能单独证明来自对应平台。一个站点有访问记录,也不能推断同一企业的其他站点已经被抓取、索引或引用。
多站点外贸企业区分 AI 爬虫策略,核心不是给品牌站、产品站和资料站贴上固定标签,而是把每个站点的业务职责、公开内容、敏感资料和技术入口分别记录。站点策略分层只能改善治理和访问边界,不能保证平台抓取、索引、AI 引用或询盘。