ClaudeBot和PerplexityBot出现在同一份 access log 里,不代表它们可以按同一套口径统计。前者主要对应 Anthropic 的训练相关抓取,后者用于 Perplexity 搜索结果;日志比较时要先按平台用途分组,再看 URL、状态码和来源核验。
这篇只比较两类日志的判断方法,不重复第32篇的通用日志筛选教程。重点是:同样是一行 GET /products/,ClaudeBot 和 PerplexityBot 分别能说明什么,不能说明什么。
先比较“访问用途”
| 日志标记 | 平台文档所述用途方向 | 外贸站复盘问题 |
|---|---|---|
ClaudeBot |
Anthropic 用于收集可能有助于模型训练的公开网页内容 | 企业是否允许公开内容进入训练相关抓取 |
Claude-SearchBot |
Anthropic 用于改善搜索结果质量 | 公开产品页是否保留 Claude 搜索相关访问 |
PerplexityBot |
Perplexity 用于搜索结果中的网站发现和链接 | 产品页、FAQ、案例页是否被搜索 crawler 访问 |
Perplexity-User |
Perplexity 用户触发的页面访问 | 是否只是用户请求了某个具体 URL |
标题比较的是 ClaudeBot 和 PerplexityBot,但日志里可能同时出现同平台的其他标记。不要把 Claude-SearchBot、Perplexity-User 自动并入主统计,否则会把训练、搜索和用户触发访问混在一起。
同一条日志,四个字段要分开看
企业做对比时,最少保留这些字段:
| 字段 | 为什么重要 |
|---|---|
| User-Agent | 判断请求自称属于哪个平台和用途 |
| URL | 判断访问的是产品页、FAQ、案例还是敏感文件 |
| 状态码 | 区分可访问、重定向、拒绝和服务异常 |
| 时间 | 与改版、robots、CDN 或安全规则变更对照 |
只比较“ClaudeBot 访问 30 次,PerplexityBot 访问 20 次”,信息量很低。更有用的是:
哪个 bot 在什么时间访问了哪类页面?
页面返回了什么状态?
这次访问是搜索相关、训练相关,还是用户触发?
用脱敏样例做判断
下面是示例记录,不是真实访问数据:
198.51.100.20 - - [13/Aug/2026:22:10:01 +0800] "GET /products/industrial-valve/ HTTP/1.1" 200 8432 "-" "ClaudeBot"
198.51.100.21 - - [13/Aug/2026:22:11:07 +0800] "GET /case-studies/ HTTP/1.1" 200 9120 "-" "PerplexityBot/1.0"
198.51.100.22 - - [13/Aug/2026:22:12:15 +0800] "GET /customer-files/quote.pdf HTTP/1.1" 403 128 "-" "ClaudeBot"
198.51.100.23 - - [13/Aug/2026:22:13:26 +0800] "GET /products/pump-a/ HTTP/1.1" 200 7210 "-" "Perplexity-User/1.0"
| 记录 | 能先说什么 | 不能直接说什么 |
|---|---|---|
ClaudeBot 访问产品页并返回 200 |
声称为 ClaudeBot 的请求拿到了页面响应 | 内容已用于训练,或 Claude 已经推荐该产品 |
PerplexityBot 访问案例页并返回 200 |
声称为 PerplexityBot 的请求访问了公开案例页 | 页面一定被 Perplexity 引用 |
ClaudeBot 访问客户文件并返回 403 |
该次请求没有拿到文件正文 | 这是错误,或应该为 AI SEO 放开 |
| Perplexity-User 访问产品页 | 可能是用户触发的具体页面访问 | PerplexityBot 已系统性抓取产品目录 |
从企业内部分析角度看,这就是两类日志的核心差别:ClaudeBot 记录更接近训练相关内容资产决策,PerplexityBot 记录更接近搜索发现和链接场景。
复盘表里不要把它们放在一栏
推荐按“平台、用途、业务动作”拆开:
平台,User-Agent,用途分组,页面类型,状态码,业务判断,下一步
Anthropic,ClaudeBot,训练相关抓取,产品页,200,公开页面被请求,核对企业公开边界
Anthropic,ClaudeBot,训练相关抓取,客户文件,403,受限文件未返回,保持权限边界
Perplexity,PerplexityBot,搜索相关抓取,案例页,200,公开案例被请求,记录页面和时间
Perplexity,Perplexity-User,用户触发访问,产品页,200,可能是用户指定页面,不要并入常规crawler统计
如果团队本次报表只比较 ClaudeBot 和 PerplexityBot 两类自动 crawler,可以单独统计它们;如果要做完整平台复盘,再另设列记录 Claude-SearchBot 和 Perplexity-User,不能直接相加,也不能据此认定其他 bot 不重要。
状态码的比较口径
相同状态码在不同页面上的含义不完全一样:
| 状态码 | ClaudeBot 记录 | PerplexityBot 记录 |
|---|---|---|
200 |
公开页面返回了正文响应,需再看用途和正文 | 搜索相关请求拿到了响应,需再看来源与页面内容 |
301/302 |
看是否跳到正确公开 URL | 看是否跳到正确公开 URL,而不是首页或登录页 |
403 |
可能是权限、WAF、服务器或应用层拒绝 | 可能是权限、WAF、服务器或应用层拒绝 |
404 |
检查旧链接和公开文件状态 | 作为站内排查动作,检查 sitemap、内链和搜索入口 |
5xx |
先排查站点稳定性 | 先排查站点稳定性 |
不要因为 PerplexityBot 的 200 更接近搜索场景,就把它写成“已引用”;也不要因为 ClaudeBot 的 200 就写成“已进入训练数据”。日志只能证明一次请求线索和响应结果。
User-Agent 只是第一层证据
ClaudeBot 或 PerplexityBot 这个字符串可以被伪造。正式复盘时,至少把它与官方来源信息、请求时间、URL、状态码和服务器安全日志放在一起看。
对于 Perplexity,平台文档区分 PerplexityBot 与 Perplexity-User,并提供对应的 IP 地址入口。Anthropic 也在平台说明中区分 ClaudeBot、Claude-SearchBot 和 Claude-User。企业不要把同一平台的不同用途合并成一个“AI 流量”。
更稳妥的记录口径是:
日志中发现声称为 ClaudeBot 的请求,访问了公开产品页并返回 200。
日志中发现声称为 PerplexityBot 的请求,访问了案例页并返回 200。
这些记录仍需结合平台官方来源信息核对,不能证明训练、索引、引用或询盘结果。
外贸团队该如何分工
| 角色 | 负责判断 |
|---|---|
| SEO | 页面属于产品、FAQ、案例还是客户资料 |
| 技术 | 日志字段、状态码、来源核验和安全层响应 |
| 内容 | 页面是否有真实规格、应用和案例证据 |
| 业务负责人 | 哪些内容公开,哪些内容不应进入训练或搜索场景 |
这样比较的结果才有业务价值:不是争论哪个 bot 数量更多,而是知道哪类公开资产被什么用途访问,以及是否符合企业的公开边界。