做 Claude 可见性,第一步不是“全部放行 AI 爬虫”,而是先分清谁在访问、为什么访问、访问后可能带来什么影响。尤其是
anthropic-ai这个词,不应直接当成 Anthropic 当前官方 bot 来配置;当前应以官方列出的ClaudeBot、Claude-User、Claude-SearchBot为准。
很多外贸站开始看服务器日志,会看到一堆 AI 相关 user-agent,于是想直接写一段 robots.txt:“让有价值的进来,把训练爬虫挡掉。”
方向没错,但这里最容易踩坑的地方,是把旧文章、第三方列表、日志里的模糊名称,当成官方口径。ClaudeBot anthropic-ai外贸站边界 这个问题,核心不是“怎么复制一段规则”,而是:你到底想让 Claude 访问哪些公开推广内容,又不想让哪些内容进入模型训练或被误抓。
先纠正:不要把 anthropic-ai 当成当前官方 bot
如果你在网上看到 anthropic-ai,建议先停一下。
按 Anthropic 当前官方说明,明确列出的 bot 是三个:
ClaudeBotClaude-UserClaude-SearchBot
也就是说,anthropic-ai 不应被写成“Anthropic 当前官方 crawler”来讲,更不建议把它作为 robots.txt 的核心配置对象。
外贸站更稳妥的做法是:
- robots.txt 里只针对官方当前列出的 user-agent 写规则。
- 日志里可以搜索
anthropic-ai,但把它当作“待排查字符串”,不要当作官方身份。 - 如果要做 WAF 白名单或拦截,不能只看 user-agent,因为 user-agent 可以伪造;要结合官方 IP JSON 判断。
这点很关键。robots.txt 是给守规则的爬虫看的,不是安全边界。
三个 Claude 相关 bot,作用不一样
| User-agent | 官方用途边界 | 外贸站应该怎么看 | 如果限制访问,可能影响什么 |
|---|---|---|---|
ClaudeBot |
与收集公开网页内容、可能用于模型训练相关 | 如果企业不希望公开内容被用于未来训练数据集,可以单独限制它 | 更偏训练数据退出信号,不等同于搜索可见性开关 |
Claude-SearchBot |
用于提升 Claude 搜索结果质量和相关性 | 对希望在 Claude 搜索相关场景中被发现的公开推广页,可以考虑放行 | 可能降低内容在 Claude 搜索相关结果中的可见性和准确性 |
Claude-User |
用户向 Claude 提问时触发访问网页 | 适合让公开产品页、FAQ、案例页在用户主动查询时可被访问 | 用户请求触发的访问可能拿不到你的页面内容 |
这个表背后的策略很简单:不要用一个规则处理三种目的。
比如,外贸企业可能愿意让 Claude-SearchBot 访问英文产品页、行业方案页和 FAQ,因为这些页面本来就是为了获客而公开的;但企业可能不愿意让 ClaudeBot 抓取整站内容用于训练。两者可以分开写。
外贸网站哪些页面值得开放
建议优先让搜索相关 bot 访问这些公开页面:
| 页面类型 | 为什么值得开放 |
|---|---|
| 首页、About、Factory、Manufacturer 页面 | 帮助 AI 系统理解你是谁、卖什么、面向哪些市场 |
| 产品分类页 | 比单个产品页更容易表达供应范围和行业覆盖 |
| 产品详情页 | 型号、材质、规格、认证、MOQ、交期等信息适合被提取 |
| FAQ 页面 | 买家常问问题天然适合被 AI 摘取成答案 |
| 应用场景页 | 适合承接 “best supplier for…” “how to choose…” 这类问题 |
| 案例页 | 能提供行业、国家、问题、解决方案等上下文 |
但下面这些内容,不应该只靠 robots.txt 保护:
- 客户报价单
- 未公开价格表
- 合同、PI、发票、物流文件
- 登录后资料
- staging 测试站
- 内部搜索结果页
- WordPress 后台、会员中心、购物车、结账页
原因很现实:robots.txt 只能约束愿意遵守规则的 crawler。真正敏感的信息,应该用登录权限、服务器鉴权、目录访问控制、WAF 或直接不公开来处理。
robots.txt 示例:搜索相关放开,训练相关单独决策
如果你的目标是让 Claude 搜索相关能力能访问公开推广页,但不希望 ClaudeBot 抓取内容用于训练,可以这样写:
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: ClaudeBot
Disallow: /
如果你的策略是允许 Anthropic 官方 bot 访问公开内容,但服务器压力比较敏感,可以给 ClaudeBot 设置 crawl delay。Anthropic 官方说明支持 Crawl-delay 这个非标准扩展。
User-agent: ClaudeBot
Allow: /
Crawl-delay: 5
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
如果是 WordPress 外贸站,后台和交易相关路径仍然建议保持限制:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /private/
这里有个常见误区:不要因为“想做 AI SEO”,就把全站无脑开放。AI 可见性要服务业务,不是把所有 URL 都交出去。
日志排查:先确认谁来过
Nginx 常见日志可以先这样扫:
zgrep -hE 'ClaudeBot|Claude-User|Claude-SearchBot|anthropic-ai' /var/log/nginx/access.log* | head -100
统计不同 user-agent 的访问量:
zgrep -hE 'ClaudeBot|Claude-User|Claude-SearchBot|anthropic-ai' /var/log/nginx/access.log* | awk -F\" '{print $6}' | sed -E 's/.*(ClaudeBot|Claude-User|Claude-SearchBot|anthropic-ai).*/\1/' | sort | uniq -c | sort -nr
看它们主要访问了哪些 URL:
zgrep -hE 'ClaudeBot|Claude-User|Claude-SearchBot' /var/log/nginx/access.log* | awk -F\" '{print $2}' | awk '{print $2}' | sort | uniq -c | sort -nr | head -50
拉取 Anthropic 官方 IP 段:
curl -s https://claude.com/crawling/bots.json | jq '.prefixes[]'
如果你发现访问集中在 /wp-admin/、搜索页、参数页、重复 tag 页,优先处理站内结构和 robots 规则;如果访问集中在核心产品页、FAQ、案例页,说明至少入口方向是对的,下一步该看页面内容是否足够清楚。
真正影响外贸转化的,不只是能不能抓
让 Claude-SearchBot 或 Claude-User 能访问页面,只是入场券。外贸站还要让页面“值得被拿来回答问题”。
一个好的产品页,应该直接回答这些问题:
- 这是什么产品?
- 适合哪些行业和国家市场?
- 关键规格是什么?
- 支持哪些材料、尺寸、认证、包装、定制?
- MOQ、样品、交期、付款方式有没有说明?
- 买家为什么应该相信这个供应商?
不要只写 “high quality, competitive price, best service”。这种内容对人没信息量,对 AI 也没可引用价值。
更好的写法是把信息结构化:
Product: Stainless Steel Ball Valve
Material: SS304 / SS316
Size Range: 1/4 inch to 4 inch
Connection: Threaded / Flanged / Welded
Application: Water treatment, food processing, chemical pipelines
MOQ: 100 pieces
Lead Time: 20-35 days depending on order quantity
Customization: Logo, handle color, packaging, thread standard
这种内容不是为了讨好爬虫,而是为了让海外买家和 AI 系统都能快速理解你的供应能力。
建议外贸团队这样落地
先把 URL 分成三类:
| 类型 | 处理建议 |
|---|---|
| 公开获客内容 | 可考虑允许 Claude-SearchBot 和 Claude-User |
| 公开但不想用于训练的内容 | 可以允许搜索相关 bot,同时限制 ClaudeBot |
| 非公开或敏感内容 | 不依赖 robots.txt,必须做权限控制 |
然后观察一段时间的日志,看访问路径、状态码、频率是否正常。不要只盯“有没有 AI bot 来”,更要看它们有没有访问你真正想推广的英文页面。
外贸 AI SEO 的重点不是神秘技巧,而是三个基础动作:
- 技术上允许该访问的页面被访问。
- 内容上把买家关心的信息讲清楚。
- 安全上不要把 robots.txt 当保险柜。
做到这三点,Claude 相关可见性才是在业务边界内做优化,而不是盲目开放整站。
最后还要把预期放稳:允许访问只是让页面有机会被读取、被理解、被用于相关搜索场景;它不是 Claude 引用保证,也不是排名按钮。外贸企业真正能长期积累的,是公开页面的信息质量、供应能力表达和可验证的业务细节。