robots.txt 在外贸AI SEO里主要管“哪些爬虫能访问哪些URL”,不是索引开关,也不是AI引用保证。它能表达抓取策略,但不能替代 noindex、内容质量和平台引用机制。
外贸企业最容易在这里犯一个错:看到 AI 搜索,就想在 robots.txt 里加几行,然后期待 ChatGPT、Perplexity、Claude 或 Google AI Overviews 开始引用网站。
这不是 robots.txt 能完成的事。
更准确地说,robots.txt 是准入层的文件。它回答的是:某个 user-agent 能不能抓某个目录或 URL。至于页面会不会被索引、会不会被 AI 回答引用,是后面的环节。
robots.txt 先管抓取,不直接管引用
| 问题 | robots.txt 能不能直接解决? | 更准确的处理方式 |
|---|---|---|
| 不想让某个 crawler 抓产品页 | 可以,用对应 User-agent + Disallow 表达 |
先确认 crawler 是否尊重 robots.txt |
| 想允许 AI 搜索 bot 访问公开页面 | 可以,用对应 User-agent + Allow 表达 |
同时检查 CDN/WAF 是否拦截 |
| 不想让 Google 索引某个页面 | 不应只靠 robots.txt | 使用 noindex,并保证 Googlebot 能看到这个规则 |
| 想让 AI 搜索一定引用页面 | 不能 | 还要看索引资格、内容匹配、来源选择 |
| 不想让敏感数据泄露 | 不能只靠 robots.txt | 登录权限、密码保护、服务器权限才是核心 |
Google 的 robots.txt 说明很清楚:它主要用于管理 crawler traffic。对网页来说,Google 不建议把 robots.txt 当成隐藏页面的方式;如果页面被外部链接指向,即使 Google 不抓取页面内容,URL 仍可能在搜索结果中出现。
所以,外贸AI SEO里谈 robots.txt,第一句话就要收住:它是抓取管理工具,不是搜索结果或 AI 引用的总开关。
抓取、训练、搜索引用,不是一回事
外贸站做 AI 可见性时,robots.txt 的价值在于“分用途表达策略”。
| 用途 | 典型问题 | robots.txt 的角色 |
|---|---|---|
| 抓取访问 | crawler 能不能请求页面? | 可以配置允许或限制 |
| 训练抓取 | 内容是否允许被用于模型训练相关抓取? | 某些平台提供对应 user-agent,可单独限制 |
| 搜索展示 | 内容是否允许进入搜索结果或链接展示场景? | 某些平台提供搜索 bot,可单独允许 |
| 用户触发访问 | 用户在 AI 产品里要求访问某页面 | 有些平台说明这类访问不等同自动抓取,robots.txt 规则可能不适用 |
| 引用选择 | AI 是否在答案里引用你 | robots.txt 不能保证 |
OpenAI 官方把搜索抓取、训练抓取、用户触发访问拆开说明。以 OpenAI 为例,OAI-SearchBot 面向 ChatGPT 搜索结果展示,GPTBot 面向可能用于训练基础模型的抓取,ChatGPT-User 则是用户触发访问,不用于自动网页抓取,也不决定内容是否出现在 Search。
这就是为什么外贸站不能只写一句“允许 AI 爬虫”。你要先知道自己允许的是搜索抓取,还是训练抓取;具体到 OpenAI 三个 user-agent 的细分,应在单独文章里展开。
一个外贸站可以怎么分目录
先按业务风险分页面,比直接改配置更稳。
| 目录/页面 | 推荐策略 | 原因 |
|---|---|---|
/products/ |
通常允许搜索相关 crawler | 产品规格、用途、材质、认证是公开推广信息 |
/categories/ |
通常允许搜索相关 crawler | 承接品类词和供应商筛选意图 |
/cases/ |
公开案例可允许,敏感客户信息先脱敏 | 案例对 AI 回答有解释价值 |
/faq/ |
通常允许搜索相关 crawler | FAQ 适合被整理成直接答案 |
/rfq/ |
说明页可允许,提交数据必须保护 | RFQ 是转化入口,不是用户数据出口 |
/downloads/ |
谨慎 | 可能有报价单、图纸、非公开资料 |
/admin/、/account/ |
不应依赖 robots.txt 保护 | 应使用登录、权限、服务器访问控制 |
注意最后一行:后台和客户数据不能靠 robots.txt 保护。robots.txt 是给守规则的 crawler 看的,不是安全系统。
配置示例:按用途拆,不要一刀切
假设企业策略是:公开营销页面允许部分 AI 搜索抓取,但训练抓取暂时限制。可以这样表达:
# Allow selected AI search crawlers to access public marketing pages
User-agent: OAI-SearchBot
Allow: /products/
Allow: /categories/
Allow: /cases/
Allow: /faq/
Disallow: /downloads/
Disallow: /admin/
Disallow: /account/
User-agent: PerplexityBot
Allow: /products/
Allow: /categories/
Allow: /cases/
Allow: /faq/
Disallow: /downloads/
Disallow: /admin/
Disallow: /account/
# Restrict selected training crawlers
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
这只是示例。不同企业的风险偏好不同:有些企业希望更多公开内容被训练抓取,有些企业不希望。关键是先把搜索、训练、用户访问分开讨论,再进入某个平台的具体 user-agent 配置。
noindex 和 robots.txt 要分清
Google 这条线尤其要注意。
如果你想让某个页面不要出现在 Google Search,应该看 noindex,不是只看 robots.txt。Google 官方文档说明,noindex 可以通过 meta 标签或 HTTP header 阻止支持该规则的搜索引擎索引页面;但要让它生效,页面不能被 robots.txt 挡住,否则 Googlebot 看不到这个 noindex。
一个常见错误配置是:
User-agent: Googlebot
Disallow: /private-page/
然后页面里又写:
<meta name="robots" content="noindex">
问题是:如果 Googlebot 被 robots.txt 拦在外面,它可能看不到页面里的 noindex。这就是为什么抓取控制和索引控制不能混着写。
外贸AI SEO里 robots.txt 的正确工作流
- 列页面:先列公开推广页、半公开资料页、敏感页。
- 定用途:分别决定搜索抓取、训练抓取、用户触发访问的策略。
- 写配置:按 user-agent 分组,不要只靠
User-agent: *。 - 查日志:确认 crawler 是否真的访问过核心 URL。
- 查状态码:重点看
200、301、403、404、5xx。 - 查索引:Google 线用 Search Console 和
noindex规则单独确认。 - 查引用:AI 搜索引用要单独监测,不能用抓取日志替代。
这套流程的好处是,它能把“我感觉 AI 没看到我们”变成可排查的问题。
最后记住三句话
robots.txt 能表达抓取意愿,但不能强制所有 crawler 行为。
robots.txt 能限制抓取,但不等于禁止 Google 索引。
robots.txt 能帮助 AI 搜索准入,但不能保证 AI 回答引用。
把这三句话讲清楚,外贸AI SEO就已经比很多泛泛而谈的教程靠谱了。