AI搜索准入解决的是“平台或爬虫有没有机会访问你”;SEO收录解决的是“搜索引擎是否把页面纳入索引并可能展示”。两者有关联,但不是一回事。外贸站如果把它们混在一起,很容易把 robots、noindex、sitemap、结构化数据都配错。
外贸企业做 AI SEO 时,最容易听到一句话:
“我们网站已经收录了,为什么 AI 还是不引用?”
或者反过来:
“我放开 GPTBot 了,是不是 ChatGPT 就会收录我?”
这两个问题背后,其实是同一个误区:把 AI 搜索准入和传统 SEO 收录混成了一件事。
先把话说准:AI搜索准入 不是一个所有平台统一使用的官方术语。这里把它定义成:你的公开页面能否被特定 AI 搜索、回答系统、搜索爬虫或用户触发访问器访问、抓取、检索,进而有机会成为候选来源。
它是前提,不是结果。
先拆成四层
对外贸站来说,最实用的拆法是四层:
| 层级 | 解决的问题 | 常见控制项 | 不能代表什么 |
|---|---|---|---|
| 准入 | 某个平台能不能访问页面 | robots.txt、WAF、CDN、防火墙、登录限制 | 不代表已经抓取 |
| 抓取 | 爬虫有没有实际请求页面 | access log、状态码、User-Agent、IP 校验 | 不代表进入索引 |
| 索引 / 收录 | 搜索系统是否把页面纳入索引 | 200、可索引内容、noindex、canonical、sitemap |
不代表一定展示 |
| 引用 / 展示 | AI features 或 AI 搜索是否把页面作为链接或来源 | 查询意图、内容匹配、snippet eligibility、平台机制 | 不代表稳定排名或询盘 |
这四层不能跳。
如果页面连准入都没有,后面基本谈不上。
但准入打开了,也只是“可能被访问”,不是“已经被引用”。
SEO收录在Google里大概怎么发生
Google 官方把 Search 的工作过程讲得很清楚:抓取、索引、提供搜索结果。URL 发现属于抓取前后的发现流程,不应该被写成和抓取、索引、展示并列的独立结果层。
这几步分别会出问题:
| 阶段 | 外贸站常见问题 |
|---|---|
| 抓取(含 URL 发现) | 产品页藏得太深、没有 sitemap、内链断掉、robots.txt 误挡、WAF 拦截、服务器 403 / 5xx |
| 索引 | 页面 noindex、内容太薄、canonical 指错、非 200 状态 |
| 展示 / 提供搜索结果 | 查询不匹配、snippet 被限制、页面质量或相关性不足 |
Google 也明确说过:即使页面符合 Search Essentials,也不保证一定会被抓取、索引或展示。
这句话很关键。
所以传统 SEO 收录不是“我提交了就有”,而是搜索系统对页面发现、访问、处理、判断后的结果。
AI搜索准入又是什么
AI 搜索准入更像“入口权限和候选条件”。
不同平台入口不一样:
| 平台 / 体系 | 你要先分清什么 |
|---|---|
| Google AI Overviews / AI Mode | 它属于 Google Search 体系;支持链接需要页面已被索引,并且有资格在 Google Search 展示 snippet |
| OpenAI | GPTBot、OAI-SearchBot、ChatGPT-User 不是同一个用途 |
| Perplexity | PerplexityBot 和 Perplexity-User 要分开看 |
| Anthropic / Claude | ClaudeBot、Claude-SearchBot、Claude-User 要分开看 |
| Copilot | 不能绕开 Bing / Microsoft 搜索生态基础 |
最容易错的是 OpenAI。
GPTBot 更偏 OpenAI 的模型训练抓取;OAI-SearchBot 才是与 Search 相关的 crawler;ChatGPT-User 是用户触发访问。你不能简单写成“放开 GPTBot = ChatGPT Search 会收录我”。
Perplexity 也类似。官方区分 PerplexityBot 和 Perplexity-User,并且说明 Perplexity-User 通常会忽略 robots.txt,因为它代表用户请求。
所以 AI 搜索准入不是一句“允许 AI 爬虫”就完事,而是要看:
- 是哪个平台;
- 是哪个 user agent;
- 是自动抓取,还是用户触发访问;
- robots.txt 对它是否适用;
- 服务器、CDN、WAF 是否放行;
- 页面本身是否公开、可读、可引用。
Google AI features的边界要单独说
如果你说的是 Google AI Overviews 或 AI Mode,逻辑要回到 Google Search。
Google 官方说,页面要有资格作为 AI Overviews 或 AI Mode 的 supporting link,需要:
- 已被 Google 索引;
- 有资格在 Google Search 中展示 snippet;
- 满足 Google Search 的技术要求;
- 没有额外 AI 专用技术要求。
这意味着什么?
不是做一个“AI 专用 sitemap”就行。
不是放一个 llms.txt 就行。
也不是套一个 FAQ Schema 就能被引用。
对 Google 来说,基础仍然是:
| 检查项 | 为什么重要 |
|---|---|
| robots.txt 没挡 Googlebot | 不先让 Googlebot 抓到,后面很难处理 |
页面返回 200 |
非成功状态通常不适合进入索引 |
| 重要正文是文本 | 图片里的参数、规格、FAQ 很难稳定理解 |
没有误加 noindex |
noindex 会阻止页面进入搜索结果 |
| snippet 没被完全限制 | supporting link 需要有资格展示摘要 |
| canonical 指向正确 | Google 通常用 canonical 页面作为主要评价对象 |
这就是为什么 AI SEO 不能脱离传统 SEO 基础。
robots.txt和noindex别再混用
很多外贸站把这两个东西当成一个开关,这是事故源。
robots.txt 主要控制抓取。
noindex 控制索引。
一个典型错误是:
User-agent: *
Disallow: /old-products/
如果你的目标是“不要让某些旧产品页继续出现在 Google 搜索结果”,只用 robots.txt 并不稳。因为 Google 需要抓到页面,才能看到页面里的 noindex。
更适合页面级不索引的是:
<meta name="robots" content="noindex">
PDF、图片、文档这类非 HTML 资源,可以用 HTTP Header:
X-Robots-Tag: noindex
但要注意:如果 robots.txt 先把 URL 挡住,Googlebot 可能看不到这个 noindex。
所以这两者不是谁更高级,而是控制层不同。
外贸站最常见的混淆
1. 把“能访问”当成“会引用”
日志里看到 OAI-SearchBot、PerplexityBot 或 Claude-SearchBot 请求了页面,只能说明它访问过。
不能证明它已经索引、理解、引用,更不能证明它带来询盘。
2. 把“Google收录”当成“所有AI平台可见”
Google 收录只说明 Google Search 体系里可能有基础。
ChatGPT、Perplexity、Claude、Copilot 是否使用、何时使用、怎样引用,要看各自平台机制。
3. 把“结构化数据”当成AI引用按钮
Schema.org、Product Schema、FAQPage、Organization Schema 可以帮助机器理解页面,Google 也有 rich result 相关规则。
但它们不是 AI 引用保证。
4. 把“llms.txt”当成Google AI要求
目前不能把 llms.txt 写成 Google Search 或 Google AI features 的必要配置。Google 官方已明确说 Search 不使用这些文件。
5. 把“屏蔽训练爬虫”当成“屏蔽搜索引用”
比如你屏蔽 GPTBot,主要影响的是 OpenAI 对训练用途的抓取;如果讨论 ChatGPT Search,就要看 OAI-SearchBot 的边界。
外贸企业应该怎么判断
不要先问“AI为什么不引用我”。先按顺序排。
| 顺序 | 问题 | 怎么看 |
|---|---|---|
| 1 | 页面是否公开可访问 | 浏览器、curl、状态码 |
| 2 | robots.txt 是否挡住关键 crawler | 检查规则和目录 |
| 3 | CDN / WAF 是否误拦截 | 看 403、挑战页、日志 |
| 4 | 页面是否能进入 Google 索引 | Search Console、URL Inspection |
| 5 | 是否有 noindex 或 snippet 限制 |
HTML、HTTP Header |
| 6 | canonical 是否指向自己或正确版本 | 页面源码 |
| 7 | 内容是否能回答采购问题 | 产品规格、认证、MOQ、交期、案例 |
| 8 | 平台 crawler 是否实际访问 | access log + 官方 IP / UA 文档 |
下面是最朴素的第一轮检查:
URL="https://www.example.com/products/industrial-pump/"
curl -sI -L "$URL"
curl -sL "$URL" | grep -Ei "robots|canonical|description"
curl -s https://www.example.com/robots.txt
如果服务器日志能拿到,再看关键 user agent:
grep -Ei 'Googlebot|bingbot|OAI-SearchBot|GPTBot|ChatGPT-User|PerplexityBot|Perplexity-User|ClaudeBot|Claude-SearchBot|Claude-User' /var/log/nginx/access.log
看日志时别急着下结论。
你至少要看:
- 请求了哪个 URL;
- 返回状态码是不是
200; - 是否被重定向到首页;
- 是否被 WAF 挑战页拦住;
- 请求的是产品页、FAQ页、案例页,还是无意义参数页。
这两件事怎么配合
可以把它理解成两条线。
第一条是传统搜索基础:
URL可发现 -> 可抓取 -> 可索引 -> 可展示 -> 有机会进入Google AI features
第二条是平台准入:
平台crawler/用户触发访问 -> 服务器放行 -> 页面可读 -> 有机会成为候选来源
两条线有交集,但不是同一条线。
对外贸企业来说,正确策略不是“只做 AI crawler”,也不是“只做 Google 收录”,而是:
- 先保证核心公开页面能被主流搜索系统正常发现和索引;
- 再按平台区分 AI crawler / search crawler / user-triggered fetcher;
- 最后用内容结构、证据、案例、FAQ 提升被理解和引用的可能性。
最后给一个判断标准
如果一个页面是公开推广页,比如产品页、供应商介绍页、案例页、FAQ页、RFQ说明页,它至少应该满足:
- 可直接访问;
- 返回
200; - 不被 robots.txt 误挡;
- 没有误加
noindex; - snippet 没被完全禁用;
- canonical 正确;
- 正文不是纯图片;
- sitemap 和内链都能发现它;
- 关键 AI / 搜索 crawler 不被 WAF 误伤。
做到这些,也只是把门打开。
能不能被 AI 搜索引用,还要看查询意图、内容质量、来源可信度和平台自己的选择机制。
这就是 AI 搜索准入和 SEO 收录的区别:一个是入口条件,一个是搜索系统处理后的状态;它们相互影响,但不能互相替代。
参考资料
- Google: In-depth guide to how Google Search works
- Google: Google Search technical requirements
- Google: AI features and your website
- Google: Robots meta tag, data-nosnippet, and X-Robots-Tag specifications
- Google: Block Search indexing with noindex
- Google: Introduction to robots.txt
- OpenAI: Overview of OpenAI Crawlers
- Perplexity Docs: Perplexity Crawlers
- Claude Help Center: Anthropic crawlers and robots.txt