Perplexity SEO 的第一步,不是改标题,也不是堆问答,而是确认
PerplexityBot能访问你的核心公开页面:首页、产品页、分类页、FAQ、案例页和供应商介绍页。访问确认只说明准入没有明显障碍,不保证 Perplexity 一定引用、展示或带来询盘。
Perplexity 这类引用型搜索,对外贸站有一个很现实的前提:页面得先能被访问。
如果 PerplexityBot 进不了你的产品页、FAQ、案例页,那后面的内容结构化、对比页、案例拆解都只是纸上谈兵。
所以这篇不再讲“PerplexityBot 为什么值得关注”。第 6 篇已经讲过。
这篇只讲操作:怎么确认 PerplexityBot核心页面访问确认 已经做到位。
先分清本次检查对象
Perplexity 官方区分两个 user-agent:
| User-Agent | 本次怎么处理 |
|---|---|
PerplexityBot |
本文主角,用于确认核心页面访问 |
Perplexity-User |
用户触发访问,只用于排除日志误判 |
官方说明 PerplexityBot 用于让网站在 Perplexity 搜索结果中被展示和链接,不用于训练 AI foundation models。
Perplexity-User 则是用户提问或操作触发的访问,不是常规搜索索引爬虫,也不用于网页爬取或训练。
所以,做 Perplexity SEO 的第一步,主看 PerplexityBot。日志里看到 Perplexity-User 时,只记录为用户触发访问,不拿它代替 PerplexityBot 的核心页面访问确认。
第一步:列出核心页面清单
不要只测首页。
外贸站至少要测这几类:
| 页面类型 | 示例 URL | 为什么重要 |
|---|---|---|
| 首页 | / |
判断站点基础入口 |
| 产品分类页 | /products/ |
表达供应范围 |
| 产品详情页 | /products/stainless-steel-valve/ |
承载规格、材质、MOQ、认证 |
| FAQ 页 | /faq/ |
回答售前问题 |
| 案例页 | /case-studies/chemical-plant-valve-project/ |
提供业务证据 |
| 供应商介绍页 | /about/、/factory/ |
说明公司实体和能力 |
| 资源页 | /guides/、/blog/ |
承接选型和教育型问题 |
可以先写成数组:
URLS=(
"https://www.example.com/"
"https://www.example.com/products/"
"https://www.example.com/products/stainless-steel-valve/"
"https://www.example.com/faq/"
"https://www.example.com/case-studies/chemical-plant-valve-project/"
"https://www.example.com/about/"
)
第二步:检查robots.txt是否允许PerplexityBot
先拿真实 robots.txt。
curl -s https://www.example.com/robots.txt
如果有多个 host,分开查:
curl -s https://example.com/robots.txt
curl -s https://www.example.com/robots.txt
curl -s https://en.example.com/robots.txt
一个偏清晰的公开页面策略:
User-agent: PerplexityBot
Allow: /products/
Allow: /categories/
Allow: /case-studies/
Allow: /faq/
Allow: /about/
Allow: /guides/
Disallow: /customer-portal/
Disallow: /downloads/private/
User-agent: *
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Allow: /wp-admin/admin-ajax.php
如果你写了:
User-agent: PerplexityBot
Disallow: /
那就说明你选择不让 PerplexityBot 抓取。这个策略可以存在,但不要一边屏蔽它,一边期待 Perplexity 更容易发现你的页面。
第三步:不要把Perplexity-User当成PerplexityBot
Perplexity 官方说明 Perplexity-User 是用户动作触发的访问,并且通常忽略 robots.txt。
这意味着:
- robots.txt 主要用于管理
PerplexityBot; - 不要把
Perplexity-User写成常规索引 crawler; - 不要用
Perplexity-User的日志命中,证明PerplexityBot已访问核心页面。
第四步:模拟PerplexityBot访问核心页面
先用 user-agent 做初筛。
for URL in "${URLS[@]}"; do
echo "== $URL =="
curl -sI -L -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot" "$URL" | head -n 8
done
注意:User-Agent 可以伪造。
这一步只能发现“是否按字符串误拦截”,不能证明请求真实来自 Perplexity。
你要重点看:
200 -> 核心公开页正常
301/302 -> 是否跳到正确 URL
403 -> 可能被 WAF / 防火墙 / 服务器规则挡住
404 -> URL 或迁移映射有问题
429 -> 可能被限速
5xx -> 服务器错误
第五步:下载PerplexityBot官方IP JSON
Perplexity 官方提供 PerplexityBot IP JSON:
curl -s https://www.perplexity.com/perplexitybot.json
如果服务器有 jq:
curl -s https://www.perplexity.com/perplexitybot.json | jq .
WAF 或安全策略核对时,建议同时看:
- User-Agent;
- 来源 IP;
- 命中的规则;
- 返回状态码;
- 被请求的 URL。
不要只靠 user-agent 放行,也不要只靠 IP 列表做文章式承诺。IP JSON 是官方核对来源之一,真实策略还要看你的服务器和 WAF。
第六步:看服务器日志
Nginx 日志可以先这样筛:
grep -Ei 'PerplexityBot|Perplexity-User' /var/log/nginx/access.log \
| awk -F'"' '{print $1, $2, $3, $6}' \
| head -n 100
再单独看 PerplexityBot:
grep -Ei 'PerplexityBot' /var/log/nginx/access.log | awk -F'"' '{print $1, $2, $3, $6}' | head -n 50
记录这几项:
| 字段 | 检查目的 |
|---|---|
| IP | 和官方 JSON 做初步核对 |
| URL | 是否访问核心公开页面 |
| 状态码 | 判断是否被拦截、跳转或报错 |
| User-Agent | 确认本次记录是不是 PerplexityBot |
| 时间 | 看是否和改版、WAF 调整、robots 更新有关 |
如果日志里 PerplexityBot 只访问首页,不访问产品页,优先查内链、robots.txt、sitemap 和 WAF。
如果访问了产品页但全是 403,优先查安全策略。
如果状态码正常但页面是空壳,查 JavaScript 渲染、地区跳转和登录限制。
第七步:确认页面返回的是真内容
状态码是 200 也不够。还要看页面有没有真实文本。
curl -sL -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot" \
https://www.example.com/products/stainless-steel-valve/ \
| grep -Ei 'stainless|material|MOQ|lead time|certification|application' | head -n 20
如果返回的是:
- cookie 横幅;
- 国家选择页;
- 纯图片;
- 登录页;
- WAF challenge;
- 空白模板;
那 PerplexityBot 即使“访问成功”,也未必拿到有价值的公开内容。
外贸产品页至少应该让文本里能看到:
- 产品是什么;
- 材质和规格;
- 应用行业;
- MOQ、样品、交期;
- 认证或质检信息;
- 定制能力;
- 联系或 RFQ 路径。
第八步:形成核对表
| 检查项 | 合格标准 | 结果 |
|---|---|---|
PerplexityBot robots 规则 |
核心公开页未被 Disallow |
|
| 相邻 user-agent 已区分 | 不把 Perplexity-User 当 PerplexityBot |
|
| 首页 | 返回 200,有真实内容 |
|
| 产品分类页 | 返回 200,有文本内容 |
|
| 产品详情页 | 返回 200,能看到规格和应用 |
|
| FAQ 页 | 返回 200,能看到问答文本 |
|
| 案例页 | 返回 200,能看到项目背景 |
|
| WAF / CDN | 未对官方 UA / IP 明显误伤 | |
| 官方 IP JSON | 已下载并用于初步核对 | |
| 日志记录 | bot、URL、状态码分开记录 | |
| 敏感资料 | 不靠 robots.txt 保护 |
这张表比一句“PerplexityBot 已放行”更有用。
最后说清楚边界
确认 PerplexityBot 能访问核心页面,只能说明:
- robots.txt 没有明显挡住;
- WAF / CDN 没有明显误伤;
- 核心 URL 能返回正常状态;
- 页面能提供公开文本内容;
- 日志里可以追踪访问情况。
它不能保证:
- Perplexity 一定引用;
- 答案一定展示你的链接;
- 排名一定提升;
- 流量一定增加;
- 询盘一定增加。
但如果连这一步都没做,后面的 Perplexity SEO 很容易变成空谈。外贸站要先保证公开获客页面能被访问,再谈内容能不能被理解、能不能成为回答采购问题的候选来源。