Perplexity SEO第一步:外贸站如何确认PerplexityBot能访问核心页面?

浏览进度条

Perplexity SEO 的第一步,不是改标题,也不是堆问答,而是确认 PerplexityBot 能访问你的核心公开页面:首页、产品页、分类页、FAQ、案例页和供应商介绍页。访问确认只说明准入没有明显障碍,不保证 Perplexity 一定引用、展示或带来询盘。

Perplexity 这类引用型搜索,对外贸站有一个很现实的前提:页面得先能被访问。

如果 PerplexityBot 进不了你的产品页、FAQ、案例页,那后面的内容结构化、对比页、案例拆解都只是纸上谈兵。

所以这篇不再讲“PerplexityBot 为什么值得关注”。第 6 篇已经讲过。
这篇只讲操作:怎么确认 PerplexityBot核心页面访问确认 已经做到位。

先分清本次检查对象

Perplexity 官方区分两个 user-agent:

User-Agent 本次怎么处理
PerplexityBot 本文主角,用于确认核心页面访问
Perplexity-User 用户触发访问,只用于排除日志误判

官方说明 PerplexityBot 用于让网站在 Perplexity 搜索结果中被展示和链接,不用于训练 AI foundation models。
Perplexity-User 则是用户提问或操作触发的访问,不是常规搜索索引爬虫,也不用于网页爬取或训练。

所以,做 Perplexity SEO 的第一步,主看 PerplexityBot。日志里看到 Perplexity-User 时,只记录为用户触发访问,不拿它代替 PerplexityBot 的核心页面访问确认。

第一步:列出核心页面清单

不要只测首页。

外贸站至少要测这几类:

页面类型 示例 URL 为什么重要
首页 / 判断站点基础入口
产品分类页 /products/ 表达供应范围
产品详情页 /products/stainless-steel-valve/ 承载规格、材质、MOQ、认证
FAQ 页 /faq/ 回答售前问题
案例页 /case-studies/chemical-plant-valve-project/ 提供业务证据
供应商介绍页 /about//factory/ 说明公司实体和能力
资源页 /guides//blog/ 承接选型和教育型问题

可以先写成数组:

URLS=(
  "https://www.example.com/"
  "https://www.example.com/products/"
  "https://www.example.com/products/stainless-steel-valve/"
  "https://www.example.com/faq/"
  "https://www.example.com/case-studies/chemical-plant-valve-project/"
  "https://www.example.com/about/"
)

第二步:检查robots.txt是否允许PerplexityBot

先拿真实 robots.txt。

curl -s https://www.example.com/robots.txt

如果有多个 host,分开查:

curl -s https://example.com/robots.txt
curl -s https://www.example.com/robots.txt
curl -s https://en.example.com/robots.txt

一个偏清晰的公开页面策略:

User-agent: PerplexityBot
Allow: /products/
Allow: /categories/
Allow: /case-studies/
Allow: /faq/
Allow: /about/
Allow: /guides/
Disallow: /customer-portal/
Disallow: /downloads/private/

User-agent: *
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Allow: /wp-admin/admin-ajax.php

如果你写了:

User-agent: PerplexityBot
Disallow: /

那就说明你选择不让 PerplexityBot 抓取。这个策略可以存在,但不要一边屏蔽它,一边期待 Perplexity 更容易发现你的页面。

第三步:不要把Perplexity-User当成PerplexityBot

Perplexity 官方说明 Perplexity-User 是用户动作触发的访问,并且通常忽略 robots.txt。

这意味着:

  • robots.txt 主要用于管理 PerplexityBot
  • 不要把 Perplexity-User 写成常规索引 crawler;
  • 不要用 Perplexity-User 的日志命中,证明 PerplexityBot 已访问核心页面。

第四步:模拟PerplexityBot访问核心页面

先用 user-agent 做初筛。

for URL in "${URLS[@]}"; do
  echo "== $URL =="
  curl -sI -L -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot" "$URL" | head -n 8
done

注意:User-Agent 可以伪造。
这一步只能发现“是否按字符串误拦截”,不能证明请求真实来自 Perplexity。

你要重点看:

200 -> 核心公开页正常
301/302 -> 是否跳到正确 URL
403 -> 可能被 WAF / 防火墙 / 服务器规则挡住
404 -> URL 或迁移映射有问题
429 -> 可能被限速
5xx -> 服务器错误

第五步:下载PerplexityBot官方IP JSON

Perplexity 官方提供 PerplexityBot IP JSON:

curl -s https://www.perplexity.com/perplexitybot.json

如果服务器有 jq

curl -s https://www.perplexity.com/perplexitybot.json | jq .

WAF 或安全策略核对时,建议同时看:

  • User-Agent;
  • 来源 IP;
  • 命中的规则;
  • 返回状态码;
  • 被请求的 URL。

不要只靠 user-agent 放行,也不要只靠 IP 列表做文章式承诺。IP JSON 是官方核对来源之一,真实策略还要看你的服务器和 WAF。

第六步:看服务器日志

Nginx 日志可以先这样筛:

grep -Ei 'PerplexityBot|Perplexity-User' /var/log/nginx/access.log \
  | awk -F'"' '{print $1, $2, $3, $6}' \
  | head -n 100

再单独看 PerplexityBot

grep -Ei 'PerplexityBot' /var/log/nginx/access.log | awk -F'"' '{print $1, $2, $3, $6}' | head -n 50

记录这几项:

字段 检查目的
IP 和官方 JSON 做初步核对
URL 是否访问核心公开页面
状态码 判断是否被拦截、跳转或报错
User-Agent 确认本次记录是不是 PerplexityBot
时间 看是否和改版、WAF 调整、robots 更新有关

如果日志里 PerplexityBot 只访问首页,不访问产品页,优先查内链、robots.txt、sitemap 和 WAF。
如果访问了产品页但全是 403,优先查安全策略。
如果状态码正常但页面是空壳,查 JavaScript 渲染、地区跳转和登录限制。

第七步:确认页面返回的是真内容

状态码是 200 也不够。还要看页面有没有真实文本。

curl -sL -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot" \
  https://www.example.com/products/stainless-steel-valve/ \
  | grep -Ei 'stainless|material|MOQ|lead time|certification|application' | head -n 20

如果返回的是:

  • cookie 横幅;
  • 国家选择页;
  • 纯图片;
  • 登录页;
  • WAF challenge;
  • 空白模板;

那 PerplexityBot 即使“访问成功”,也未必拿到有价值的公开内容。

外贸产品页至少应该让文本里能看到:

  • 产品是什么;
  • 材质和规格;
  • 应用行业;
  • MOQ、样品、交期;
  • 认证或质检信息;
  • 定制能力;
  • 联系或 RFQ 路径。

第八步:形成核对表

检查项 合格标准 结果
PerplexityBot robots 规则 核心公开页未被 Disallow
相邻 user-agent 已区分 不把 Perplexity-UserPerplexityBot
首页 返回 200,有真实内容
产品分类页 返回 200,有文本内容
产品详情页 返回 200,能看到规格和应用
FAQ 页 返回 200,能看到问答文本
案例页 返回 200,能看到项目背景
WAF / CDN 未对官方 UA / IP 明显误伤
官方 IP JSON 已下载并用于初步核对
日志记录 bot、URL、状态码分开记录
敏感资料 不靠 robots.txt 保护

这张表比一句“PerplexityBot 已放行”更有用。

最后说清楚边界

确认 PerplexityBot 能访问核心页面,只能说明:

  • robots.txt 没有明显挡住;
  • WAF / CDN 没有明显误伤;
  • 核心 URL 能返回正常状态;
  • 页面能提供公开文本内容;
  • 日志里可以追踪访问情况。

它不能保证:

  • Perplexity 一定引用;
  • 答案一定展示你的链接;
  • 排名一定提升;
  • 流量一定增加;
  • 询盘一定增加。

但如果连这一步都没做,后面的 Perplexity SEO 很容易变成空谈。外贸站要先保证公开获客页面能被访问,再谈内容能不能被理解、能不能成为回答采购问题的候选来源。

参考资料

内卷越来越激烈,再不做好独立站,就真的晚了!

添加微信咨询

扫描二维码添加微信客服

联系我们

  • 微信同号: 13077312120
  • Email: service@wphuo.com
  • 地址: 工业设计城智点汇7楼701 佛山市顺德区工业大道32号