AI 爬虫访问分析 Skill(汽车出口版)
目的
本 skill 分析站点对 AI 爬虫(AI 公司用于发现/索引/训练网页内容的机器人)的可访问性。 若 AI 爬虫被屏蔽,站点内容再好也无法出现在 AI 回答里——爬虫访问是 GEO 的底层前置条件。
关键认知
截至 2026 年初,大量网站因沿用旧 SEO 配置而"误伤"AI 爬虫。 一项 2025 年研究发现,Top 1000 网站中 35%+ 至少屏蔽了一个主流 AI 爬虫,5–10% 屏蔽了全部。 对中国汽车出口站而言,屏蔽 AI 爬虫 = 把海外买家的 AI 询盘通道直接关掉。
AI 爬虫完整参考
一级:AI 搜索可见性必需(建议:全部放行)
这些爬虫驱动用户主动找答案的 AI 搜索产品,屏蔽它们会直接降低你的可见性。
| 爬虫 | 运营方 | 作用 | 屏蔽后果 | 建议 |
|---|---|---|---|---|
| GPTBot | OpenAI | ChatGPT 联网/搜索/训练 | 不进 ChatGPT 搜索 | 放行 |
| OAI-SearchBot | OpenAI | 仅 ChatGPT 搜索(不用于训练) | 不进 ChatGPT 搜索结果 | 放行 |
| ChatGPT-User | OpenAI | 用户主动让 ChatGPT 访问 URL | 用户无法让你家页被读取 | 放行 |
| ClaudeBot | Anthropic | Claude 联网/引用 | Claude 无法引用 | 放行 |
| PerplexityBot | Perplexity | Perplexity AI 搜索 | 不进 Perplexity;且其外链引流质量高 | 放行 |
二级:AI 生态重要(建议:放行)
| 爬虫 | 运营方 | 作用 | 建议 |
|---|---|---|---|
| Google-Extended | Gemini 训练与 AIO 改进(不影响 Google 搜索排名) | 放行 | |
| GoogleOther | Google 研究与 AI 相关采集 | 放行 | |
| Applebot-Extended | Apple | Apple Intelligence / Siri | 放行 |
| Amazonbot | Amazon | Alexa / 亚马逊 AI | 放行 |
| FacebookBot | Meta | Meta AI(FB/IG/WhatsApp) | 放行 |
三级:仅训练类(按策略取舍)
| 爬虫 | 运营方 | 作用 | 建议 |
|---|---|---|---|
| CCBot | Common Crawl | 构建公共训练集(被多家 AI 使用) | 视策略 |
| anthropic-ai | Anthropic | Claude 训练(≠ ClaudeBot 实时功能) | 视策略 |
| Bytespider | 字节跳动 | 豆包/TikTok AI | 出海站建议屏蔽(爬取激进、对海外搜索增益低);若在中国市场经营则放行 |
| cohere-ai | Cohere | Cohere 模型训练 | 视策略 |
建议矩阵
| 爬虫 | 级别 | 建议 | 理由 |
|---|---|---|---|
| GPTBot | 1 | 放行 | ChatGPT 搜索(9 亿+周活) |
| OAI-SearchBot | 1 | 放行 | 纯搜索、无训练顾虑 |
| ChatGPT-User | 1 | 放行 | 用户主动访问 |
| ClaudeBot | 1 | 放行 | Claude 联网与引用 |
| PerplexityBot | 1 | 放行 | 外链引流最优的 AI 搜索 |
| Google-Extended | 2 | 放行 | Gemini 功能;不影响搜索排名 |
| GoogleOther | 2 | 放行 | Google AI 研究 |
| Applebot-Extended | 2 | 放行 | Apple Intelligence(20 亿+设备) |
| Amazonbot | 2 | 放行 | Alexa 与亚马逊 AI |
| FacebookBot | 2 | 放行 | Meta AI(30 亿+用户) |
| CCBot | 3 | 视策略 | 仅训练 |
| anthropic-ai | 3 | 视策略 | 仅训练 |
| Bytespider | 3 | 屏蔽(出海) | 爬取激进、增益低 |
| cohere-ai | 3 | 视策略 | 仅训练 |
最大 AI 可见性配置(robots.txt)
# ===== AI 爬虫:放行(获取 AI 搜索可见性)=====
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: GoogleOther
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Amazonbot
Allow: /
User-agent: FacebookBot
Allow: /
# ===== AI 爬虫:屏蔽(激进/低价值)=====
User-agent: Bytespider
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://your-domain.com/sitemap.xml
分析流程
步骤 1:抓取并解析 robots.txt
- 抓
[domain]/robots.txt。 - 解析所有 User-agent 与其 Allow/Disallow 规则。
- 对每个 AI 爬虫判定:已放行 / 已屏蔽 / 未提及(继承通配规则)。
- 记录
Crawl-delay。 - 检查
Sitemap指令是否存在。
步骤 2:检查 meta robots 标签
抽样 5–10 关键页,检查 <meta name="robots" content="noindex/nofollow/noai"> 及 bot 专属 meta。
步骤 3:检查 HTTP 头
检查 X-Robots-Tag: noindex / noai 及 bot 专属头。
步骤 4:检查 AI 专属文件
是否存在 /llms.txt、/.well-known/ai-plugin.json、/ai.txt。
步骤 5:评估 JS 渲染依赖
AI 爬虫(GPTBot/ClaudeBot/PerplexityBot)普遍不执行 JS。若核心内容(车型参数、报价)依赖 JS 渲染,则 AI 抓不到——视为高优先级问题。检查是否有 SSR/SSG。
步骤 6:解析 Content-Signal
扫描 robots.txt 中的 Content-Signal: 指令(IETF 草案),解析 ai-train/search/ai-personalization/ai-retrieval 的 yes/no。
输出格式
生成 GEO-CRAWLER-ACCESS.md:
# AI 爬虫访问报告:[域名]
**分析日期:** [日期]
**robots.txt 状态:** [找到/未找到/错误]
---
## 爬虫访问汇总
| 爬虫 | 运营方 | 级别 | 状态 | 影响 |
|---|---|---|---|---|
| GPTBot | OpenAI | 1 | 已放行/已屏蔽/未提及 | [影响] |
| ... | | | | |
## AI 可见性分:[X]/100
**一级访问:** [X/5 放行]
**二级访问:** [X/5 放行]
**三级访问:** [X/4 放行]
---
## 危急问题
[列出被屏蔽的一级爬虫]
## 建议
### 立即动作
[具体 robots.txt 改动]
### 推荐 robots.txt
[完整内容]
### 其他技术发现
- meta robots:[发现]
- X-Robots-Tag:[发现]
- JS 渲染:[评估]
- llms.txt:[有/无]
- Sitemap:[评估]
爬虫访问评分
| 组件 | 权重 | 计分 |
|---|---|---|
| 一级爬虫放行 | 50% | 每放行 1 个一级爬虫 20 分(5 个满分,折算 50) |
| 二级爬虫放行 | 25% | 每放行 1 个二级爬虫 20 分(折算 25) |
| 无全站屏蔽 | 15% | 无 User-agent:* Disallow:/ 且无 noai 时满分 |
| AI 专属文件 | 10% | llms.txt 5 分 + sitemap 可访问 5 分 |
总分上限 100。