# Gauto Crawlers

> AI 爬虫访问分析（汽车出口版）。检查 robots.txt、meta 标签与 HTTP 头，判定哪些 AI 爬虫可访问站点，输出完整访问图谱与优化建议，确保海外买家在 AI 里能检索到你的车源。

- Skill: `adiready/gauto-crawlers` (Agent Skill)
- Install (CLI): `npx skillmds@latest add adiready/gauto-crawlers`
- Raw SKILL.md: https://api.skillmd.com/api/skills/adiready/gauto-crawlers/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: adiready (https://skillmd.com/u/adiready)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/adiready/gauto-crawlers

---


# AI 爬虫访问分析 Skill（汽车出口版）

## 目的

本 skill 分析站点对 **AI 爬虫**（AI 公司用于发现/索引/训练网页内容的机器人）的可访问性。
**若 AI 爬虫被屏蔽，站点内容再好也无法出现在 AI 回答里**——爬虫访问是 GEO 的底层前置条件。

## 关键认知

截至 2026 年初，大量网站因沿用旧 SEO 配置而"误伤"AI 爬虫。
一项 2025 年研究发现，Top 1000 网站中 35%+ 至少屏蔽了一个主流 AI 爬虫，5–10% 屏蔽了全部。
对中国汽车出口站而言，**屏蔽 AI 爬虫 = 把海外买家的 AI 询盘通道直接关掉**。

---

## AI 爬虫完整参考

### 一级：AI 搜索可见性必需（建议：全部放行）

这些爬虫驱动用户主动找答案的 AI 搜索产品，屏蔽它们会直接降低你的可见性。

| 爬虫 | 运营方 | 作用 | 屏蔽后果 | 建议 |
|---|---|---|---|---|
| **GPTBot** | OpenAI | ChatGPT 联网/搜索/训练 | 不进 ChatGPT 搜索 | **放行** |
| **OAI-SearchBot** | OpenAI | 仅 ChatGPT 搜索（不用于训练） | 不进 ChatGPT 搜索结果 | **放行** |
| **ChatGPT-User** | OpenAI | 用户主动让 ChatGPT 访问 URL | 用户无法让你家页被读取 | **放行** |
| **ClaudeBot** | Anthropic | Claude 联网/引用 | Claude 无法引用 | **放行** |
| **PerplexityBot** | Perplexity | Perplexity AI 搜索 | 不进 Perplexity；且其**外链引流质量高** | **放行** |

### 二级：AI 生态重要（建议：放行）

| 爬虫 | 运营方 | 作用 | 建议 |
|---|---|---|---|
| **Google-Extended** | Google | Gemini 训练与 AIO 改进（**不影响 Google 搜索排名**） | **放行** |
| **GoogleOther** | Google | Google 研究与 AI 相关采集 | **放行** |
| **Applebot-Extended** | Apple | Apple Intelligence / Siri | **放行** |
| **Amazonbot** | Amazon | Alexa / 亚马逊 AI | **放行** |
| **FacebookBot** | Meta | Meta AI（FB/IG/WhatsApp） | **放行** |

### 三级：仅训练类（按策略取舍）

| 爬虫 | 运营方 | 作用 | 建议 |
|---|---|---|---|
| **CCBot** | Common Crawl | 构建公共训练集（被多家 AI 使用） | 视策略 |
| **anthropic-ai** | Anthropic | Claude 训练（≠ ClaudeBot 实时功能） | 视策略 |
| **Bytespider** | 字节跳动 | 豆包/TikTok AI | **出海站建议屏蔽**（爬取激进、对海外搜索增益低）；若在中国市场经营则放行 |
| **cohere-ai** | Cohere | Cohere 模型训练 | 视策略 |

---

## 建议矩阵

| 爬虫 | 级别 | 建议 | 理由 |
|---|---|---|---|
| GPTBot | 1 | **放行** | ChatGPT 搜索（9 亿+周活） |
| OAI-SearchBot | 1 | **放行** | 纯搜索、无训练顾虑 |
| ChatGPT-User | 1 | **放行** | 用户主动访问 |
| ClaudeBot | 1 | **放行** | Claude 联网与引用 |
| PerplexityBot | 1 | **放行** | 外链引流最优的 AI 搜索 |
| Google-Extended | 2 | **放行** | Gemini 功能；不影响搜索排名 |
| GoogleOther | 2 | **放行** | Google AI 研究 |
| Applebot-Extended | 2 | **放行** | Apple Intelligence（20 亿+设备） |
| Amazonbot | 2 | **放行** | Alexa 与亚马逊 AI |
| FacebookBot | 2 | **放行** | Meta AI（30 亿+用户） |
| CCBot | 3 | 视策略 | 仅训练 |
| anthropic-ai | 3 | 视策略 | 仅训练 |
| Bytespider | 3 | **屏蔽**（出海） | 爬取激进、增益低 |
| cohere-ai | 3 | 视策略 | 仅训练 |

### 最大 AI 可见性配置（robots.txt）

```
# ===== AI 爬虫：放行（获取 AI 搜索可见性）=====
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: GoogleOther
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: Amazonbot
Allow: /

User-agent: FacebookBot
Allow: /

# ===== AI 爬虫：屏蔽（激进/低价值）=====
User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

Sitemap: https://your-domain.com/sitemap.xml
```

---

## 分析流程

### 步骤 1：抓取并解析 robots.txt
1. 抓 `[domain]/robots.txt`。
2. 解析所有 User-agent 与其 Allow/Disallow 规则。
3. 对每个 AI 爬虫判定：**已放行 / 已屏蔽 / 未提及**（继承通配规则）。
4. 记录 `Crawl-delay`。
5. 检查 `Sitemap` 指令是否存在。

### 步骤 2：检查 meta robots 标签
抽样 5–10 关键页，检查 `<meta name="robots" content="noindex/nofollow/noai">` 及 bot 专属 meta。

### 步骤 3：检查 HTTP 头
检查 `X-Robots-Tag: noindex / noai` 及 bot 专属头。

### 步骤 4：检查 AI 专属文件
是否存在 `/llms.txt`、`/.well-known/ai-plugin.json`、`/ai.txt`。

### 步骤 5：评估 JS 渲染依赖
AI 爬虫（GPTBot/ClaudeBot/PerplexityBot）**普遍不执行 JS**。若核心内容（车型参数、报价）依赖 JS 渲染，则 AI 抓不到——视为高优先级问题。检查是否有 SSR/SSG。

### 步骤 6：解析 Content-Signal
扫描 robots.txt 中的 `Content-Signal:` 指令（IETF 草案），解析 `ai-train/search/ai-personalization/ai-retrieval` 的 yes/no。

---

## 输出格式

生成 `GEO-CRAWLER-ACCESS.md`：

```markdown
# AI 爬虫访问报告：[域名]

**分析日期：** [日期]
**robots.txt 状态：** [找到/未找到/错误]

---

## 爬虫访问汇总
| 爬虫 | 运营方 | 级别 | 状态 | 影响 |
|---|---|---|---|---|
| GPTBot | OpenAI | 1 | 已放行/已屏蔽/未提及 | [影响] |
| ... | | | | |

## AI 可见性分：[X]/100
**一级访问：** [X/5 放行]
**二级访问：** [X/5 放行]
**三级访问：** [X/4 放行]

---

## 危急问题
[列出被屏蔽的一级爬虫]

## 建议
### 立即动作
[具体 robots.txt 改动]
### 推荐 robots.txt
```
[完整内容]
```
### 其他技术发现
- meta robots：[发现]
- X-Robots-Tag：[发现]
- JS 渲染：[评估]
- llms.txt：[有/无]
- Sitemap：[评估]
```

---

## 爬虫访问评分

| 组件 | 权重 | 计分 |
|---|---|---|
| 一级爬虫放行 | 50% | 每放行 1 个一级爬虫 20 分（5 个满分，折算 50） |
| 二级爬虫放行 | 25% | 每放行 1 个二级爬虫 20 分（折算 25） |
| 无全站屏蔽 | 15% | 无 `User-agent:* Disallow:/` 且无 noai 时满分 |
| AI 专属文件 | 10% | llms.txt 5 分 + sitemap 可访问 5 分 |

总分上限 100。

