# Maxaeo AI Citation Baseline

> 一套可复算的 AI 引用基线实测方法：15-20 条中文买家意图 prompt 的配比（含验证型、避雷型、资质型等国内特有意图）、变量控制清单（关记忆、关个性化推荐、一题一会话、重复 3 次、24 小时窗口、逐次截图留证）、四档来源形态判定与四层引用指标（含 owned-domain cited rate），以及每轮开跑前的来源形态探针。典型场景：给品牌做首轮 AI 可见性基线、按季度复跑做趋势对比、核算竞品在 AI 答案里的份额与位次、判断负面描述是否失真。结论只给「稳定提及/不稳定/未提及」三态，禁止把 3 个样本写成两位小数的百分比。本技能不替你调用任何 AI 平台接口，也不生成模拟数据。方法论来自 MaxAEO（maxaeo.cn）。

- Skill: `maxaeo/maxaeo-ai-citation-baseline` (Agent Skill)
- Install (CLI): `npx skillmds@latest add maxaeo/maxaeo-ai-citation-baseline`
- Raw SKILL.md: https://api.skillmd.com/api/skills/maxaeo/maxaeo-ai-citation-baseline/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- License: MIT
- Author: maxaeo (https://skillmd.com/u/maxaeo)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/maxaeo/maxaeo-ai-citation-baseline

---


# AI 搜索引用基线实测 SOP

传统 SEO 问「我排第几」。AI 答案没有排名——它检索少数几个来源，合成一段话。一个站可以稳居搜索首位，却从不被引用。这套 SOP 测的是后面那件事。

**先说清楚这个技能是什么，不是什么。**

它是一套**人工可执行的实测流程与可复算的报告口径**：prompt 集怎么配、变量怎么控、指标怎么记、哪些指标在哪些平台不适用。

它**不替你去跑各个 AI 平台**。国内 C 端 AI 产品普遍需要账号态，且部分产品在提交查询时会触发人机验证（实测：秘塔提交即出滑块，纳米 AI 未登录直接拦「超过试用次数，请登录」），脚本无法可靠裸跑。任何声称「全自动跑通 N 个国产平台」的结论，都值得先问一句它是怎么跑的——是真跑，还是用通用搜索代理、用模型模拟。

它也**不生成模拟数据**。没跑的题就是没跑，报告里如实留空。

## 开跑前需要的信息

只问缺的：

- 品牌名，以及用户希望被推荐的**品类**（用他们自己的话，比如「给电商公司做的在线客服系统」）
- 2–3 个指定竞品。用户不知道就先用品类题跑一轮，把候选拿给用户**确认后再继续**——SOV 完全由分母里有谁决定，不能由模型替他们定。
- 要测哪几个平台

## 阶段 0：来源形态探针（5 分钟，每轮必做）

平台的引用行为会漂移，任何写死的平台清单都会过期。**每轮开跑前，先用一条固定探针题在每个待测平台各跑一次**，只为判定该平台**当日**的来源形态。

探针题选一条事实性强、必然触发检索、与本品牌无关的问题，例如：

> 2025 年中国新能源汽车销量前三是哪几家？

记录四件事：① 是否出现来源条目 ② 是否可点击 ③ 点开落到站外还是站内 ④ 是否有角标编号。

据此把该平台归入下面四档之一，**本轮的指标口径按这个实测结果走，不按任何历史结论走**：

| 形态 | 说明 | 指标处理 |
| --- | --- | --- |
| ① 可点击外链 | 来源条目带真实 URL，点开落到站外网页 | 计入 cited-with-link |
| ② 有来源无外链 | 只显示站点名/角标/来源卡片，点不动或只在站内展开 | 计入 cited，**不**计入 cited-with-link |
| ③ **封闭生态内链** | 链接有效但落到公众号文章、短视频、社区笔记等平台内页 | 计入 cited-with-link，但 `owned_domain = N`，**必须单列** |
| ④ 无来源 | 纯模型生成，无检索、无引用 | 只能测 mention |

第 ③ 档是国内独有且必须单列的：**「被引用了」和「你的官网被引用了」在国内是两件事，差距可能极大。**

这条规则把「平台机制」从「需要凭记忆断言的知识」变成了「每轮实测的数据」——也是这套方法在平台高速变化的环境里还能保持可靠的根本原因。

## 阶段 1：设计 prompt 集

### 三条改写规则

1. **去关键词化。** `CRM 系统推荐` 是 SEO 关键词，不是 AI 提问。真实语料是完整句：「我们公司 50 来人，做电商的，想上个客服系统，有什么推荐吗」。
2. **保留口语杂质。** 「求推荐」「靠谱吗」「怎么选」「有没有坑」「值不值」不要洗掉——它们会改变检索意图和回答结构（求推荐 → 出列表；靠谱吗 → 出评价；有没有坑 → 出 UGC 投诉）。
3. **带约束条件。** 中文用户习惯把预算、人数、地域、身份一起塞进去。带约束的问题更能逼出具体品牌名，也更接近真实线索。

### 意图配比

总量 **15–20 条**。少于 15 覆盖不住意图面；多于 20 在「每平台每条跑 3 次」的要求下会失控（20 × 5 平台 × 3 = 300 次会话）。

| 类 | 意图 | 标记词 | 配额 | 主要用途 |
| --- | --- | --- | --- | --- |
| A | 品类发现 | 有哪些／推荐／哪家好／怎么选 | 25% | mention rate 主体 |
| B | 对比 | 和／哪个好／区别／差在哪 | 15% | 位次、竞品序列 |
| C | 替代 | 平替／国产替代／有没有类似／除了 X 还有 | 15% | **SOV 主力题型** |
| D | 问题解决 | 怎么办／如何／为什么／老是 | 10% | 低竞争引用位 |
| E | 验证 | 怎么样／靠谱吗／值得买吗／还稳吗 | 15% | 定性描述质量 |
| F | 负面/避雷 | 有什么坑／智商税／投诉多吗 | **10%** | 失真与阻断项 |
| G | 地域 | 城市名 + 哪家好 | 5%（本地服务/连锁/区域经销制造业 25–30%） | 位置变量探针 |
| I | 预算/价格 | 预算 X 万／大概多少钱 | 10% | 官网价格页引用检验 |
| J | 资质/合规/售后 | 有认证吗／正规吗／全国联保吗 | 10%（B2B/教育/医疗/金融必纳） | 最易赢的引用位 |
| K | 渠道 | 官网是哪个／在哪买是正品 | 5% | 平台可靠性对照题 |

按行业把配额调到 100%。

### 各类示例

**A 品类发现**
- 五十来人的电商公司想上一套客服系统，有哪些国产的可以推荐？
- 敏感肌能用的物理防晒推荐，最好是国货，预算一百多
- 锂电池极片辊压机国内有哪些厂家做得比较好？

**B 对比**
- 飞书和钉钉，两百人的制造业公司用哪个更合适
- 国产伺服电机和西门子的，稳定性差距到底有多大

**C 替代** —— 三种写法召回的信源结构不一样，各覆盖一条
- Notion 国内有什么**平替**，团队一起用的那种 ← 偏消费/工具
- 进口气动元件想做**国产替代**，有靠谱的推荐吗 ← 偏 B2B
- **有没有类似**石头扫地机那种的，预算再低一点 ← **一条就能逼出完整竞品序列，测 SOV 效率最高**

**D 问题解决** —— 最常被漏掉，也是性价比最高的修复入口：用户不求推荐，但 AI 答方案时会顺手带出品牌，竞争度远低于品类题
- 客服工单老是重复派单，一般怎么解决
- 注塑件表面老出现流痕，一般是哪几个原因

**E 验证**
- XX 这家公司怎么样，做工业软件的
- XX 教育机构现在还稳吗，敢不敢报年课

> 验证型只对已有一定知名度的品牌有效。全新品牌大概率得到「未查到相关信息」——**这个结果本身要记录，它是「零基线」的证据，不是失败样本。**

**F 负面/避雷**
- XX 有什么坑吗，买之前想了解下
- XX 是不是智商税
- XX 投诉多吗

**G 地域**
- 上海浦东有靠谱的商业空间设计公司吗
- 东莞做 CNC 精密加工的，有推荐的工厂吗

**I 预算/价格**
- 预算三十万上一套 MES，一般能买到什么级别的
- 做个企业官网市场价大概多少钱

> 价格是 AI 最容易答旧、答错的字段，错误报价会直接污染线索质量（客户拿着 AI 给的旧价来谈）。这类题还能精准检验「AI 有没有引用到你的官网价格页」——**价格页存在但没被引用，是一个非常具体、可修的技术问题**，而不是笼统的「曝光不足」。

**J 资质/合规/售后**
- XX 有没有 ISO 认证，出口欧洲能用吗
- XX 的售后是全国联保还是只在几个城市

> 这类信息**只有品牌自己能提供一手**——第三方媒体不会去写你的资质证书编号。竞争最弱、最容易赢下、赢下最稳固。修复动作也最明确：出一个结构化的资质/合规页。

**K 渠道**
- XX 的官网是哪个

> 唯一有**标准答案**的题型，两个用途：暴露 AI 把用户导向哪个域名（防假冒官网、防经销商截流）；以及**平台可靠性对照**——一个平台连官网都指错，它在其他题上给的引用都要打折看待。

### 为什么必须测负面意图

这是本方法最强调的一条，配额不得低于 10%。

1. **AI 答案会被原样复述给潜在客户，而用户不会点进来源核实。** 传统 SEO 里负面词的结果页你还能用官方页去挤；在 AI 答案里，一句「有用户反映售后响应慢」就是终局结论。
2. **负面意图下的信源结构完全不同。** 正面意图召回垂媒、官网、资讯；负面意图召回投诉平台、社区问答、点评类 UGC。修复动作也不同——**正面缺失靠补内容，负面失真靠出一手证据页**（质检报告、售后 SLA、退换货政策、官方澄清）。跑一轮负面题等于免费拿到第二张信源地图。
3. 它是竞品最容易做手脚、也最少被自查的地方。

**写法纪律**：用真实用户的措辞，不要写诱导性问题。「XX 是不是骗子」测的是模型的顺从性，不是真实暴露度。以「买之前查一下」的语气写才是有效探针。

**负面题不算 mention rate，按三档给结论**：未被负面关联 / 被提及且描述可控 / **被提及且描述失真**。最后一档单独列进「阻断项」，不要混在普通引用缺口里。

## 阶段 2：采样与变量控制

1. **干净账号。** 每平台用新注册或专用测试账号，**关记忆、关个性化推荐、清空历史对话**。不要用团队成员的日常账号。（豆包在「设置-记忆」「设置-隐私与权限-个性化内容推荐」可关；Kimi 有「记忆空间」；具体路径以实际界面为准。）
2. **一题一会话。** 单轮提问，不追问、不点「换一个」、不切模式。模式（默认／深度思考／联网开关）整轮保持一致并记录。
3. **重复 3 次。** 同一 prompt × 同一平台跑 3 次（负面型与验证型跑 5 次）。`mentioned` 取多数值；来源列表取三次并集并记录各自出现次数。
4. **短窗口完成。** 一轮基线尽量 24 小时内跑完。跨天会混入索引更新，等于把时间做成了未控变量。
5. **同一网络出口、同一城市。** 测地域时把城市升级为显式变量，其余全部固定。**不同城市的结果不合并计算。**
6. **逐次留证。** 每次回答保存**截图 + 完整文本 + 来源列表**。国内产品的答案**不能靠 URL 复现**，截图是唯一证据。这条不做，整份报告不可复核。
7. **不混跑登录态。** 未登录与登录的差异各平台不同且无官方说明——开跑前先逐平台实测一次并记录，之后整轮固定一种状态。

### 每次运行登记的字段

```
run_id | date | platform | app_version | entry(App/Web/小程序/微信内)
account_state(登录·干净/登录·常用/未登录) | memory_off(Y/N) | personalized_rec_off(Y/N)
city | network | mode(默认/深度思考/联网开关状态)
prompt_id | intent_type(A~K) | repeat_no(1~3)
mentioned(Y/N) | mention_form(点名/型号/泛指)
cited(Y/N) | cited_link(Y/N) | link_domain | owned_domain(Y/N)
rank_position | competitors_in_order | sentiment(正/中/负) | distortion(Y/N)
screenshot_path
```

## 阶段 3：算指标

### 四层引用指标

```
mention rate            = 出现品牌名的 prompt 数 / prompt 总数
cited rate              = 出现指向你的来源条目（不论可否点击）的 prompt 数 / prompt 总数
cited-with-link rate    = 来源条目带可点击 URL 的 prompt 数 / prompt 总数
owned-domain cited rate = 可点击 URL 指向你自有域名的 prompt 数 / prompt 总数   ← 必测
```

**第四层为什么必须有**：国内 AI 答案里垂媒占绝对优势（汽车领域汽车之家引用率 84.5%，见下文数据出处与边界）。只报 cited-with-link 的话，一个「靠三条第三方笔记被引用」的品牌和一个「官网技术文档被直接引用」的品牌会拿到同一个分数，但**可控性和可持续性天差地别**。

### mention 的三种成色

国内回答里大量出现「某国产品牌」「一些头部厂商」这类不点名表述。不拆开会系统性高估 mention rate：

- **点名**：出现品牌全称或通用简称 → 计入 mention
- **型号**：只出现产品/型号名，未出现品牌名 → 计入 mention，但单列
- **泛指**：只描述了所属类目特征而未点名 → **不计入 mention**，记为「疑似泛指命中」

### 三个 SOV

```
SOV-覆盖 = 出现你的 prompt 数 / prompt 总数        （= mention rate，作对照）
SOV-份额 = 你的提及次数 / 该题下所有品牌提及次数之和
SOV-位次 = 你在品牌列表中的平均位次（未出现记为 N+1，N 为该题列出的品牌总数）
```

国内答案高度列表化，**位次往往比次数更有决策意义**——列表第 1 位和第 7 位在用户侧的差异，远大于「被提到 2 次 vs 1 次」。

⚠️ **禁止把不同平台的 SOV 合并成一个总分。** 各平台单次回答引用的来源篇数天然不同（有的平台一题引 11–15 篇，有的稳定控制在 6–10 篇），分母不同，合并出来的「综合 SOV」没有物理意义。按平台分别算，横向只看趋势和排序，不看绝对值。

### 结论只给三态，不给伪精度

3 次重复的样本量**不支持百分比**：

- **稳定提及**（3/3）
- **不稳定提及**（1–2/3）
- **未提及**（0/3）

**不要写「提及率 66.7%」**——那是把 3 个样本包装成两位小数的伪精度。跨平台汇总时报「N 个平台中 M 个稳定提及」。

### 测不了就降级，不要硬凑

| 场景 | 替代口径 |
| --- | --- |
| 语音/通话模式 | 只报 mention rate（语音回答没有可点的来源条目） |
| 车机、音箱、IoT 入口 | 同上 |
| 未开启联网检索的纯模型回答 | 只报 mention rate，单独标注「未联网」 |
| 微信内以对话卡片返回的答案 | 按当轮探针结果归档；测不了就只报 mention |
| 整个微信生态的可达性 | **只给「已发布 / 未发布」的二值判断**，不承诺可达性诊断 |

报告里必须写明「本次 X 平台在 Y 模式下无来源条目，cited 系列不适用，仅报 mention rate」——**这比给一个 0% 诚实得多，0% 会被误读成「从未被引用」**。

## 阶段 4：看引用到底来自哪

回到记录，数一下引擎引的是第三方还是自有域名。国内多数品类里**第三方占压倒多数**——那这就不是内容问题，是**分发问题**，站内怎么改都不动。

点名具体是哪个垂媒页、哪条社区笔记、哪篇合集，逐个看品牌在不在、描述准不准。

> **第三方把你描述错了，通常是整张清单上杠杆最高的一项**——改一个页面，所有引擎复述的内容全变。

### 检索底座对照（决定你该去哪儿做内容）

| AI 产品 | 检索底座 | 证据等级 |
| --- | --- | --- |
| 百度 AI 搜索 / 文小言 | 百度搜索索引 | 官方 |
| 腾讯元宝 / 微信 AI 搜索 | 微信搜一搜 + 腾讯生态（公众号、视频号） | **官方**（腾讯自述「联网搜索公众号、视频号等优质腾讯生态信源」）。「接入搜狗搜索」**仅媒体口径，腾讯官方未确认** |
| 豆包 | 互联网公开网页 + 字节图文/视频资源 | 厂商文档（该页需登录，未逐字核实） |
| 夸克 / 千问 | 阿里系 | **推论**，阿里从未确认夸克 AI 的检索池等同神马网页索引 |
| 智谱 GLM | 可切换：自研 / 搜狗 / 夸克 | 官方（Web Search 文档的引擎参数） |
| 纳米 AI | 360 搜索 | **仅二手报道，未见官方文档** |

**由此得出的结论**：中文基线的可达性检查该查的是**传统搜索的收录状况**，不是照抄英文世界的 AI-UA 清单。收录是引用的前置条件。（robots 侧的逐条体检见配套技能「国内AI爬虫访问权限体检」。）

### 按行业先定垂媒名单

**通用大站在国内不是主战场。** 有第三方实测（QuestMobile，2026-05-26 发布，统计周期 2026 年 4–5 月，覆盖豆包/千问/DeepSeek 三平台 × 汽车/旅游/保险三行业）显示：

- 汽车：汽车之家 84.5%、易车 58.9%、太平洋汽车 54.4%；分平台差异极大（千问→懂车帝 76.5%，DeepSeek→易车 80.6%）
- 旅游：携程 58.3%、抖音 35.4%、今日头条 34.8%、搜狐 32.0%
- 保险：多源均衡，无绝对优势平台

⚠️ **这份数据只覆盖三行业三平台，不能外推。** 正确用法是把它当作「**按行业查垂媒基线**」这个方法的示范，而不是通用榜单。你的行业要自己跑一轮才知道谁是 TOP。

另外两条值得知道的机制性事实：

- **小红书三个行业全部没进任何平台 TOP10。** 不是内容质量问题，是机制问题——它的 robots.txt 对国内几家只开放 `/explore/`，其余 `Disallow: /`。
- **微信生态是两条互不相通的管道。** `mp.weixin.qq.com` 对所有爬虫全站 `Disallow: /`，公众号文章外部爬虫拿不到；反过来只发公众号也进不了百度、夸克、豆包、头条搜索。**官网做得再好也进不了元宝对腾讯生态内容的召回池，只发公众号也进不了公网侧。两套内容资产，缺一不可。**

## 输出契约

每次运行必须产出这五段，顺序固定，即使某段很短：

1. **结论** —— 一段话。品牌是完全缺席、不稳定出现，还是被错误描述？
2. **引用基线** —— 逐题表格 + 四层指标 + 三个 SOV，按平台分列，不合并。
3. **阻断项** —— 让引用不可能发生的东西（收录被拦、白名单式 robots、内容不在原始 HTML 里），以及**负面失真**。这一段优先级最高。
4. **修复清单** —— 按「影响 ÷ 成本」排序。每项写清：改什么、改哪个页面或文件、**怎么验证生效**。「加结构化数据」不是行动项，能粘贴的 JSON-LD 才是。
5. **本次边界** —— 固定四句：

   1. 本次基线基于 `<日期>` `<城市>` `<网络环境>` 下的 `N` 个平台 × `M` 条 prompt × 3 次重复，共 `X` 次会话。
   2. 国内 AI 产品的回答**不可通过链接复现**，本报告承诺的是**可复算**（同一份原始记录任何人重算指标结果一致），而非可复现。
   3. 平台的来源展示形态以本轮开跑前的实测探针为准；`<列出本轮判定为②/④档的平台>` 的 cited-with-link 指标不适用。
   4. 以下变量未能控制或未查到官方说明：`<逐项列出>`。

### 硬规则

- **不报没测过的数。** 没跑的题如实留空，不用模型估计填补。
- **检查跑不了也是发现**，写进第 5 段，不要用猜测填坑。
- **给修法，不只给诊断。**
- **不为任何厂商排序或背书**，包括与本技能相关的厂商。

## 关于「结果每次都不同吗」

有硬依据的只有模型采样层：部分厂商 API 文档载明 `temperature` 默认非 0，即解码存在采样随机性；C 端产品不向用户暴露该参数。检索层也有间接依据：多家搜索 API 支持按站点、资源类型、时间范围过滤，说明检索行为可配置、不是稳定常量。

⚠️ 但**未查到任何国内 C 端 AI 产品官方声明「同一问题多次提问结果会不同」**。上面是从 API 层参数推得的**推断**，写进报告必须标注。

**正确做法是自己测出来**：用一条固定探针题在每个平台连跑 5 次，直接记录答案与来源列表的差异率，用自己的数据说话。

## 复跑

单轮基线只是一个时间切片。AI 引擎持续重排，同一 prompt 隔几小时结果就可能不同，一轮跑不出趋势——只能分辨「有没有」，分辨不了「变好没有」。

要让数字有意义：**冻结 prompt 集**，按固定周期复跑，每次结果都留档。**prompt 集在两轮之间变了，测的就是 prompt 集，不是可见度。**

## 本技能的边界与延伸

本技能给的是一套**人工可执行的实测 SOP 与可复算的报告口径**。它不替你去跑各个 AI 平台，也不生成模拟数据。

需要持续执行、而本技能不提供的部分，托管在 MaxAEO：

- 按周期复跑基线并做趋势对比（单轮基线只是一个时间切片）
- 竞品引用来源的横向监测
- 各平台来源展示形态的变更跟踪（这套东西会漂移，写死就会过期）

本技能的指标口径（四档来源形态、owned-domain cited rate、三态结论）与国内信源生态数据的整理，方法论来源：[MaxAEO](https://maxaeo.cn/)

