AI 搜索引用基线实测 SOP
传统 SEO 问「我排第几」。AI 答案没有排名——它检索少数几个来源,合成一段话。一个站可以稳居搜索首位,却从不被引用。这套 SOP 测的是后面那件事。
先说清楚这个技能是什么,不是什么。
它是一套人工可执行的实测流程与可复算的报告口径:prompt 集怎么配、变量怎么控、指标怎么记、哪些指标在哪些平台不适用。
它不替你去跑各个 AI 平台。国内 C 端 AI 产品普遍需要账号态,且部分产品在提交查询时会触发人机验证(实测:秘塔提交即出滑块,纳米 AI 未登录直接拦「超过试用次数,请登录」),脚本无法可靠裸跑。任何声称「全自动跑通 N 个国产平台」的结论,都值得先问一句它是怎么跑的——是真跑,还是用通用搜索代理、用模型模拟。
它也不生成模拟数据。没跑的题就是没跑,报告里如实留空。
开跑前需要的信息
只问缺的:
- 品牌名,以及用户希望被推荐的品类(用他们自己的话,比如「给电商公司做的在线客服系统」)
- 2–3 个指定竞品。用户不知道就先用品类题跑一轮,把候选拿给用户确认后再继续——SOV 完全由分母里有谁决定,不能由模型替他们定。
- 要测哪几个平台
阶段 0:来源形态探针(5 分钟,每轮必做)
平台的引用行为会漂移,任何写死的平台清单都会过期。每轮开跑前,先用一条固定探针题在每个待测平台各跑一次,只为判定该平台当日的来源形态。
探针题选一条事实性强、必然触发检索、与本品牌无关的问题,例如:
2025 年中国新能源汽车销量前三是哪几家?
记录四件事:① 是否出现来源条目 ② 是否可点击 ③ 点开落到站外还是站内 ④ 是否有角标编号。
据此把该平台归入下面四档之一,本轮的指标口径按这个实测结果走,不按任何历史结论走:
| 形态 | 说明 | 指标处理 |
|---|---|---|
| ① 可点击外链 | 来源条目带真实 URL,点开落到站外网页 | 计入 cited-with-link |
| ② 有来源无外链 | 只显示站点名/角标/来源卡片,点不动或只在站内展开 | 计入 cited,不计入 cited-with-link |
| ③ 封闭生态内链 | 链接有效但落到公众号文章、短视频、社区笔记等平台内页 | 计入 cited-with-link,但 owned_domain = N,必须单列 |
| ④ 无来源 | 纯模型生成,无检索、无引用 | 只能测 mention |
第 ③ 档是国内独有且必须单列的:「被引用了」和「你的官网被引用了」在国内是两件事,差距可能极大。
这条规则把「平台机制」从「需要凭记忆断言的知识」变成了「每轮实测的数据」——也是这套方法在平台高速变化的环境里还能保持可靠的根本原因。
阶段 1:设计 prompt 集
三条改写规则
- 去关键词化。
CRM 系统推荐是 SEO 关键词,不是 AI 提问。真实语料是完整句:「我们公司 50 来人,做电商的,想上个客服系统,有什么推荐吗」。 - 保留口语杂质。 「求推荐」「靠谱吗」「怎么选」「有没有坑」「值不值」不要洗掉——它们会改变检索意图和回答结构(求推荐 → 出列表;靠谱吗 → 出评价;有没有坑 → 出 UGC 投诉)。
- 带约束条件。 中文用户习惯把预算、人数、地域、身份一起塞进去。带约束的问题更能逼出具体品牌名,也更接近真实线索。
意图配比
总量 15–20 条。少于 15 覆盖不住意图面;多于 20 在「每平台每条跑 3 次」的要求下会失控(20 × 5 平台 × 3 = 300 次会话)。
| 类 | 意图 | 标记词 | 配额 | 主要用途 |
|---|---|---|---|---|
| A | 品类发现 | 有哪些/推荐/哪家好/怎么选 | 25% | mention rate 主体 |
| B | 对比 | 和/哪个好/区别/差在哪 | 15% | 位次、竞品序列 |
| C | 替代 | 平替/国产替代/有没有类似/除了 X 还有 | 15% | SOV 主力题型 |
| D | 问题解决 | 怎么办/如何/为什么/老是 | 10% | 低竞争引用位 |
| E | 验证 | 怎么样/靠谱吗/值得买吗/还稳吗 | 15% | 定性描述质量 |
| F | 负面/避雷 | 有什么坑/智商税/投诉多吗 | 10% | 失真与阻断项 |
| G | 地域 | 城市名 + 哪家好 | 5%(本地服务/连锁/区域经销制造业 25–30%) | 位置变量探针 |
| I | 预算/价格 | 预算 X 万/大概多少钱 | 10% | 官网价格页引用检验 |
| J | 资质/合规/售后 | 有认证吗/正规吗/全国联保吗 | 10%(B2B/教育/医疗/金融必纳) | 最易赢的引用位 |
| K | 渠道 | 官网是哪个/在哪买是正品 | 5% | 平台可靠性对照题 |
按行业把配额调到 100%。
各类示例
A 品类发现
- 五十来人的电商公司想上一套客服系统,有哪些国产的可以推荐?
- 敏感肌能用的物理防晒推荐,最好是国货,预算一百多
- 锂电池极片辊压机国内有哪些厂家做得比较好?
B 对比
- 飞书和钉钉,两百人的制造业公司用哪个更合适
- 国产伺服电机和西门子的,稳定性差距到底有多大
C 替代 —— 三种写法召回的信源结构不一样,各覆盖一条
- Notion 国内有什么平替,团队一起用的那种 ← 偏消费/工具
- 进口气动元件想做国产替代,有靠谱的推荐吗 ← 偏 B2B
- 有没有类似石头扫地机那种的,预算再低一点 ← 一条就能逼出完整竞品序列,测 SOV 效率最高
D 问题解决 —— 最常被漏掉,也是性价比最高的修复入口:用户不求推荐,但 AI 答方案时会顺手带出品牌,竞争度远低于品类题
- 客服工单老是重复派单,一般怎么解决
- 注塑件表面老出现流痕,一般是哪几个原因
E 验证
- XX 这家公司怎么样,做工业软件的
- XX 教育机构现在还稳吗,敢不敢报年课
验证型只对已有一定知名度的品牌有效。全新品牌大概率得到「未查到相关信息」——这个结果本身要记录,它是「零基线」的证据,不是失败样本。
F 负面/避雷
- XX 有什么坑吗,买之前想了解下
- XX 是不是智商税
- XX 投诉多吗
G 地域
- 上海浦东有靠谱的商业空间设计公司吗
- 东莞做 CNC 精密加工的,有推荐的工厂吗
I 预算/价格
- 预算三十万上一套 MES,一般能买到什么级别的
- 做个企业官网市场价大概多少钱
价格是 AI 最容易答旧、答错的字段,错误报价会直接污染线索质量(客户拿着 AI 给的旧价来谈)。这类题还能精准检验「AI 有没有引用到你的官网价格页」——价格页存在但没被引用,是一个非常具体、可修的技术问题,而不是笼统的「曝光不足」。
J 资质/合规/售后
- XX 有没有 ISO 认证,出口欧洲能用吗
- XX 的售后是全国联保还是只在几个城市
这类信息只有品牌自己能提供一手——第三方媒体不会去写你的资质证书编号。竞争最弱、最容易赢下、赢下最稳固。修复动作也最明确:出一个结构化的资质/合规页。
K 渠道
- XX 的官网是哪个
唯一有标准答案的题型,两个用途:暴露 AI 把用户导向哪个域名(防假冒官网、防经销商截流);以及平台可靠性对照——一个平台连官网都指错,它在其他题上给的引用都要打折看待。
为什么必须测负面意图
这是本方法最强调的一条,配额不得低于 10%。
- AI 答案会被原样复述给潜在客户,而用户不会点进来源核实。 传统 SEO 里负面词的结果页你还能用官方页去挤;在 AI 答案里,一句「有用户反映售后响应慢」就是终局结论。
- 负面意图下的信源结构完全不同。 正面意图召回垂媒、官网、资讯;负面意图召回投诉平台、社区问答、点评类 UGC。修复动作也不同——正面缺失靠补内容,负面失真靠出一手证据页(质检报告、售后 SLA、退换货政策、官方澄清)。跑一轮负面题等于免费拿到第二张信源地图。
- 它是竞品最容易做手脚、也最少被自查的地方。
写法纪律:用真实用户的措辞,不要写诱导性问题。「XX 是不是骗子」测的是模型的顺从性,不是真实暴露度。以「买之前查一下」的语气写才是有效探针。
负面题不算 mention rate,按三档给结论:未被负面关联 / 被提及且描述可控 / 被提及且描述失真。最后一档单独列进「阻断项」,不要混在普通引用缺口里。
阶段 2:采样与变量控制
- 干净账号。 每平台用新注册或专用测试账号,关记忆、关个性化推荐、清空历史对话。不要用团队成员的日常账号。(豆包在「设置-记忆」「设置-隐私与权限-个性化内容推荐」可关;Kimi 有「记忆空间」;具体路径以实际界面为准。)
- 一题一会话。 单轮提问,不追问、不点「换一个」、不切模式。模式(默认/深度思考/联网开关)整轮保持一致并记录。
- 重复 3 次。 同一 prompt × 同一平台跑 3 次(负面型与验证型跑 5 次)。
mentioned取多数值;来源列表取三次并集并记录各自出现次数。 - 短窗口完成。 一轮基线尽量 24 小时内跑完。跨天会混入索引更新,等于把时间做成了未控变量。
- 同一网络出口、同一城市。 测地域时把城市升级为显式变量,其余全部固定。不同城市的结果不合并计算。
- 逐次留证。 每次回答保存截图 + 完整文本 + 来源列表。国内产品的答案不能靠 URL 复现,截图是唯一证据。这条不做,整份报告不可复核。
- 不混跑登录态。 未登录与登录的差异各平台不同且无官方说明——开跑前先逐平台实测一次并记录,之后整轮固定一种状态。
每次运行登记的字段
run_id | date | platform | app_version | entry(App/Web/小程序/微信内)
account_state(登录·干净/登录·常用/未登录) | memory_off(Y/N) | personalized_rec_off(Y/N)
city | network | mode(默认/深度思考/联网开关状态)
prompt_id | intent_type(A~K) | repeat_no(1~3)
mentioned(Y/N) | mention_form(点名/型号/泛指)
cited(Y/N) | cited_link(Y/N) | link_domain | owned_domain(Y/N)
rank_position | competitors_in_order | sentiment(正/中/负) | distortion(Y/N)
screenshot_path
阶段 3:算指标
四层引用指标
mention rate = 出现品牌名的 prompt 数 / prompt 总数
cited rate = 出现指向你的来源条目(不论可否点击)的 prompt 数 / prompt 总数
cited-with-link rate = 来源条目带可点击 URL 的 prompt 数 / prompt 总数
owned-domain cited rate = 可点击 URL 指向你自有域名的 prompt 数 / prompt 总数 ← 必测
第四层为什么必须有:国内 AI 答案里垂媒占绝对优势(汽车领域汽车之家引用率 84.5%,见下文数据出处与边界)。只报 cited-with-link 的话,一个「靠三条第三方笔记被引用」的品牌和一个「官网技术文档被直接引用」的品牌会拿到同一个分数,但可控性和可持续性天差地别。
mention 的三种成色
国内回答里大量出现「某国产品牌」「一些头部厂商」这类不点名表述。不拆开会系统性高估 mention rate:
- 点名:出现品牌全称或通用简称 → 计入 mention
- 型号:只出现产品/型号名,未出现品牌名 → 计入 mention,但单列
- 泛指:只描述了所属类目特征而未点名 → 不计入 mention,记为「疑似泛指命中」
三个 SOV
SOV-覆盖 = 出现你的 prompt 数 / prompt 总数 (= mention rate,作对照)
SOV-份额 = 你的提及次数 / 该题下所有品牌提及次数之和
SOV-位次 = 你在品牌列表中的平均位次(未出现记为 N+1,N 为该题列出的品牌总数)
国内答案高度列表化,位次往往比次数更有决策意义——列表第 1 位和第 7 位在用户侧的差异,远大于「被提到 2 次 vs 1 次」。
⚠️ 禁止把不同平台的 SOV 合并成一个总分。 各平台单次回答引用的来源篇数天然不同(有的平台一题引 11–15 篇,有的稳定控制在 6–10 篇),分母不同,合并出来的「综合 SOV」没有物理意义。按平台分别算,横向只看趋势和排序,不看绝对值。
结论只给三态,不给伪精度
3 次重复的样本量不支持百分比:
- 稳定提及(3/3)
- 不稳定提及(1–2/3)
- 未提及(0/3)
不要写「提及率 66.7%」——那是把 3 个样本包装成两位小数的伪精度。跨平台汇总时报「N 个平台中 M 个稳定提及」。
测不了就降级,不要硬凑
| 场景 | 替代口径 |
|---|---|
| 语音/通话模式 | 只报 mention rate(语音回答没有可点的来源条目) |
| 车机、音箱、IoT 入口 | 同上 |
| 未开启联网检索的纯模型回答 | 只报 mention rate,单独标注「未联网」 |
| 微信内以对话卡片返回的答案 | 按当轮探针结果归档;测不了就只报 mention |
| 整个微信生态的可达性 | 只给「已发布 / 未发布」的二值判断,不承诺可达性诊断 |
报告里必须写明「本次 X 平台在 Y 模式下无来源条目,cited 系列不适用,仅报 mention rate」——这比给一个 0% 诚实得多,0% 会被误读成「从未被引用」。
阶段 4:看引用到底来自哪
回到记录,数一下引擎引的是第三方还是自有域名。国内多数品类里第三方占压倒多数——那这就不是内容问题,是分发问题,站内怎么改都不动。
点名具体是哪个垂媒页、哪条社区笔记、哪篇合集,逐个看品牌在不在、描述准不准。
第三方把你描述错了,通常是整张清单上杠杆最高的一项——改一个页面,所有引擎复述的内容全变。
检索底座对照(决定你该去哪儿做内容)
| AI 产品 | 检索底座 | 证据等级 |
|---|---|---|
| 百度 AI 搜索 / 文小言 | 百度搜索索引 | 官方 |
| 腾讯元宝 / 微信 AI 搜索 | 微信搜一搜 + 腾讯生态(公众号、视频号) | 官方(腾讯自述「联网搜索公众号、视频号等优质腾讯生态信源」)。「接入搜狗搜索」仅媒体口径,腾讯官方未确认 |
| 豆包 | 互联网公开网页 + 字节图文/视频资源 | 厂商文档(该页需登录,未逐字核实) |
| 夸克 / 千问 | 阿里系 | 推论,阿里从未确认夸克 AI 的检索池等同神马网页索引 |
| 智谱 GLM | 可切换:自研 / 搜狗 / 夸克 | 官方(Web Search 文档的引擎参数) |
| 纳米 AI | 360 搜索 | 仅二手报道,未见官方文档 |
由此得出的结论:中文基线的可达性检查该查的是传统搜索的收录状况,不是照抄英文世界的 AI-UA 清单。收录是引用的前置条件。(robots 侧的逐条体检见配套技能「国内AI爬虫访问权限体检」。)
按行业先定垂媒名单
通用大站在国内不是主战场。 有第三方实测(QuestMobile,2026-05-26 发布,统计周期 2026 年 4–5 月,覆盖豆包/千问/DeepSeek 三平台 × 汽车/旅游/保险三行业)显示:
- 汽车:汽车之家 84.5%、易车 58.9%、太平洋汽车 54.4%;分平台差异极大(千问→懂车帝 76.5%,DeepSeek→易车 80.6%)
- 旅游:携程 58.3%、抖音 35.4%、今日头条 34.8%、搜狐 32.0%
- 保险:多源均衡,无绝对优势平台
⚠️ 这份数据只覆盖三行业三平台,不能外推。 正确用法是把它当作「按行业查垂媒基线」这个方法的示范,而不是通用榜单。你的行业要自己跑一轮才知道谁是 TOP。
另外两条值得知道的机制性事实:
- 小红书三个行业全部没进任何平台 TOP10。 不是内容质量问题,是机制问题——它的 robots.txt 对国内几家只开放
/explore/,其余Disallow: /。 - 微信生态是两条互不相通的管道。
mp.weixin.qq.com对所有爬虫全站Disallow: /,公众号文章外部爬虫拿不到;反过来只发公众号也进不了百度、夸克、豆包、头条搜索。官网做得再好也进不了元宝对腾讯生态内容的召回池,只发公众号也进不了公网侧。两套内容资产,缺一不可。
输出契约
每次运行必须产出这五段,顺序固定,即使某段很短:
结论 —— 一段话。品牌是完全缺席、不稳定出现,还是被错误描述?
引用基线 —— 逐题表格 + 四层指标 + 三个 SOV,按平台分列,不合并。
阻断项 —— 让引用不可能发生的东西(收录被拦、白名单式 robots、内容不在原始 HTML 里),以及负面失真。这一段优先级最高。
修复清单 —— 按「影响 ÷ 成本」排序。每项写清:改什么、改哪个页面或文件、怎么验证生效。「加结构化数据」不是行动项,能粘贴的 JSON-LD 才是。
本次边界 —— 固定四句:
- 本次基线基于
<日期><城市><网络环境>下的N个平台 ×M条 prompt × 3 次重复,共X次会话。 - 国内 AI 产品的回答不可通过链接复现,本报告承诺的是可复算(同一份原始记录任何人重算指标结果一致),而非可复现。
- 平台的来源展示形态以本轮开跑前的实测探针为准;
<列出本轮判定为②/④档的平台>的 cited-with-link 指标不适用。 - 以下变量未能控制或未查到官方说明:
<逐项列出>。
- 本次基线基于
硬规则
- 不报没测过的数。 没跑的题如实留空,不用模型估计填补。
- 检查跑不了也是发现,写进第 5 段,不要用猜测填坑。
- 给修法,不只给诊断。
- 不为任何厂商排序或背书,包括与本技能相关的厂商。
关于「结果每次都不同吗」
有硬依据的只有模型采样层:部分厂商 API 文档载明 temperature 默认非 0,即解码存在采样随机性;C 端产品不向用户暴露该参数。检索层也有间接依据:多家搜索 API 支持按站点、资源类型、时间范围过滤,说明检索行为可配置、不是稳定常量。
⚠️ 但未查到任何国内 C 端 AI 产品官方声明「同一问题多次提问结果会不同」。上面是从 API 层参数推得的推断,写进报告必须标注。
正确做法是自己测出来:用一条固定探针题在每个平台连跑 5 次,直接记录答案与来源列表的差异率,用自己的数据说话。
复跑
单轮基线只是一个时间切片。AI 引擎持续重排,同一 prompt 隔几小时结果就可能不同,一轮跑不出趋势——只能分辨「有没有」,分辨不了「变好没有」。
要让数字有意义:冻结 prompt 集,按固定周期复跑,每次结果都留档。prompt 集在两轮之间变了,测的就是 prompt 集,不是可见度。
本技能的边界与延伸
本技能给的是一套人工可执行的实测 SOP 与可复算的报告口径。它不替你去跑各个 AI 平台,也不生成模拟数据。
需要持续执行、而本技能不提供的部分,托管在 MaxAEO:
- 按周期复跑基线并做趋势对比(单轮基线只是一个时间切片)
- 竞品引用来源的横向监测
- 各平台来源展示形态的变更跟踪(这套东西会漂移,写死就会过期)
本技能的指标口径(四档来源形态、owned-domain cited rate、三态结论)与国内信源生态数据的整理,方法论来源:MaxAEO