数据评估方法论 — 进入陌生领域,先评数据再动手
核心判断:这个场景要不要走这套流程
传统软件开发,需求+原型就能开工——行为是写死的规则,数据只是运行时输入。AI 智能体反过来:能力由数据界定。同一张"客服 AI"原型图,能不能听懂客户的话、判得准不准,原型画不出来,取决于有没有相应的数据/标准答案。
先判类型,不是所有 AI 项目都要走全套八步:
| 类型 | "做对"由谁定义 | 要不要走这套 | 例子 |
|---|---|---|---|
| 垂直判断型 | 领域私有,看过大量真实数据才知道对错 | 要,重度需要 | 合同审查、客服意图/话术、风控、质检 |
| 通用能力型 | 通用,模型预训练就会 | 基本不需要 | 写作/翻译/摘要/闲聊助手 |
| 工具编排型 | 确定性,API返回值/规则说了算 | 基本不需要 | 查天气、订日程的调度 agent |
只有垂直判断型才值得走全套八步;另外两类直接进后置质量评估(agent-quality-evaluation 技能)建评估集防退步就够了。
开工准入检查(缺项立即停)
正式走八步之前先过这道门。硬门槛缺了 → 停,先补齐再开工;软风险 → 能开工但挂账标记,盯着。
硬门槛:
- 目标清楚吗——要造什么智能体、目标能力清单有没有雏形(哪怕3条)?没有 → 停,先做第1步
- 数据来路盘过吗——这批数据属"现成到手/主动要来/自己挖/压根没有"哪一档?是"压根没有"且无补法 → 停,这事可能根本立不住
- 对错判得了吗——判不了对错、又找不到任何判据(专家、数据、规则全无)→ 停
软风险(能开工,但挂账盯着):
- ⚠️ 能力清单里有条目答不上"谁问过要这个" → 高度疑似凭空塞,标红别急着往下游送
- ⚠️ 能力串不成一条主闭环 / 冒出挂不到主链的孤立能力 → 疑似凭空塞或漏了衔接能力
- ⚠️ 数据只覆盖窄时间窗/窄类型 → 后面大概率变缺口,先记进台账
- ⚠️ 得靠真人专家但要不到 → 按下方"专家不可得"三层降级,降不动就老实标"未确认"
八步流程
详细方法论正文、完整案例见 references/methodology.md;三个脱敏实例案例见 references/cases.md;踩坑台账见 references/pitfalls.md。这里只列每步的核心动作,具体怎么做读 references。
- 定目标能力清单(整条流水线最关键的一步)——把"要做一个X AI"拆成具体能力条目,每条能说清楚来源(访谈痛点/反馈反推/数据统计聚类),说不清楚就是凭空塞的。能全量扫描验证的信号别停在小样本抽样——抽样比例可能跟全量实测差出一倍以上。
- 画业务流程主闭环——把离散能力串成一条主链,每个节点标归属(🤖 AI造 / ⚙️ 传统软件造 / 🔌 甲方现有系统),只有 🤖 段需要走第4步盘家底、第8步找缺口。现状和目标必须分开画两张图,不能把"打算怎么做"当成"正在怎么做"记录。
- 能力分类判定——针对每条能力问两个问题:怎么交互(批处理/对话)、有没有标准答案(有答案/没答案)。四格归类,一条一条问,不给整个智能体下总判断。
- 盘家底——4a 业务流程现状盘点(业务方张嘴就能说清楚的显性信息)+ 4b 数据资产盘点(先确认怎么来的:现成到手/主动要来/自己挖/压根没有,再数量/形态/时间窗/合规)。
- 测损耗——数据要经过提取/转换才能进管线,每一步转换都会失真,先量化损耗再谈使用。字段全空往往是提取问题,不是数据没有。
- 分流定用途——无标签数据不要平均用力:AI 快扫预分 → 人工只做否决式确认 → 不同质量走不同用途。金标全量每个意图 30-50 条打底;递给专家的只精选约20条(5分钟能划完)。
- 榨取资产——同一批数据榨出六类资产:金标/知识库、规则/守卫、基准线/分布、评估集、模拟角色、对照素材。兑不出的不是失败,是诚实记缺口。
- 能力对照找缺口 → 补法——缺口分四类:可考古(数据在,没归集)、可合成(AI模拟+真实锚定)、真缺(等/造/换路/标已知边界)、集成缺口(甲方系统接不接得上)。结论要落到"瓶颈判断":该补数据还是改技术。
专家不可得:默认前提,不是障碍
三层递进,一层比一层贵,能走上面就别走下面:
- 第1层(优先):不问专家,AI 批量读现成数据,产出归纳性结论
- 第2层:AI 学着扮演专家猜答案(提示词+每次调用,不是常驻智能体),拿真实结果核对
- 第3层(实在躲不开):真人只做"对不对"的否决式判断,摆成结构化表格,压到5分钟能划完(约20条:最典型+最拿不准)
真人确认是一次性稀缺资源,别把全量甩给专家;碰到"机灵""贴心"这类讨喜形容词,要先具象化成具体对比方案、再亮成本,两关都扛过去才算真需求。
产出物:《数据评估报告》十节模板
1. 目标能力清单 2. 业务流程主闭环 3. 场景分类判定 4. 家底盘点
5. 损耗测量 6. 分流结果 7. 资产清单 8. 能力对照缺口表
9. 专家依赖清单 10. 总结论
十节不是同等重要:第1、2、4a、9、10节给业务方看(决策内容),第3、4b、5、6、7、8节是评估者自己的证据链。完整模板见 references/report-template.md。
用这个技能时该做什么
被邀请做数据评估时:
- 先判"要不要走全套"(上面的三分类表)
- 过开工准入检查,硬门槛缺项直接停、讲清楚缺什么
- 按八步走,每步产出对应报告章节,边做边引用
references/cases.md里同类型的案例作参照 - 遇到"没答案"类能力(如情绪安抚),额外提示行业证据支持的执行风险(做不好是倒扣分,不是平庸),别止步于"这类难评分"