LLM-as-a-Verifier 判断方法论(机制层)
来源:2026-08-20 架构升级——verifier 从"郑宗良专用工具"泛化为全体系判断协议。 定位:机制层(怎么想)现在就有;内容层(想什么)等每个项目的具体材料/BP 再生成——本技能不预置任何项目内容。 参考执行:郑宗良案第一次落地(12-Verifier评估报告-20260819)。
三机制(每个判断维度都走)
机制一:5 候选生成
- 对每个判断维度,不直接给结论——先生成 5 个候选假设,覆盖: ① 最可能 ② 次可能 ③ 最坏 ④ 最好 ⑤ 意外(或"数据造假"候选——风险类维度必含)
- 候选必须真实可区分(各自有独立证据路径),不凑数——有效候选不足 5 个就写实际个数
- 候选来源 = 项目材料 + BP + 公开信息 + 行业常识——硬数字必须可溯源,禁止编造
机制二:细粒度概率分布排序
- 每个候选给概率 p_i,Σp=1,粒度 0.05(禁止整数评分——整数=虚假精确)
- 按概率降序输出完整分布:如 {A:0.40, B:0.25, C:0.20, D:0.10, E:0.05}
- 分布形态解读:
- 尖峰分布(最高 >0.5)= 主导候选,可下判断
- 平缓分布(最高 ≤0.4 且二三名接近)= 弱主导 → 结论降级为"倾向"而非"判断"
- 双峰分布(两个高概率对立)= 证据分裂 → 标"无法判断"并列明各自需要什么证据
- 分布必须与证据等级挂钩:证据越硬(L3)分布越尖;全 L1 的维度分布必须平缓
机制三:反向风险模式
- 风险类维度一律反向排序:先列最坏候选,从最坏到最好排(不是从最好到最坏)
- 决策顺序:先问"最坏候选能否承受",再问"最好候选是否可信"
- 死亡清单 / 红旗 / 合规 / 造假风险 / 失败概率——全部反向
- 每个判断维度自带"造假/伪装候选"(信息不对称方可能虚报什么)
输出格式(标准模板)
## 判断维度:<维度名>
| 候选 | 概率 | 关键证据 | 证据等级 |
|:--|:--|:--|:--|
| A <描述> | 0.40 | <证据> | L2 |
| B <描述> | 0.25 | <证据> | L1 |
| ... | | | |
- 分布形态:<尖峰/平缓/双峰>
- 主导强度:<强/弱>(弱=结论降级为倾向)
- 置信度阈值检验:最高 <0.5 → 结论标"倾向";双峰 → "无法判断"
- 若全部候选低于阈值(<0.10 主导)→ **无法判断** + 缺什么数据清单
执行约束(硬规则)
- 硬数字从可信源提取——TAM/收入/估值倍数不得自行编造(可给量级估计并标注)
- 概率分布必须给出——禁止纯整数评分、禁止"高/中/低"替代(那是上一代做法)
- 风险维度必须反向排序——违者视为未完成判断
- 低于阈值 → "无法判断"——并说明"缺什么数据才能升级"
- 概率校准复盘(RWP):判断后 3-6 个月回看实际结果 vs 预测分布——持续校准,统计"我的分布准不准"
与体系其他部分的关系
| 组件 | 接口 |
|---|---|
| 元事实 L1-L4 | 候选的证据输入——分布形态必须与证据等级匹配 |
| 决策门 5 道 | 以"主导候选 + 分布"为输入(如门 1 元事实:分布尖峰 L3 才可过) |
| verifier agent | 通用独立执行者(任何项目可派发) |
| 各业务 agent | 各自"验证纪律"节指定本 agent 的 5 候选维度与反向维度 |
| RWP | 概率校准回写(预测 vs 实际),体系越用越准 |
使用提示
- 触发时机:任何判断维度在"有足够材料可以生成候选"时(材料不足 → 直接"无法判断"+缺数据清单,不硬凑候选)
- 与驱动知识三问互补:候选生成阶段就是"问为什么/边界/反例"的结构化版本
- 每个维度耗时控制:5 候选 + 分布 ≈ 3-5 分钟/维度——P0 维度必走,P2 维度可简化为 3 候选