# Verifier Method

> LLM-as-a-Verifier 判断方法论——任何判断维度的三机制：5 候选生成 + 细粒度概率分布排序 + 反向风险模式。MUST BE USED 当对项目做判断（技术/市场/团队/估值/风险任一维度）且需要多假设验证、防止单一路径自信时。

- Skill: `justinjchen-cornell/verifier-method` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add justinjchen-cornell/verifier-method`
- Raw SKILL.md: https://api.skillmd.com/api/skills/justinjchen-cornell/verifier-method/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: Justinjchen-Cornell (https://skillmd.com/u/justinjchen-cornell)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/justinjchen-cornell/verifier-method

---


# LLM-as-a-Verifier 判断方法论（机制层）

> 来源：2026-08-20 架构升级——verifier 从"郑宗良专用工具"泛化为全体系判断协议。
> 定位：**机制层（怎么想）现在就有；内容层（想什么）等每个项目的具体材料/BP 再生成**——本技能不预置任何项目内容。
> 参考执行：郑宗良案第一次落地（12-Verifier评估报告-20260819）。

## 三机制（每个判断维度都走）

### 机制一：5 候选生成
- 对每个判断维度，不直接给结论——先生成 **5 个候选假设**，覆盖：
  ① 最可能 ② 次可能 ③ 最坏 ④ 最好 ⑤ 意外（或"数据造假"候选——风险类维度必含）
- 候选必须**真实可区分**（各自有独立证据路径），不凑数——有效候选不足 5 个就写实际个数
- 候选来源 = 项目材料 + BP + 公开信息 + 行业常识——**硬数字必须可溯源，禁止编造**

### 机制二：细粒度概率分布排序
- 每个候选给概率 p_i，**Σp=1，粒度 0.05**（禁止整数评分——整数=虚假精确）
- 按概率降序输出完整分布：如 {A:0.40, B:0.25, C:0.20, D:0.10, E:0.05}
- 分布形态解读：
  - **尖峰分布**（最高 >0.5）= 主导候选，可下判断
  - **平缓分布**（最高 ≤0.4 且二三名接近）= 弱主导 → 结论降级为"倾向"而非"判断"
  - **双峰分布**（两个高概率对立）= 证据分裂 → 标"无法判断"并列明各自需要什么证据
- 分布必须与证据等级挂钩：证据越硬（L3）分布越尖；全 L1 的维度分布必须平缓

### 机制三：反向风险模式
- **风险类维度一律反向排序**：先列最坏候选，从最坏到最好排（不是从最好到最坏）
- 决策顺序：先问"**最坏候选能否承受**"，再问"最好候选是否可信"
- 死亡清单 / 红旗 / 合规 / 造假风险 / 失败概率——全部反向
- 每个判断维度自带"造假/伪装候选"（信息不对称方可能虚报什么）

## 输出格式（标准模板）

```
## 判断维度：<维度名>
| 候选 | 概率 | 关键证据 | 证据等级 |
|:--|:--|:--|:--|
| A <描述> | 0.40 | <证据> | L2 |
| B <描述> | 0.25 | <证据> | L1 |
| ... | | | |
- 分布形态：<尖峰/平缓/双峰>
- 主导强度：<强/弱>（弱=结论降级为倾向）
- 置信度阈值检验：最高 <0.5 → 结论标"倾向"；双峰 → "无法判断"
- 若全部候选低于阈值（<0.10 主导）→ **无法判断** + 缺什么数据清单
```

## 执行约束（硬规则）

1. **硬数字从可信源提取**——TAM/收入/估值倍数不得自行编造（可给量级估计并标注）
2. **概率分布必须给出**——禁止纯整数评分、禁止"高/中/低"替代（那是上一代做法）
3. **风险维度必须反向排序**——违者视为未完成判断
4. **低于阈值 → "无法判断"**——并说明"缺什么数据才能升级"
5. **概率校准复盘**（RWP）：判断后 3-6 个月回看实际结果 vs 预测分布——持续校准，统计"我的分布准不准"

## 与体系其他部分的关系

| 组件 | 接口 |
|:--|:--|
| 元事实 L1-L4 | 候选的证据输入——分布形态必须与证据等级匹配 |
| 决策门 5 道 | 以"主导候选 + 分布"为输入（如门 1 元事实：分布尖峰 L3 才可过）|
| verifier agent | 通用独立执行者（任何项目可派发）|
| 各业务 agent | 各自"验证纪律"节指定本 agent 的 5 候选维度与反向维度 |
| RWP | 概率校准回写（预测 vs 实际），体系越用越准 |

## 使用提示
- 触发时机：任何判断维度在"有足够材料可以生成候选"时（材料不足 → 直接"无法判断"+缺数据清单，不硬凑候选）
- 与驱动知识三问互补：候选生成阶段就是"问为什么/边界/反例"的结构化版本
- 每个维度耗时控制：5 候选 + 分布 ≈ 3-5 分钟/维度——P0 维度必走，P2 维度可简化为 3 候选

