# Delphi Method

> 德尔菲法（Delphi Method / 专家咨询法）全流程方法学助手，聚焦"用多轮匿名专家咨询构建并筛选指标体系"的完整链路。当用户要做德尔菲专家检验的任何环节时使用：判断该不该用德尔菲（vs 层次分析法/问卷调查/焦点小组）、指标初选与初始指标体系搭建、专家遴选（人数、资质、代表性）、咨询问卷设计（Likert 计分、开放意见栏）、轮次设计（几轮、什么时候停）、四大核心统计量计算与解读——专家积极系数（回收率）、专家权威系数 Cr（判断依据 Ca + 熟悉程度 Cs）、专家协调程度（肯德尔和谐系数 Kendall's W + 卡方检验、变异系数 CV）、专家意见集中程度（算术平均值、满分频率）；两套指标筛选标准（界值法 / 变异系数-均值法）的公式、判定规则与选择依据；指标增删改的决策与专家反馈；权重确定；德尔菲过程文档与论文方法章写作；审稿与答辩高频质疑应对。触发词包括"德尔菲""德尔菲法""Delphi""专家咨询""专家检验""专家打分""指标体系构建""指标筛选""肯德尔和谐系数""Kendall W""协调系数""变异系数""满分频率""专家权威系数""专家积极系数""界值法""两轮咨询""指标剔除""专家意见集中度"等。工具中立（SPSS/Excel/R/DView 皆可），覆盖从"要不要用德尔菲"到"最终指标体系成文"的全过程。

- Skill: `maydengximin-sketch/delphi-method` (Agent Skill, multi-file: 5 files)
- Install (CLI): `npx skillmds@latest add maydengximin-sketch/delphi-method`
- Raw SKILL.md: https://api.skillmd.com/api/skills/maydengximin-sketch/delphi-method/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: maydengximin-sketch (https://skillmd.com/u/maydengximin-sketch)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/maydengximin-sketch/delphi-method

---


# 德尔菲法（专家咨询/专家检验）

## 核心姿态

德尔菲法的本质是：**用多轮匿名反馈，让一群专家的意见从分散走向收敛**。

它不是"找几个专家打个分"，而是一个有明确判定标准的**收敛过程**。判断一次德尔菲做得好不好，看三件事：

1. **专家够不够格**（权威系数、代表性）
2. **意见收没收敛**（协调系数、变异系数是否随轮次改善）
3. **筛选有没有依据**（筛选标准是事先定好的，不是看着数据凑的）

**最常见的失败**：先看数据，再定标准。这是结果导向的倒推，审稿人一眼就能看穿。**筛选标准必须在收数据之前写死。**

不要承诺"做完德尔菲就一定能发表"。也不要把德尔菲当成给已有指标体系"背书"的工具——如果两轮下来一个指标都没删，审稿人会问：那你做这个干什么？

## 一、什么时候该用德尔菲

| 适合 | 不适合 |
|---|---|
| 缺乏客观数据，需要依靠专家经验判断 | 已有充足的客观数据可做统计推断 |
| 要**构建**一个新的指标体系/评价体系 | 只是要**验证**一个成熟量表（用 CFA） |
| 议题跨学科、需要多方经验整合 | 议题有明确标准答案 |
| 需要匿名以避免权威压制和从众 | 需要面对面碰撞产生新想法（用焦点小组） |

**和相邻方法的关系**：
- **德尔菲 → AHP/熵权法**：德尔菲负责"选出哪些指标"，AHP 等负责"每个指标多重要"。两者常串联使用。
- **德尔菲 vs 问卷调查**：德尔菲的样本是专家（十几到几十人），追求**收敛**；问卷调查的样本是总体代表（几百人），追求**推断**。不要混淆。

## 二、完整流程

```
指标初选（文献分析 / 质性编码 / 理论框架）
      ↓
组建专家团队（遴选标准事先写死）
      ↓
设计咨询问卷（Likert 计分 + 开放意见栏）
      ↓
第一轮咨询 → 回收 → 计算四大系数 → 按筛选标准增删改
      ↓
第二轮咨询（把第一轮结果反馈给专家）→ 回收 → 再计算
      ↓
判断是否收敛？（W 提升、CV 下降、意见趋于一致）
      ↓  否 → 第三轮
      ↓  是
确定最终指标体系 → （可选）确定权重
```

**轮次**：通常 **2-3 轮**。一轮不够（没有反馈就不叫德尔菲）；超过三轮专家易疲劳、流失率上升。

## 三、专家团队

**人数**：常见 **15-50 人**。少于 15 人代表性存疑，多于 50 人协调难度陡增、边际收益递减。

**遴选标准（必须事先写死并在论文中报告）**：
- 研究领域与本课题的相关性
- 职称 / 学历 / 从业年限（例：中级及以上职称，从业 ≥ 5 年）
- 领域代表性（学界 + 业界 + 一线实践者的配比）
- 地域 / 机构分布（避免单一来源）

**必须报告**：专家基本情况表（人数、职称、学历、年限、专业方向的分布）。**不要出现专家姓名与工作单位**——匿名是德尔菲的方法要求，也是伦理要求。

## 四、四大核心统计量

这四个是德尔菲的"体检指标"，缺一不可，审稿人都会看。

### 1. 专家积极系数（回收率）
```
积极系数 = 回收问卷数 / 发放问卷数
```
- 反映专家对本研究的关心程度。
- **一般认为 ≥ 70% 可接受**，越高越好。多轮之间的流失率也要报告。

### 2. 专家权威系数 Cr
```
Cr = (Ca + Cs) / 2
```
- **Ca = 判断依据系数**：专家做判断的依据（理论分析、实践经验、同行了解、直觉），每项按影响程度大/中/小赋值后求和。
- **Cs = 熟悉程度系数**：专家对该问题的熟悉程度（很熟悉…不熟悉），按 1.0 / 0.8 / 0.6 / 0.4 / 0.2 / 0 赋值。
- **判定：Cr ≥ 0.7 认为结果可信**，Cr ≥ 0.8 为高权威。
- **注意**：Ca 和 Cs 的量表必须**放在问卷里让专家自评**，不能事后拍脑袋填。很多人做到一半才发现忘了收，只能重发问卷。

### 3. 专家协调程度

**（1）肯德尔和谐系数 Kendall's W** —— 检验全体专家意见的一致性

- 取值 0-1，需同时报告 **卡方检验的显著性（p < 0.05）**。
- **W 显著 ≠ W 很高**。W 只要显著，就说明专家意见的一致性非随机；W 的绝对值高低反映一致性强弱。

常用解释区间：

| W 值 | 一致性程度 |
|---|---|
| < 0.2 | 较差 |
| 0.2 – 0.4 | 一般 |
| 0.4 – 0.6 | 中等 |
| 0.6 – 0.8 | 较强 |
| 0.8 – 1.0 | 很强 |

> ⚠️ 现实中德尔菲的 W 常落在 **0.2–0.5**，这是正常的——专家人数越多、指标越多，W 天然越低。**关键看 W 是否显著，以及第二轮是否高于第一轮（收敛的证据）**。不要因为 W 只有 0.3 就慌，也不要为了好看去删专家。

**（2）变异系数 CV**
```
CV = 标准差 / 算术平均值
```
- 反映专家对**某一个具体指标**评分的离散程度。CV 越小，专家对该指标越有共识。
- 一般以 **CV < 0.25** 作为共识良好的经验标准。

**W 和 CV 的分工**：W 看**整体**专家一致性，CV 看**单个指标**的共识。两者都要报。

### 4. 专家意见集中程度
- **算术平均值**：该指标的重要性得分均值，越高越重要。
- **满分频率**：给该指标打满分的专家人数 / 总人数。越高说明认同度越强。

## 五、两套指标筛选标准（选一套，事先写死）

### 方法 A：变异系数-均值法（简单、常用）

判定规则（三项指标）：
- **算术平均值 > 3.0（或 3.5，5 分制下）**
- **变异系数 < 0.25**
- **满分频率**（可选纳入）

**剔除规则**：三项中有一项不满足即剔除。（也有研究采用"两项均不满足才剔除"的宽松版——**必须在方法章明确说明你用的是哪一种**。）

### 方法 B：界值法（更严谨、更受审稿人认可）

界值不是拍脑袋定的，而是**由本轮全部指标的数据算出来的**：

```
算术平均值界值 = 全部指标均值的平均数 − 标准差    → 指标均值 > 界值 才合格
变异系数界值   = 全部指标 CV 的平均数 + 标准差     → 指标 CV  < 界值 才合格
满分频率界值   = 全部指标满分频率的平均数 − 标准差  → 指标满分频率 > 界值 才合格
```

**判定规则**：
- 三项**全部合格** → 保留
- **部分不合格** → 提交专家组讨论决定去留（并在论文中说明理由）
- **三项全部不合格** → 直接剔除

> 界值法的优势：阈值来自数据本身，不是主观设定，**更难被质疑"标准是为了留下你想留的指标而定的"**。

### 怎么选
- 指标数量多、想要更强的方法学辩护 → **界值法**
- 指标少、追求简洁 → **变异系数-均值法**
- **不要两套都算，然后挑对自己有利的那套报告。** 这是学术不端。

## 六、轮次间的动作

第一轮结束后，必须做三件事：

1. **按标准筛选**：删掉不合格指标（并记录每一个被删指标的数据与理由——审稿人会要）
2. **处理专家的开放意见**：新增指标、合并指标、修改表述
3. **准备反馈材料**：把第一轮的**统计结果（均值、CV、满分频率）连同修改后的指标**反馈给专家

**反馈是德尔菲的灵魂**。没有反馈的多轮打分，只是重复调查，不是德尔菲。

**收敛的判断依据**：
- Kendall's W **升高**
- 变异系数 **普遍下降**
- 需要增删的指标 **趋近于零**

三者同时出现，即可停止。

## 七、工具操作

**SPSS 算 Kendall's W**：
`分析 → 非参数检验 → 旧对话框 → K 个相关样本 → 勾选 Kendall's W`
（把每个指标作为一个变量，每位专家作为一行）

**Excel**：均值 `AVERAGE`、标准差 `STDEV.S`、变异系数 = 标准差/均值、满分频率 = `COUNTIF(区域,5)/专家数`。界值按上面的公式再算一层。

**R**：`irr::kendall(matrix, correct = TRUE)`

**专用软件**（如 DView 等）也可，但**必须能说清它算的是什么公式**——审稿人不认"软件算出来的"。

## 八、过程文档 / 论文方法章结构

一份完整的德尔菲报告应包含：

1. **指标初选**：来源（文献/质性编码/理论）、初始指标体系表（几个一级、几个二级、几个三级）
2. **专家团队**：遴选标准、人数、基本情况分布表（匿名）
3. **问卷设计**：计分方式、是否含开放意见栏、权威系数量表
4. **数据分析**
   - 专家积极系数（各轮回收情况表）
   - 专家权威系数（Ca、Cs、Cr 计算表）
   - 专家协调程度（各轮 W 值 + 卡方 + p 值表；变异系数）
   - 专家意见集中程度（均值、满分频率）
5. **指标筛选**：筛选标准（写清是界值法还是均值-CV 法及其公式）、各轮筛选结果表、**被剔除指标及其理由**
6. **最终指标体系**：修改前后对比、最终体系表
7. （可选）**权重确定**：AHP / 百分权重法等

## 九、审稿与答辩高频质疑

| 质疑 | 怎么答 |
|---|---|
| "专家只有 20 人，代表性够吗？" | 德尔菲追求的是**专家的权威性与代表性**，不是统计推断的样本量。用 Cr 值和专家分布来答。 |
| "W 只有 0.3，一致性这么差？" | W 显著即说明非随机一致；并展示**第二轮 W 高于第一轮**，证明意见在收敛。 |
| "为什么删这几个指标？" | 拿出事先写死的筛选标准和每个被删指标的具体数据。**标准在前，数据在后。** |
| "两轮就够了吗？" | 用收敛证据答：W 升高、CV 普遍下降、增删指标趋近于零。 |
| "专家怎么选的？" | 拿出事先写死的遴选标准，并说明领域/职称/年限/机构的分布。 |
| "你是不是先看了数据才定标准？" | 这是最致命的质疑。**唯一的防御是：标准写在收数据之前，并在文中明确陈述。** |

## 十、伦理与边界

- **匿名性**：专家之间必须互相匿名；论文中不得出现专家姓名与单位。
- **知情同意**：专家应知晓研究目的、轮次安排与数据用途。
- **不得**为了让某个指标"活下来"而调整标准、剔除专家或修改数据。
- **不得**在两套筛选方法中挑选对自己有利的结果报告。
- 报告**全部**轮次的数据，包括不好看的那一轮。

> 📚 详细统计公式与工具操作见 `references/statistics.md`；
> 筛选标准的完整判定逻辑见 `references/screening-criteria.md`；
> 过程文档与论文写作模板见 `references/reporting.md`；
> 权威文献见 `references/bibliography.md`。

