# Cw Collab Review

> 评估用户（目标人员）在与 AI 协作过程中的行为质量——不是评价代码产出，而是评价人的判断、决策、纠偏、审查等协作行为。基于九维度行为框架给出 0-4 分评分和具体改进建议。当用户说"评价一下我的表现""复盘刚才的协作""我刚才协作得怎么样""人机协作评估""协作复盘"时触发，或在用户粘贴一段对话记录要求评估时触发。

- Skill: `nutstore/cw-collab-review` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add nutstore/cw-collab-review`
- Raw SKILL.md: https://api.skillmd.com/api/skills/nutstore/cw-collab-review/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: nutstore (https://skillmd.com/u/nutstore)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/nutstore/cw-collab-review

---


# 人机编码协作行为复盘 (Collaboration Review)

## 核心定位

为与 AI 协作的开发者提供**行为层面的复盘**：不评价代码/产出物好坏，只评价"人在协作过程中做了哪些有价值的判断、错过了哪些介入机会、哪些行为建立在未验证的前提上"。

目标：让用户下一次与 AI 协作时，**更早介入、更准纠偏、更少无效投入**。

## ⚠️ 先加载框架再评估

完整的九维度定义、评分规则、输出格式模板都在 reference 里。**评估前必须先读**：

```
read_skill_resource("cw-collab-review", "references/evaluation-framework.md")
```

这份 SKILL.md 只讲执行流程，不讲维度细节。

---

## 两种触发场景

### 场景 A：评估当前会话（最常见）

用户说"评价一下我刚才的表现"——目标人员就是**当前用户**，AI 就是**你自己（当前 agent）**。

数据来源：
- ✅ 当前会话的完整上下文（你有全部消息记录）
- 需要识别：哪些消息来自用户、哪些是 AI 的分析/工具调用/输出
- 同事消息：如果用户在对话里引用了同事的话，标注为同事

⚠️ **关键纪律**：评估 AI（你自己）的行为时要更严格，不能因为"AI 主动发现了问题"就算作用户的能力。AI 自己的纠偏、AI 自己的预见性，都只能作为"判断用户是否有介入机会"的背景，不能算用户的正向行为。

### 场景 B：评估外部对话（用户提供记录）

用户粘贴一段外部对话（可能是与其他 AI、与同事的协作记录）。

数据来源：用户提供的对话文本。需要用户指明：
- 谁是目标人员
- 谁是同事（如有）
- 哪些是 AI 的输出

如果角色不清晰，先问清楚再评估。

---

## 执行流程

### 第一步：加载评估框架
```
read_skill_resource("cw-collab-review", "references/evaluation-framework.md")
```

### 第二步：识别角色与阶段
- 明确目标人员、同事、AI 的发言边界
- 按时间划分协作阶段（需求澄清 / 信息调查 / 方案设计 / 编码实施 / Review / 验证）

### 第三步：提取关键行为事件
按时间顺序，提取目标人员的**关键判断行为**。每个事件标记：
- 主行为维度 + 次行为维度（从九维度选）
- 前提有效性（✅已确认 / ⚠️未确认但合理 / ❌被证伪 / 证据不足）
- 收缩与必要扩张质量（高/中/低/不适用）
- 是否改变后续方向
- 行为评价

⚠️ 不要把"好的""继续"这种机械回复算作关键事件。

### 第四步：识别介入机会与缺失行为
只在**对话中明确出现了需要介入的场景**时，才指出用户缺少某种行为。
区分两种情况：
- 未出现适用场景（不计为缺点）
- 出现了介入机会但未观察到行为（可指出）

### 第五步：按框架输出
严格按 reference 里定义的 **10 个 section** 输出。不要省略，不要合并，不要只给抽象结论。

---

## 九维度速查（详见 reference）

| 维度 | 一句话 | 价值层级 |
|------|--------|---------|
| 1. 定向信息获取 | 主动查代码/事实，而非只接受 AI 总结 | 基础 |
| 2. 复述确认 | 在关键节点用自己的话重述结论 | 基础 |
| 3. 需求与任务边界收缩 | 明确做什么、不做什么 | 关键 |
| 4. 方案取舍与主导决策 | 不默认接受 AI 首选方案 | 关键 |
| 5. 实施时机与介入节奏 | 前提稳定后才编码，风险出现时暂停 | 关键 |
| 6. 否定与纠偏 | 有依据地指出 AI 错误 | 关键 |
| 7. 预见性判断与主动设限 | **事前**识别风险——价值最高 | 最高 |
| 8. 搜索方向修正 | 修正 AI 跑偏的调查方向 | 中 |
| 9. 基于实现细节的校准与审查 | 读实际代码，而非只看 AI 总结 | 关键 |

**核心原则**：事前发现 > 事后发现；一次精准介入 > 多轮模糊质疑；依据充分 > 凭感觉。

---

## 输出结构（10 个 section，详见 reference）

1. 总体结论（4-8 句）
2. 协作阶段概览（表格）
3. 关键行为事件表
4. 九维度评价表
5. 做得好的地方（2-5 项，含行为/证据/价值）
6. 需要提高的地方（2-5 项，含可用表达）
7. 前提有效性汇总
8. 无效投入与止损分析
9. 实施后审查专项结论
10. 最终行为画像（模式/最值得保留/最优先改进/一句话结论）

---

## 边界与失败模式

| 情况 | 处理 |
|------|------|
| 对话极短（< 5 轮） | 数据不足，提示用户"对话太短，建议在更完整的协作后复盘" |
| 用户要求只看"好的地方" | 可以，但仍需指出前提有效性 |
| 用户要求评估"代码质量" | 拒绝——本 skill 只评估人的行为，不评估代码 |
| 对话未进入编码阶段 | 第 9 节"实施后审查"标注不适用，其余正常 |

## 不做的事

- ❌ 不评价最终代码/产出物的好坏
- ❌ 不把 AI 主动发现的问题算作用户能力
- ❌ 不因为发言多就给高分
- ❌ 不因为项目成功就反推用户优秀
- ❌ 不对未出现适用场景的维度机械扣分
- ❌ 不只给抽象结论，必须引用具体对话证据

---

## 版本

- **v1.0** (2026-07-28): 初版，基于用户提供的九维度行为评估框架

