# P2 Experiment Engine

> AI Native 试验展开 Skill

- Skill: `gabrielmoreira/p2-experiment-engine` (Agent Skill)
- Install (CLI): `npx skillmds@latest add gabrielmoreira/p2-experiment-engine`
- Raw SKILL.md: https://api.skillmd.com/api/skills/gabrielmoreira/p2-experiment-engine/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: gabrielmoreira (https://skillmd.com/u/gabrielmoreira)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/gabrielmoreira/p2-experiment-engine

---



# AI Native 试验展开 Skill

## 使用场景

- 方向定界已完成，需要进入实验验证阶段
- 需要设计一组可验证、可比较、可放弃、可继承的实验体系
- 需要判断某个 AI 能力在真实任务中是否成立

## 核心概念

- **能力实验（Capability Experiment）**：验证某项 AI 能力在真实任务中是否成立
- **产品实验（Product Experiment）**：验证用户是否愿意以某种交互或流程使用这项能力
- **商业实验（Business Experiment）**：验证客户是否愿意为这类能力投入预算或试点资源
- **评估（Evaluation）**：用样本、对照和失败案例判断能力是否成立

## 试验展开流程

```
资料准备
  → 能力实验（先用最强模型看天花板）
    → 产品实验（验证交互和流程）
      → 商业实验（验证价值密度和付费意愿）
        → 评估与失败分析
          → 输出实验结论报告
```

## 第一步：资料准备

试验前必须准备：

1. **外部资料**：行业知识、公开规则、产品文档
2. **内部业务资料**：SOP、历史工单、对话记录、专家经验
3. **样本集**：正例、负例、边界案例、长尾问题
4. **评估标准（Rubric）**：什么算对、什么算错、什么算可接受

没有资料准备的实验会漂浮。

## 第二步：能力实验

### 原则：先看能力上限，再压缩成本

1. 先用最强模型（如 GPT-4o/Claude Opus）测试能力天花板
2. 确定能力上限足够高后，再用更便宜模型测试能否保住目标效果
3. 如果最强模型也无法达到可接受水平，应该放弃或重新定义问题

### 能力实验要验证的问题

- AI 到底能做到什么深度
- 哪些场景能够稳定成立
- 哪些场景只能做到辅助，不能做到自动化
- 哪些场景即使技术可行，也没有足够高的价值密度

### 实验产物

- 流程类 demo：任务流程、节点跳转、人工接管点、审批逻辑
- 功能类 demo：问答、分类、归因、生成建议
- 界面类 demo：单页界面、工作台原型、表单交互或 Copilot 面板
- 系统说明文档：边界、模块、接口草稿、评估方式、失败处理

## 第三步：产品实验

验证用户是否愿意以某种交互或流程使用这项能力：

- 用户如何表达目标
- 系统如何展示状态和建议
- 用户如何纠偏或确认
- 任务完成率和满意度

## 第四步：商业实验

验证价值密度：

- 客户是否愿意付费试点
- 续期意愿如何
- 场景扩展可能性
- 与现有解决方案的成本对比

## 第五步：评估与失败分析

### 评估不是看主观感觉

- 用样本、对照和失败案例判断能力是否成立
- 建立评估 Rubric：明确什么算对、什么算错、什么算可接受
- 每次实验都应有可量化的评估结果

### 失败分析是实验最重要的产物

- 哪些场景能稳定成立，哪些不能
- 哪些问题资料还不够
- 哪些能力只适合做建议，哪些已经有机会进入产品化
- 失败案例应该被沉淀为下一轮优化的输入

## 输出物：实验结论报告

1. **能力边界**：哪些场景能稳定成立，哪些不能
2. **产品形态建议**：问答、Copilot、工作流、智能体，哪种更适合
3. **资料缺口**：还需要补充哪些材料才能进入系统构建
4. **风险边界**：哪些动作必须人工接管
5. **进入系统构建的条件**：什么条件满足后可以进入系统构建

## 使用方式

当用户提供 Direction Brief 或问题方向时，自动执行：

1. 检查资料准备是否充分
2. 设计能力实验方案（先强模型看上限）
3. 设计产品实验方案（交互与流程验证）
4. 设计商业实验方案（价值密度验证）
5. 建立评估 Rubric 并执行评估
6. 沉淀失败案例和人工修正
7. 输出实验结论报告

## 示例

### 示例1：AI 客服 Copilot 能力验证

**场景描述**：
基于方向定界输出的 Direction Brief，验证 AI 客服候选回复生成的能力边界。

**用户输入**：
Direction Brief：AI 客服协同系统（已完成方向定界）

**Skill 执行流程**：

1. **资料准备验证**
   - 检查已有：FAQ（500条）、工单样本（1000条）、物流规则
   - 需要补充：50条边界案例（模糊问题、多轮对话、情绪问题）
   - 评估标准：准确性、完整性、风险识别率

2. **能力实验**
   
   | 实验批次 | 模型 | 场景 | 准确率 | 结论 |
   |----------|------|------|--------|------|
   | 第1批 | GPT-4o | 订单查询 | 92% | ✅ 能力强 |
   | 第2批 | GPT-4o | 物流异常解释 | 85% | ✅ 可用 |
   | 第3批 | Claude 3.5 | 售后政策咨询 | 78% | ⚠️ 需资料补充 |
   | 第4批 | GPT-4o-mini | 订单查询 | 88% | ✅ 可压缩成本 |

3. **产品实验（影子验证）**
   - 在真实会话中运行系统，输出候选回复但不发送
   - 对比人工客服实际回复与系统建议
   - 评估：采纳率65%，人工修改率35%
   - 发现问题：多轮上下文丢失、异常情况处理不足

4. **商业实验**
   - 与客服主管访谈：预计节省30%培训时间
   - 测算：首响时间从5分钟→1分钟，但人工审核增加20%
   - 结论：净效益正向，ROI > 200%

5. **失败分析**
   
   | 失败类型 | 数量 | 原因 | 解决方案 |
   |----------|------|------|----------|
   | 上下文丢失 | 12 | 会话状态未保留 | 加入记忆系统 |
   | 敏感承诺 | 5 | 未识别价格承诺 | 增加规则拦截 |
   | 过度承诺 | 8 | 超出政策范围 | 收紧生成边界 |

**输出结果**：

```markdown
# 实验结论报告：AI 客服 Copilot

## 能力边界（已验证）
✅ 订单查询：92%准确率，可用
✅ 物流解释：85%准确率，可用  
⚠️ 售后政策：78%准确率，需补充资料
❌ 投诉处理：不适合AI独立完成

## 产品形态建议
- 类型：Copilot（人工确认模式）
- 界面：侧边栏候选回复 + 风险标记
- 关键交互：一键采纳、快速编辑、风险提示

## 资料缺口
- 需要补充200条售后政策边界案例
- 需要建立敏感承诺规则库
- 需要测试集覆盖更多长尾问题

## 风险边界
- 退款、赔付相关：必须人工确认
- 价格相关：必须引用最新数据源
- 情感升级：自动转人工

## 进入系统构建条件
✅ 能力边界已清晰
✅ 产品形态已验证
⚠️ 需补充售后政策资料（预计1周）
✅ ROI已验证正向
```

---

### 示例2：AIOps 故障分诊能力验证

**场景描述**：
验证 AI 在告警聚类、日志解释、案例召回上的能力边界。

**用户输入**：
Direction Brief：AIOps 故障分诊辅助系统

**Skill 执行流程**：

1. **资料准备**
   - 样本集：50个历史故障（含日志、告警、处理记录）
   - 评估标准：召回率 > 80%，误报率 < 20%

2. **分层能力实验**

   **第一层：日志解释能力**
   - 测试：100条典型日志
   - 结果：GPT-4o 解释准确 88%，Claude 3.5 85%
   - 结论：✅ 能力成立

   **第二层：告警聚类能力**  
   - 测试：10次真实故障的告警流（共300条）
   - 结果：相关告警聚类准确率 82%
   - 失败案例：跨服务依赖关系未识别
   - 结论：⚠️ 基本可用，需改进依赖分析

   **第三层：案例召回能力**
   - 测试：新故障发生时召回历史相似案例
   - 结果：Top3 召回准确率 75%
   - 结论：⚠️ 可用但需优化索引策略

3. **产品实验（影子验证）**
   - 值班工程师处理故障时，系统并行输出分诊建议
   - 对比结果：系统建议 vs 工程师实际判断
   - 评估：采纳率55%，辅助参考率80%
   - 关键发现：系统擅长"看什么"，弱于"怎么做"

4. **商业与风险评估**
   - 价值：平均定位时间从45分钟→25分钟
   - 风险：2次错误归因建议（被工程师识别后忽略）
   - 结论：高风险场景需强化边界控制

5. **失败案例分析**

   | 失败场景 | 原因 | 改进方向 |
   |----------|------|----------|
   | 新型异常未识别 | 超出历史案例库 | 建立未知异常标记机制 |
   | 依赖关系误判 | 缺少服务拓扑数据 | 补充CMDB集成 |
   | 时序相关故障遗漏 | 未关联时间窗口 | 加入时间序列分析 |

**输出结果**：

```markdown
# 实验结论报告：AIOps 故障分诊系统

## 能力边界（验证结果）
✅ 日志解释：88%准确率
⚠️ 告警聚类：82%准确率（依赖分析弱）
⚠️ 案例召回：75%准确率（需优化索引）
❌ 自动修复：明确不做（高风险）

## 产品形态建议
- 主形态：值班面板辅助（非自动执行）
- 输出：故障摘要卡 + 相似案例 + "建议先看"
- 边界：不提供操作建议，只提供信息组织

## 资料缺口
- 需要服务依赖拓扑数据
- 需要更多跨服务故障案例
- 需要建立异常标记与升级规则

## 风险边界（高约束设计）
- AI输出 = 建议，不是命令
- 所有AI建议需人工确认后执行
- 生产操作权限永不开放给AI
- 误判路径100%可追溯

## 进入系统构建条件
✅ 三层能力通过验证
⚠️ 需CMDB数据接入（2周）
✅ 风险边界已明确
✅ 影子验证完成（采纳率55%）
```

---

### 示例3：法律合同审查助手能力验证

**场景描述**：
基于方向定界，验证 AI 在法律合同条款识别和风险提示上的能力边界。

**用户输入**：
Direction Brief：法律合同审查助手（限定为非最终决策，仅辅助）

**Skill 执行流程**：

1. **资料准备**
   - 样本集：100份标准合同（NDA、服务协议、劳动合同）
   - 法律条款库：常见风险条款模板
   - 评估标准：条款识别准确率、风险判断准确率

2. **分层能力实验**

   **第一层：条款识别能力**
   | 合同类型 | 测试数量 | GPT-4o | Claude 3.5 | 结论 |
   |----------|----------|--------|------------|------|
   | NDA保密协议 | 30份 | 90% | 88% | ✅ 可用 |
   | 服务协议 | 40份 | 85% | 82% | ✅ 可用 |
   | 劳动合同 | 30份 | 78% | 75% | ⚠️ 需补充 |

   **第二层：风险提示能力**
   - 测试：识别"不对等条款"（如单方解约权、无限责任）
   - 结果：高风险条款识别率 82%，但部分隐蔽条款漏检
   - 失败案例：隐含在"其他"条款中的风险未能识别

   **第三层：成本压缩测试**
   - GPT-4o-mini：准确率下降 8%，但成本降低 70%
   - 结论：对于初筛场景，可使用低成本模型

3. **产品实验（影子验证）**
   - 法务专员审查合同，AI 并行分析
   - 对比：专员实际标记 vs AI 标记
   - 结果：
     - AI 辅助发现额外风险点数量：平均 1.2 个/份合同
     - 专员对 AI 建议采纳率：45%
     - 审查时间：从 1.5小时 → 45分钟

4. **失败分析**

   | 失败类型 | 比例 | 原因 | 改进措施 |
   |----------|------|------|----------|
   | 隐含条款遗漏 | 15% | 风险不在标准条款中 | 建立隐含风险模式库 |
   | 行业特殊条款 | 12% | 特定行业术语不理解 | 补充行业词典 |
   | 上下文误判 | 8% | 条款组合效应未识别 | 增强上下文分析 |

**输出结果**：

```markdown
# 实验结论报告：法律合同审查助手

## 能力边界
✅ 标准条款识别（NDA、服务协议）：88%+
⚠️ 复杂合同（劳动、股权）：75-78%，需改进
✅ 高风险条款标记：82%
❌ 隐含风险识别：能力不足

## 产品形态建议
- Copilot 模式：并排显示原始合同 + AI 标记
- 人机协作：AI 初筛 → 人工复核
- 输出：checklist + 风险条款高亮 + 修改建议

## 关键发现
- 适合标准合同快速审查
- 复杂交易合同仍需资深律师主导
- AI 发现的问题平均 40% 被专员认可采纳

## 进入系统构建条件
⚠️ 补充200份劳动/股权合同样本
✅ 法务团队认可边界设定
✅ 影子验证通过
```

---

### 示例4：HR 智能简历筛选助手

**场景描述**：
验证 AI 在简历解析、候选人匹配、初筛评估上的能力，需特别注意公平性和偏见问题。

**用户输入**：
Direction Brief：HR 智能简历筛选助手

**Skill 执行流程**：

1. **资料准备**
   - 样本集：1000份历史简历（已脱敏去除姓名、性别、年龄）
   - 岗位要求：5个标准岗位（Java开发、产品经理、销售等）
   - 评估标准：匹配准确率、偏见检测

2. **能力实验**

   **技能点1：简历信息提取**
   - 测试：从PDF/Word中提取结构化信息
   - 结果：
     - 教育背景：94% 准确率
     - 工作经历：87% 准确率（部分非标准格式简历困难）
     - 技能标签：79% 准确率（技能同义词识别不足）

   **技能点2：岗位匹配评分**
   - 测试：根据JD要求给候选人打分
   - 结果：
     - Top10 推荐命中率：68%
     - 与 HR 专员评分相关性：0.72（中等相关）

   **技能点3：偏见检测**
   - 测试：匿名化简历 vs 完整简历的评分差异
   - 关键发现：
     - 去除性别信息后，技术岗男女得分无显著差异 ✅
     - 但某些管理岗仍略有偏差 ⚠️（需持续监控）

3. **产品实验**
   - 在真实招聘流程中并行运行
   - HR 先按原流程筛选，再看 AI 建议
   - 结果：
     - AI 发现"遗漏候选人"比例：12%
     - 这些被遗漏候选人中，最终面试通过率：35%
     - 说明 AI 发现了一些人类筛选中的盲点

4. **公平性评估**

   | 维度 | 测试结果 | 风险等级 |
   |------|----------|----------|
   | 性别偏见 | 无显著差异 | 🟢 低风险 |
   | 学历偏好 | 存在过度偏好985/211 | 🟡 中风险 |
   | 年龄相关 | 无明显年龄歧视 | 🟢 低风险 |
   | 地域相关 | 部分地域词汇偏见 | 🟡 中风险 |

**输出结果**：

```markdown
# 实验结论报告：HR 智能简历筛选助手

## 能力边界
✅ 简历信息提取：教育94%、经历87%
⚠️ 岗位匹配：Top10命中率68%，有提升空间
⚠️ 公平性：整体可控，但需监控学历/地域偏见

## 重要发现：AI 发现人类盲点
- AI 识别出 HR 遗漏的合格候选人 12%
- 这些候选人面试通过率 35%
- AI 在"非标准背景但有潜力"的识别上有优势

## 产品形态建议
- 初筛助手：辅助而非替代 HR 筛选
- 盲筛模式：默认隐藏可能导致偏见的信息
- 透明度：显示匹配依据（哪些JD要求被满足）
- 反馈闭环：HR 驳回时标记原因，优化模型

## 公平性保障措施
- 定期偏见审计（A/B 测试）
- 多样性指标监控
- 申诉机制：候选人可请求人工复核

## 进入系统构建条件
⚠️ 建立偏见监控 dashboard
✅ HR 团队培训完成（理解 AI 辅助边界）
✅ 法务确认合规性
```

---

### 示例5：内容创作智能助手（营销文案）

**场景描述**：
验证 AI 在营销文案创作上的能力，包括多风格适应、品牌一致性、合规风险检测。

**用户输入**：
Direction Brief：营销文案智能创作助手

**Skill 执行流程**：

1. **资料准备**
   - 品牌资料：品牌调性指南、过往优质文案100篇
   - 产品信息：功能清单、卖点、目标用户画像
   - 合规资料：广告法禁用词、行业敏感词库

2. **多维度能力实验**

   **维度1：创作质量**
   | 场景 | 人工评分 | 采纳率 |
   |------|----------|--------|
   | 社交媒体短文案（微博/小红书） | 4.2/5 | 68% |
   | 电商详情页长文案 | 3.8/5 | 52% |
   | 邮件营销标题 | 4.0/5 | 60% |
   | 视频脚本 | 3.5/5 | 42% |

   **维度2：品牌一致性**
   - 测试：给定品牌调性，生成文案
   - 评估：品牌团队判断是否符合调性
   - 结果：符合率 73%，主要偏差在情感强度控制

   **维度3：合规风险**
   - 测试：100篇 AI 生成文案的合规检测
   - 结果：
     - 检出禁用词：准确率 95%
     - 夸大宣传：检出率 60%（部分较为隐蔽）
     - 竞品对比：合规性 100%（无不当对比）

3. **风格适应实验**
   - 同一产品，生成不同风格文案
   - 结果：风格区分度明显，但在"高级 but 接地气"的平衡上仍有困难

4. **A/B 测试（影子验证）**
   - 选择 20% 流量，对比 AI 文案 vs 人工文案
   - 结果：
     - 点击率：AI 文案 3.2% vs 人工 3.5%（略低）
     - 转化率：AI 文案 1.8% vs 人工 2.1%（略低）
     - 但生成速度：AI 平均 2分钟 vs 人工平均 2小时

5. **失败分析**

   | 问题类型 | 描述 | 改进方向 |
   |----------|------|----------|
   | 同质化 | 多个产品文案风格过于相似 | 增强产品差异化输入 |
   | 情感过度 | 有时过于夸张 | 细化情感强度控制 |
   | 长尾场景 | 小众产品理解不足 | 补充小众样本 |

**输出结果**：

```markdown
# 实验结论报告：内容创作智能助手

## 能力边界
✅ 短文案创作：质量4.2/5，可用
⚠️ 长文案详情页：质量3.8/5，需改进
⚠️ 品牌一致性：73%，需调优
✅ 合规检测：禁用词检出率95%

## 关键发现
- 效率优势：2分钟 vs 2小时（60倍提升）
- 质量差距：点击率和转化率略低（-10%）
- 适用场景：更适合批量、快速、标准化文案
- 不适合：品牌大推、需要深度创意的campaign

## 产品形态建议
- 初稿生成：AI 快速产出多版本草稿
- 人工精修：创作者在 AI 基础上优化
- 合规预检：发布前自动检测风险
- 风格模板：提供多风格快速切换

## 商业模式
- 内部赋能：提升创作团队效率
- 外部售卖：小型商家自助生成基础文案

## 进入系统构建条件
✅ 品牌团队认可质量标准
⚠️ 建立质量反馈闭环机制
✅ 法务确认合规流程
```

