# Evaluation Metric Design

> Evaluation Metric Design

- Skill: `wanghaisheng/evaluation-metric-design` (Agent Skill)
- Install (CLI): `npx skillmds@latest add wanghaisheng/evaluation-metric-design`
- Raw SKILL.md: https://api.skillmd.com/api/skills/wanghaisheng/evaluation-metric-design/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: wanghaisheng (https://skillmd.com/u/wanghaisheng)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/wanghaisheng/evaluation-metric-design

---

# Evaluation Metric Design

## 概述
评估指标设计技能专注于设计平衡、合理的评估指标体系，用于衡量（角色, 演员）组合的综合表现。

## 核心概念

### 评估指标
用于衡量（角色, 演员）组合表现的量化标准，包括质量、成本、延迟、成功率等维度。

### 指标设计原则
- **平衡性**：各指标权重应该平衡，避免单一指标主导
- **可量化**：指标应该可以量化测量
- **可解释**：指标含义应该清晰可解释
- **可操作**：指标应该能够指导改进

## 核心指标

### 质量指标
- **输出质量**：0-10分，基于输出质量评分
- **功能完整性**：0-1，基于功能测试通过率
- **代码质量**：0-1，基于代码规范检查

### 成本指标
- **Token消耗**：任务消耗的token数量
- **API费用**：任务产生的API费用
- **成本效率**：基准成本 / 实际成本

### 延迟指标
- **响应时间**：任务完成时间
- **首字延迟**：首次输出时间
- **延迟效率**：基准延迟 / 实际延迟

### 成功率指标
- **任务成功率**：成功任务 / 总任务
- **Schema通过率**：Schema校验通过率
- **测试通过率**：单元测试通过率

## 权重设计

### 权重分配
```yaml
metric_weights:
  quality: 0.4
  cost: 0.2
  latency: 0.2
  success_rate: 0.2
```

### 权重调整
- 根据任务类型调整权重
- 根据用户偏好调整权重
- 根据业务需求调整权重

## 指标计算

### 综合评分
综合评分 = Σ(指标得分 × 权重)

### 归一化
不同指标有不同的单位和范围，需要归一化到统一范围（0-1）。

## 最佳实践

- 指标应该定期审查和调整
- 权重应该透明可配置
- 指标数据应该可追溯
- 指标变化应该有告警机制

## 常见错误

- 权重设置不合理，导致评分偏差
- 指标不可量化，难以测量
- 指标含义模糊，难以解释
- 指标过于复杂，难以维护

