Evaluation Metric Design

Evaluation Metric Design

wanghaisheng Updated

File contents

Evaluation Metric Design

概述

评估指标设计技能专注于设计平衡、合理的评估指标体系,用于衡量(角色, 演员)组合的综合表现。

核心概念

评估指标

用于衡量(角色, 演员)组合表现的量化标准,包括质量、成本、延迟、成功率等维度。

指标设计原则

  • 平衡性:各指标权重应该平衡,避免单一指标主导
  • 可量化:指标应该可以量化测量
  • 可解释:指标含义应该清晰可解释
  • 可操作:指标应该能够指导改进

核心指标

质量指标

  • 输出质量:0-10分,基于输出质量评分
  • 功能完整性:0-1,基于功能测试通过率
  • 代码质量:0-1,基于代码规范检查

成本指标

  • Token消耗:任务消耗的token数量
  • API费用:任务产生的API费用
  • 成本效率:基准成本 / 实际成本

延迟指标

  • 响应时间:任务完成时间
  • 首字延迟:首次输出时间
  • 延迟效率:基准延迟 / 实际延迟

成功率指标

  • 任务成功率:成功任务 / 总任务
  • Schema通过率:Schema校验通过率
  • 测试通过率:单元测试通过率

权重设计

权重分配

metric_weights:
  quality: 0.4
  cost: 0.2
  latency: 0.2
  success_rate: 0.2

权重调整

  • 根据任务类型调整权重
  • 根据用户偏好调整权重
  • 根据业务需求调整权重

指标计算

综合评分

综合评分 = Σ(指标得分 × 权重)

归一化

不同指标有不同的单位和范围,需要归一化到统一范围(0-1)。

最佳实践

  • 指标应该定期审查和调整
  • 权重应该透明可配置
  • 指标数据应该可追溯
  • 指标变化应该有告警机制

常见错误

  • 权重设置不合理,导致评分偏差
  • 指标不可量化,难以测量
  • 指标含义模糊,难以解释
  • 指标过于复杂,难以维护

wanghaisheng/openaiworkhorse-design-team/tree/main/.claude/skills/designer-role/skills/evaluation-metric-design commit 5797480b23

Frequently asked questions

npx skillmds@latest add wanghaisheng/evaluation-metric-design