Agent Quality Evaluation

智能体做出来之后,怎么证明它够好、改动之后有没有退步——建黄金测试集 + pytest + 基线报告的方法论。 适用场景:AI 智能体已经能跑了,需要建立可重复、可自动化的验收标准;或者改了 prompt/守卫后想知道有没有改坏。 触发关键词:质量评估、黄金测试集、评测集、基线报告、pass率、SMART标准、防退步、回归测试、这个智能体好不好。 不适用:项目还没开工、判断值不值得做(那是 data-readiness-assessment 技能管的前置阶段)。

oopsoops618 a1a6cca 4 files · 11.5 KB Updated

File contents

oopsoops618/sage-agent-eval/tree/main/skills/agent-quality-evaluation commit a1a6ccad1d

Frequently asked questions

npx skillmds@latest add oopsoops618/agent-quality-evaluation