oopsoops618
- 2 skills
- 0 followers
- 12 hours ago last updated
- ▌ Agent Quality Evaluation · oopsoops618 bundle智能体做出来之后,怎么证明它够好、改动之后有没有退步——建黄金测试集 + pytest + 基线报告的方法论。 适用场景:AI 智能体已经能跑了,需要建立可重复、可自动化的验收标准;或者改了 prompt/守卫后想知道有没有改坏。 触发关键词:质量评估、黄金测试集、评测集、基线报告、pass率、SMART标准、防退步、回归测试、这个智能体好不好。 不适用:项目还没开工、判断值不值得做(那是 data-readiness-assessment 技能管的前置阶段)。
- ▌ Data Readiness Assessment · oopsoops618 bundle进入一个陌生领域、准备造一个 AI 智能体之前,先评估"这事值不值得做、数据够不够"的前置方法论(八步流程)。 适用场景:接到一个新的智能体项目需求,第一件事不是写代码,是判断目标能力清单是否清楚、数据从哪来、能不能判对错、缺口怎么补。 触发关键词:数据评估、数据就绪度、前置评估、这个项目能不能做、数据够不够、目标能力清单、进入陌生领域做AI。 不适用:模型已经做出来了、要测试效果好不好(那是 agent-quality-evaluation 技能管的后置阶段)。