Devlab Eval Driven Agent

eval 自评测体系驱动的 AI Agent 生产体系方法论。以评测集为核心资产,建立"评测集组织 + Mock 隔离 + 标准化比对 + 自动评测脚本 + 回归门禁"闭环;L0-L4 分层评测(确定性单测/轨迹评测/输出评测/生产回归/安全成本护栏),L1 golden session 轨迹断言,L2/L3 数据后端接 Langfuse(dataset/scores/LLM-as-judge),配套 evalctl CLI(0.3.x)。Triggers on "评测集", "eval", "回归测试", "准确率怎么保证", "测试数据集", "AI 质量护栏", "eval-driven", "LLM-as-judge", "langfuse 评测", "scores", "质量评分", "轨迹评测", "golden session", "agent 测试", "工具调用序列".

seed-forge a577683 4 files · 23.7 KB Updated

File contents

seed-forge/harness-ai-kit/tree/main/skills/devlab-eval-driven-agent commit a577683e6e

Frequently asked questions

npx skillmds@latest add seed-forge/devlab-eval-driven-agent