Evals

Objective eval metrics via code/model/human graders with pass@k/pass^k scoring. USE WHEN eval, evaluate, test agent, benchmark, verify behavior, regression test, capability test, run eval, compare models, compare prompts, create judge, create use case, view results, failure to task, suite manager, transcript capture, trial runner, skillgrade, skill eval, skill test, docker eval, external eval.

mj-deving b2bb2e9 53 files · 215.5 KB Updated

File contents

mj-deving/pai-skills/tree/main/skills/Utilities/Evals commit b2bb2e9202

Frequently asked questions

npx skillmds@latest add mj-deving/evals