Eval

Evaluate and rank agent results by metric or LLM judge for an AgentHub session.

DylanCkawalec Updated 3 repo stars

File contents

DylanCkawalec/Mermate/tree/main/nemoclaw/.agents/skills/engineering-advanced-skills/agenthub/skills/eval commit f1dc8c0239

Frequently asked questions

npx skillmds@latest add dylanckawalec/eval