Eval Engineering

Iteratively inspect an agent repository and optional user-provided traces, interview the user, and create, run, and audit Harbor evals one at a time. Use for agent evals, Harbor tasks, benchmark cases, verifier design, or controlled agent environments.

nik-ti Updated

File contents

nik-ti/agent-skills/tree/main/skills/langchain-skills/eval-engineering commit 88e1914111

Frequently asked questions

npx skillmds@latest add nik-ti/eval-engineering