Eval Engineering

Inspect an agent repository and optional traces, interview the user, write reviewed Task Specs, build and audit Harbor tasks, and bootstrap reusable project World Knowledge Skills. Use for agent evals, benchmark design, Task generation, controlled Environments, synthetic data, Verifiers, Harbor runs, calibration, or continuous benchmark maintenance.

langchain-ai Updated

File contents

langchain-ai/langchain-skills/tree/main/config/skills/eval-engineering commit c62557a725

Frequently asked questions

npx skillmds@latest add langchain-ai-langchain-skills/eval-engineering