Nw Agent Evals

Lightweight eval method for testing nWave AGENTS and SKILLS (LLM behavior) as a lean alternative to heavy BDD/ATD. An eval = one prompt -> one captured run (trace + artifacts) -> a small set of checks -> a comparable score over time. Load when validating agent behavior, building a regression net for an agent/skill, or reducing agent-test bloat.

nWave-ai Updated

File contents

nwave-ai/nwave-experimental/tree/main/nWave/skills/nw-agent-evals commit 7b1255424f

Frequently asked questions

npx skillmds@latest add nwave-ai/nw-agent-evals