Agent Evals And Observability

Design, run, review, or release framework- and vendor-neutral evaluations and observability for AI agents. Use when defining agent evals, datasets, graders, trajectory review, regression analysis, release gates, production traces, or privacy-aware telemetry. Covers task and trajectory contracts, statistical comparisons, and incident-to-case learning; route framework implementation to pydanticai or langgraph when needed. Do not use this skill for unrelated requests; route to the nearest named specialist.

magnus919 Updated

File contents

magnus919/agent-skills/tree/main/agent-evals-and-observability commit ed3ba241a6

Frequently asked questions

npx skillmds@latest add magnus919/agent-evals-and-observability