Agent LLM Evals

Design, debug, or review LLM and agent evaluations: task datasets, tool/state grading, calibrated judges, traces, candidate selection, repeated trials, and release gates. Use when evaluating model, prompt, tool, or workflow changes; domain owners define the behavior being measured.

BejeweledMe Updated

File contents

BejeweledMe/codex-pro-agent-skills/tree/main/skills/agent-llm-evals commit 35940d4388

Frequently asked questions

npx skillmds@latest add bejeweledme/agent-llm-evals