Evaluators

Author or refine a Phoenix evaluator — code or LLM-as-a-judge — that scores a run's output. Trigger when the user wants to create a new evaluator, improve an existing one's logic or rubric, choose labels, or decide what to measure on a dataset or experiment. Do NOT trigger on: (1) manual prompt drafting (use `playground`), (2) running or comparing experiments themselves (use `experiments`), (3) cross-trace failure diagnosis with no evaluator in scope (use `debug-trace`).

arize-ai 2edf87e 6.7 KB Updated

File contents

arize-ai/phoenix/tree/main/src/phoenix/server/agents/prompts/skills/evaluators commit 2edf87e7d7

Frequently asked questions

npx skillmds@latest add arize-ai-phoenix/evaluators