Contract
- Input: model predictions, ground truth, subgroup labels, feature data.
- Output: evaluation report with recommendation.
- Side effects: none (analysis only; does not deploy).
- Dependencies: model artifacts, test set, subgroup metadata.
- Stop condition: report complete with subgroup analysis.
- Risk: medium — recommendations affect deployment; requires validation.
- Boundary: evaluates; does not deploy.
Model Evaluation
Evaluate a machine-learning or LLM model with metrics, subgroup fairness, robustness, and explainability — and recommend deployment or revision.
Process
1. Define metrics
Select metrics aligned with the problem:
- Classification: accuracy, precision, recall, F1, ROC-AUC, PR-AUC, log-loss, Cohen's kappa.
- Regression: MAE, RMSE, MAPE, R², explained variance.
- Ranking / recommendation: NDCG, MAP, hit-rate, lift.
- LLM: BLEU, ROUGE, BERTScore (not just human preference).
Completion criterion: metrics named; justification stated.
2. Subgroup / fairness analysis
Split predictions by subgroup: gender, age, race, region, income, language.
Compute:
- Demographic parity (P(pred=1 | group))
- Equalised odds (TPR/FPR equality)
- Calibration (predicted probability matches observed rate)
- Performance gap (F1 difference between groups)
Report the largest gap and whether it exceeds an acceptable threshold.
Completion criterion: subgroup tables saved; largest gap reported.
3. Robustness
Test under perturbation:
- Adversarial examples (FGSM, PGD for images; word substitution for text).
- Noise (Gaussian, dropout, label noise).
- Distribution shift (test on a different domain / time period).
Completion criterion: robustness results with failure examples.
4. Explainability
- Feature importance (SHAP, permutation, mutual information).
- Counterfactual: what minimal change flips the prediction?
- Attention maps / saliency (for vision / NLP).
Completion criterion: explanation method applied to worst-case examples.
5. Failure-mode analysis
From confusion matrix or error set:
- Which cases are wrong? (false positives, false negatives, outliers)
- Is the error systematic (bias) or random?
- What does the failure reveal about model limits?
Completion criterion: failure-mode section with examples.
6. Recommendation
- Deploy if: metrics exceed thresholds; fairness gaps below threshold; robustness acceptable; failure modes understood and mitigated.
- Revise if: weak on one dimension but fixable.
- Do not deploy if: large fairness gap; brittle to shift; failure modes dangerous.
Completion criterion: recommendation with explicit conditions.
1---2name: ai-model-evaluation3description: Evaluate ML / LLM models — accuracy, fairness, robustness, explainability, drift — with explicit metrics, subgroup analysis, and failure-mode reporting.4---56## Contract78- **Input:** model predictions, ground truth, subgroup labels, feature data.9- **Output:** evaluation report with recommendation.10- **Side effects:** none (analysis only; does not deploy).11- **Dependencies:** model artifacts, test set, subgroup metadata.12- **Stop condition:** report complete with subgroup analysis.13- **Risk:** medium — recommendations affect deployment; requires validation.14- **Boundary:** evaluates; does not deploy.1516# Model Evaluation1718Evaluate a **machine-learning or LLM model** with metrics, subgroup fairness, robustness, and explainability — and recommend deployment or revision.1920## Process2122### 1. Define metrics23Select metrics aligned with the problem:24- Classification: accuracy, precision, recall, F1, ROC-AUC, PR-AUC, log-loss, Cohen's kappa.25- Regression: MAE, RMSE, MAPE, R², explained variance.26- Ranking / recommendation: NDCG, MAP, hit-rate, lift.27- LLM: BLEU, ROUGE, BERTScore (not just human preference).2829**Completion criterion:** metrics named; justification stated.3031### 2. Subgroup / fairness analysis32Split predictions by subgroup: gender, age, race, region, income, language.33Compute:34- Demographic parity (P(pred=1 | group))35- Equalised odds (TPR/FPR equality)36- Calibration (predicted probability matches observed rate)37- Performance gap (F1 difference between groups)3839Report the largest gap and whether it exceeds an acceptable threshold.4041**Completion criterion:** subgroup tables saved; largest gap reported.4243### 3. Robustness44Test under perturbation:45- Adversarial examples (FGSM, PGD for images; word substitution for text).46- Noise (Gaussian, dropout, label noise).47- Distribution shift (test on a different domain / time period).4849**Completion criterion:** robustness results with failure examples.5051### 4. Explainability52- Feature importance (SHAP, permutation, mutual information).53- Counterfactual: what minimal change flips the prediction?54- Attention maps / saliency (for vision / NLP).5556**Completion criterion:** explanation method applied to worst-case examples.5758### 5. Failure-mode analysis59From confusion matrix or error set:60- Which cases are wrong? (false positives, false negatives, outliers)61- Is the error systematic (bias) or random?62- What does the failure reveal about model limits?6364**Completion criterion:** failure-mode section with examples.6566### 6. Recommendation67- Deploy if: metrics exceed thresholds; fairness gaps below threshold; robustness acceptable; failure modes understood and mitigated.68- Revise if: weak on one dimension but fixable.69- Do not deploy if: large fairness gap; brittle to shift; failure modes dangerous.7071**Completion criterion:** recommendation with explicit conditions.