Contract
- Input: dataset description, problem type, performance target.
- Output: pipeline architecture + training report + deployment checklist.
- Side effects: may create artifacts (models, logs) when executed.
- Dependencies: external ML framework (scikit-learn, PyTorch, TensorFlow, XGBoost) and data source.
- Stop condition: pipeline documented; model validated; checklist filled.
- Risk: medium — model decisions affect users; requires validation.
- Boundary: designs pipeline; does not train production models unless explicitly executed.
ML Pipeline Design
Build a machine-learning pipeline from data to deployed model with reproducibility and fairness checks.
Process
1. Frame the problem
State: supervised / unsupervised / reinforcement; classification / regression / clustering; time-series / tabular / image / text / tabular-time-series.
Completion criterion: problem type named; target metric defined.
2. Data design
- Source (database, API, file store, synthetic).
- Schema (features, target, weights, time stamps).
- Preprocessing (imputation, encoding, scaling, feature engineering, augmentation).
- Train / validation / test split; stratification if needed.
Completion criterion: data schema and split strategy documented.
3. Model selection
- Baseline (simple: logistic regression, linear, random forest, XGBoost).
- Advanced (deep learning, transformers, ensembles).
- Selection criteria: interpretability vs performance vs resource cost.
Completion criterion: model family selected with justification.
4. Training design
- Loss function; optimiser; learning rate schedule.
- Cross-validation strategy (k-fold, time-series split, stratified).
- Regularisation (L2, dropout, early stopping, data augmentation).
- Reproducibility: seed, versioned library, container.
Completion criterion: training plan documented with seeds and versions.
5. Evaluation
- Metrics aligned with business goal (accuracy / F1 / ROC-AUC / MAE / RMSE / log-loss / lift / ranking metrics).
- Validation vs test distinction; no lookahead.
- Error analysis (confusion matrix, worst-case examples, subgroup differences / fairness audit).
Completion criterion: evaluation report with subgroup fairness check.
6. Deployment and monitoring
- Model registry (MLflow, DVC, Weights & Biases).
- Container (Docker / Kubernetes) with pinned versions.
- Monitoring: drift (data / concept / performance), latency, error rate.
- Rollback plan.
Completion criterion: deployment checklist complete; monitoring rules defined.
1---2name: ai-ml-pipeline3description: Design ML pipelines — data ingestion, preprocessing, training, evaluation, deployment, monitoring — with reproducibility, fairness, and version control.4---56## Contract78- **Input:** dataset description, problem type, performance target.9- **Output:** pipeline architecture + training report + deployment checklist.10- **Side effects:** may create artifacts (models, logs) when executed.11- **Dependencies:** external ML framework (scikit-learn, PyTorch, TensorFlow, XGBoost) and data source.12- **Stop condition:** pipeline documented; model validated; checklist filled.13- **Risk:** medium — model decisions affect users; requires validation.14- **Boundary:** designs pipeline; does not train production models unless explicitly executed.1516# ML Pipeline Design1718Build a **machine-learning pipeline** from data to deployed model with reproducibility and fairness checks.1920## Process2122### 1. Frame the problem23State: supervised / unsupervised / reinforcement; classification / regression / clustering; time-series / tabular / image / text / tabular-time-series.2425**Completion criterion:** problem type named; target metric defined.2627### 2. Data design28- Source (database, API, file store, synthetic).29- Schema (features, target, weights, time stamps).30- Preprocessing (imputation, encoding, scaling, feature engineering, augmentation).31- Train / validation / test split; stratification if needed.3233**Completion criterion:** data schema and split strategy documented.3435### 3. Model selection36- Baseline (simple: logistic regression, linear, random forest, XGBoost).37- Advanced (deep learning, transformers, ensembles).38- Selection criteria: interpretability vs performance vs resource cost.3940**Completion criterion:** model family selected with justification.4142### 4. Training design43- Loss function; optimiser; learning rate schedule.44- Cross-validation strategy (k-fold, time-series split, stratified).45- Regularisation (L2, dropout, early stopping, data augmentation).46- Reproducibility: seed, versioned library, container.4748**Completion criterion:** training plan documented with seeds and versions.4950### 5. Evaluation51- Metrics aligned with business goal (accuracy / F1 / ROC-AUC / MAE / RMSE / log-loss / lift / ranking metrics).52- Validation vs test distinction; no lookahead.53- Error analysis (confusion matrix, worst-case examples, subgroup differences / fairness audit).5455**Completion criterion:** evaluation report with subgroup fairness check.5657### 6. Deployment and monitoring58- Model registry (MLflow, DVC, Weights & Biases).59- Container (Docker / Kubernetes) with pinned versions.60- Monitoring: drift (data / concept / performance), latency, error rate.61- Rollback plan.6263**Completion criterion:** deployment checklist complete; monitoring rules defined.