Data Science Engineering Suite – Quick Reference
This skill turns raw data and questions into validated, documented models ready for production:
- EDA workflows: Structured exploration with drift detection
- Feature engineering: Reproducible feature pipelines with leakage prevention and train/serve parity
- Model selection: Baselines first; strong tabular defaults; escalate complexity only when justified
- Evaluation & reporting: Slice analysis, uncertainty, model cards, production metrics
- SQL transformation: SQLMesh for staging/intermediate/marts layers
- MLOps: CI/CD, CT (continuous training), CM (continuous monitoring)
- Production patterns: Data contracts, lineage, feedback loops, streaming features
Modern emphasis (December 2025): Feature stores, automated retraining, drift monitoring, and train-serve parity. Tools: LightGBM 4.6, scikit-learn 1.7, PyTorch 2.9.1, Polars 1.x.
Quick Reference
| Task |
Tool/Framework |
Command |
When to Use |
| EDA & Profiling |
Pandas, Great Expectations |
df.describe(), ge.validate() |
Initial data exploration and quality checks |
| Feature Engineering |
Pandas, Polars, Feature Stores |
df.transform(), Feast materialization |
Creating lag, rolling, categorical features |
| Model Training |
Gradient boosting, linear models, scikit-learn |
lgb.train(), model.fit() |
Strong baselines for tabular ML |
| Hyperparameter Tuning |
Optuna, Ray Tune |
optuna.create_study(), tune.run() |
Optimizing model parameters |
| SQL Transformation |
SQLMesh |
sqlmesh plan, sqlmesh run |
Building staging/intermediate/marts layers |
| Experiment Tracking |
MLflow, W&B |
mlflow.log_metric(), wandb.log() |
Versioning experiments and models |
| Model Evaluation |
scikit-learn, custom metrics |
metrics.roc_auc_score(), slice analysis |
Validating model performance |
When to Use This Skill
Claude should invoke this skill when the user asks for hands-on DS/ML workflow help, e.g.:
- "Help me explore this dataset / find issues."
- "Design features for this problem."
- "Choose metrics and evaluate this model."
- "Write a model evaluation report or model card."
- "Structure an end-to-end DS project."
- "Set up SQL transformations with SQLMesh."
- "Build incremental feature pipelines in SQL."
- "Create staging/intermediate/marts layers."
- "Set up MLOps: CI/CD, continuous training, monitoring."
Data Lake & Lakehouse
For comprehensive data lake/lakehouse patterns (beyond SQLMesh transformation), see data-lake-platform:
- Table formats: Apache Iceberg, Delta Lake, Apache Hudi
- Query engines: ClickHouse, DuckDB, Apache Doris, StarRocks
- Alternative transformation: dbt (alternative to SQLMesh)
- Ingestion: dlt, Airbyte (connectors)
- Streaming: Apache Kafka patterns
- Orchestration: Dagster, Airflow
This skill focuses on ML feature engineering and modeling. Use data-lake-platform for general-purpose data infrastructure.
Related Skills
For adjacent topics, reference:
- ai-mlops - APIs, batch jobs, monitoring, drift, data ingestion (dlt)
- ai-llm - LLM prompting, fine-tuning, evaluation
- ai-rag - RAG pipelines, chunking, retrieval
- ai-llm-inference - LLM inference optimization, quantization
- ai-ml-timeseries - Time series forecasting, backtesting
- qa-testing-strategy - Test-driven development, coverage
- data-sql-optimization - SQL optimization, index patterns (complements SQLMesh)
- data-lake-platform - Data lake/lakehouse infrastructure (ClickHouse, Iceberg, Kafka)
Decision Tree: Choosing Data Science Approach
User needs ML for: [Problem Type]
├─ Tabular Data?
│ ├─ Small-Medium (<1M rows)? → **LightGBM** (fast, efficient)
│ ├─ Large & Complex (>1M rows)? → **LightGBM** first, then NN if needed
│ └─ High-dim sparse (text, counts)? → Linear models, then shallow NN
│
├─ Time Series?
│ ├─ Seasonality? → LightGBM, then see ai-ml-timeseries skill
│ └─ Long-term dependencies? → Transformers (ai-ml-timeseries)
│
├─ Text or Mixed Modalities?
│ └─ LLMs/Transformers → See ai-llm
│
└─ SQL Transformations?
└─ SQLMesh (staging/intermediate/marts layers)
Rule of thumb: For tabular data, tree-based gradient boosting is a strong baseline, but must be validated against alternatives and constraints.
Core Concepts (Vendor-Agnostic)
- Problem framing: define success metrics, baselines, and decision thresholds before modeling.
- Leakage prevention: ensure all features are available at prediction time; split by time/group when appropriate.
- Uncertainty: report confidence intervals and stability (fold variance, bootstrap) rather than single-point metrics.
- Reproducibility: version code/data/features, fix seeds, and record the environment.
- Operational handoff: define monitoring, retraining triggers, and rollback criteria with MLOps.
Implementation Practices (Tooling Examples)
- Track experiments and artifacts (run id, commit hash, data version).
- Add data validation gates in pipelines (schema + distribution + freshness).
- Prefer reproducible, testable feature code (shared transforms, point-in-time correctness).
- Use datasheets/model cards and eval reports as deployment prerequisites (Datasheets for Datasets: https://arxiv.org/abs/1803.09010; Model Cards: https://arxiv.org/abs/1810.03993).
Do / Avoid
Do
- Do start with baselines and a simple model to expose leakage and data issues early.
- Do run slice analysis and document failure modes before recommending deployment.
- Do keep an immutable eval set; refresh training data without contaminating evaluation.
Avoid
- Avoid random splits for temporal or user-correlated data.
- Avoid “metric gaming” (optimizing the number without validating business impact).
- Avoid training on labels created after the prediction timestamp (silent future leakage).
Core Patterns (Overview)
Pattern 1: End-to-End DS Project Lifecycle
Use when: Starting or restructuring any DS/ML project.
Stages:
- Problem framing - Business objective, success metrics, baseline
- Data & feasibility - Sources, coverage, granularity, label quality
- EDA & data quality - Schema, missingness, outliers, leakage checks
- Feature engineering - Per data type with feature store integration
- Modelling - Baselines first, then LightGBM, then complexity as needed
- Evaluation - Offline metrics, slice analysis, error analysis
- Reporting - Model evaluation report + model card
- MLOps - CI/CD, CT (continuous training), CM (continuous monitoring)
Detailed guide: EDA Best Practices
Pattern 2: Feature Engineering
Use when: Designing features before modelling or during model improvement.
By data type:
- Numeric: Standardize, handle outliers, transform skew, scale
- Categorical: One-hot/ordinal (low cardinality), target/frequency/hashing (high cardinality)
- Feature Store Integration: Store encoders, mappings, statistics centrally
- Text: Cleaning, TF-IDF, embeddings, simple stats
- Time: Calendar features, recency, rolling/lag features
Key Modern Practice: Use feature stores (Feast, Tecton, Databricks) for versioning, sharing, and train-serve parity.
Detailed guide: Feature Engineering Patterns
Pattern 3: Data Contracts & Lineage
Use when: Building production ML systems with data quality requirements.
Components:
- Contracts: Schema + ranges/nullability + freshness SLAs
- Lineage: Track source → feature store → train → serve
- Feature store hygiene: Materialization cadence, backfill/replay, encoder versioning
- Schema evolution: Backward/forward-compatible migrations with shadow runs
Detailed guide: Data Contracts & Lineage
Pattern 4: Model Selection & Training
Use when: Picking model families and starting experiments.
Decision guide (modern benchmarks):
- Tabular: Start with a strong baseline (linear/logistic, then gradient boosting) and iterate based on error analysis
- Baselines: Always implement simple baselines first (majority class, mean, naive forecast)
- Train/val/test splits: Time-based (forecasting), group-based (user/item leakage), or random (IID)
- Hyperparameter tuning: Start manual, then Bayesian optimization (Optuna, Ray Tune)
- Overfitting control: Regularization, early stopping, cross-validation
Detailed guide: Modelling Patterns
Pattern 5: Evaluation & Reporting
Use when: Finalizing a model candidate or handing over to production.
Key components:
- Metric selection: Primary (ROC-AUC, PR-AUC, RMSE) + guardrails (calibration, fairness)
- Threshold selection: ROC/PR curves, cost-sensitive, F1 maximization
- Slice analysis: Performance by geography, user segments, product categories
- Error analysis: Collect high-error examples, cluster by error type, identify systematic failures
- Uncertainty: Confidence intervals (bootstrap where appropriate), variance across folds, and stability checks
- Evaluation report: 8-section report (objective, data, features, models, metrics, slices, risks, recommendation)
- Model card: Documentation for stakeholders (intended use, data, performance, ethics, operations)
Detailed guide: Evaluation Patterns
Pattern 6: Reproducibility & MLOps
Use when: Ensuring experiments are reproducible and production-ready.
Modern MLOps (CI/CD/CT/CM):
- CI (Continuous Integration): Automated testing, data validation, code quality
- CD (Continuous Delivery): Environment-specific promotion (dev → staging → prod), canary deployment
- CT (Continuous Training): Drift-triggered and scheduled retraining
- CM (Continuous Monitoring): Real-time data drift, performance, system health
Versioning:
- Code (git commit), data (DVC, LakeFS), features (feature store), models (MLflow Registry)
- Seeds (reproducibility), hyperparameters (experiment tracker)
Detailed guide: Reproducibility Checklist
Pattern 7: Feature Freshness & Streaming
Use when: Managing real-time features and streaming pipelines.
Components:
- Freshness contracts: Define freshness SLAs per feature, monitor lag, alert on breaches
- Batch + stream parity: Same feature logic across batch/stream, idempotent upserts
- Schema evolution: Version schemas, add forward/backward-compatible parsers, backfill with rollback
- Data quality gates: PII/format checks, range checks, distribution drift (KL, KS, PSI)
Detailed guide: Feature Freshness & Streaming
Pattern 8: Production Feedback Loops
Use when: Capturing production signals and implementing continuous improvement.
Components:
- Signal capture: Log predictions + user edits/acceptance/abandonment (scrub PII)
- Labeling: Route failures/edge cases to human review, create balanced sets
- Dataset refresh: Periodic refresh (weekly/monthly) with lineage, protect eval set
- Online eval: Shadow/canary new models, track solve rate, calibration, cost, latency
Detailed guide: Production Feedback Loops
Resources (Detailed Guides)
For comprehensive operational patterns and checklists, see:
- EDA Best Practices - Structured workflow for exploratory data analysis
- Feature Engineering Patterns - Operational patterns by data type
- Data Contracts & Lineage - Data quality, versioning, feature store ops
- Modelling Patterns - Model selection, hyperparameter tuning, train/test splits
- Evaluation Patterns - Metrics, slice analysis, evaluation reports, model cards
- Reproducibility Checklist - Experiment tracking, MLOps (CI/CD/CT/CM)
- Feature Freshness & Streaming - Real-time features, schema evolution
- Production Feedback Loops - Online learning, labeling, canary deployment
Templates
Use these as copy-paste starting points:
Project & Workflow Templates
- Standard DS project template:
templates/project/template-standard.md
- Quick DS experiment template:
templates/project/template-quick.md
Feature Engineering & EDA
- Feature engineering template:
templates/features/template-feature-engineering.md
- EDA checklist & notebook template:
templates/eda/template-eda.md
Evaluation & Reporting
- Model evaluation report:
templates/evaluation/template-evaluation-report.md
- Model card:
templates/evaluation/template-model-card.md
- ML experiment review:
templates/review/experiment-review-template.md
SQL Transformation (SQLMesh)
For SQL-based data transformation and feature engineering:
- SQLMesh project setup:
templates/transformation/template-sqlmesh-project.md
- SQLMesh model types:
templates/transformation/template-sqlmesh-model.md (FULL, INCREMENTAL, VIEW)
- Incremental models:
templates/transformation/template-sqlmesh-incremental.md
- DAG and dependencies:
templates/transformation/template-sqlmesh-dag.md
- Testing and data quality:
templates/transformation/template-sqlmesh-testing.md
Use SQLMesh when:
- Building SQL-based feature pipelines
- Managing incremental data transformations
- Creating staging/intermediate/marts layers
- Testing SQL logic with unit tests and audits
For data ingestion (loading raw data), use:
- ai-mlops skill (dlt templates for REST APIs, databases, warehouses)
Navigation
Resources
- resources/reproducibility-checklist.md
- resources/evaluation-patterns.md
- resources/feature-engineering-patterns.md
- resources/modelling-patterns.md
- resources/feature-freshness-streaming.md
- resources/eda-best-practices.md
- resources/data-contracts-lineage.md
- resources/production-feedback-loops.md
Templates
Data
- data/sources.json — Curated external references
External Resources
See data/sources.json for curated foundational and implementation references:
- Core ML/DL: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, JAX
- Data processing: pandas, NumPy, Polars, DuckDB, Spark, Dask
- SQL transformation: SQLMesh, dbt (staging/marts/incremental patterns)
- Feature stores: Feast, Tecton, Databricks Feature Store (centralized feature management)
- Data validation: Pydantic, Great Expectations, Pandera, Evidently (quality + drift)
- Visualization: Matplotlib, Seaborn, Plotly, Streamlit, Dash
- MLOps: MLflow, W&B, DVC, Neptune (experiment tracking + model registry)
- Hyperparameter tuning: Optuna, Ray Tune, Hyperopt
- Model serving: BentoML, FastAPI, TorchServe, Seldon, Ray Serve
- Orchestration: Kubeflow, Metaflow, Prefect, Airflow, ZenML
- Cloud platforms: AWS SageMaker, Google Vertex AI, Azure ML, Databricks, Snowflake
Use this skill to execute data science projects end-to-end: concrete checklists, patterns, and templates, not theory.
1---2name: ai-ml-data-science3description: End-to-end data science patterns (modern best practices): problem framing -> data -> EDA -> feature engineering (with feature stores) -> modelling -> evaluation -> reporting, plus SQL transformation (SQLMesh). Emphasizes MLOps integration, drift monitoring, and production-ready workflows.4---5
6# Data Science Engineering Suite – Quick Reference
7
8This skill turns **raw data and questions** into **validated, documented models** ready for production:
9
10- **EDA workflows**: Structured exploration with drift detection
11- **Feature engineering**: Reproducible feature pipelines with leakage prevention and train/serve parity
12- **Model selection**: Baselines first; strong tabular defaults; escalate complexity only when justified
13- **Evaluation & reporting**: Slice analysis, uncertainty, model cards, production metrics
14- **SQL transformation**: SQLMesh for staging/intermediate/marts layers
15- **MLOps**: CI/CD, CT (continuous training), CM (continuous monitoring)
16- **Production patterns**: Data contracts, lineage, feedback loops, streaming features
17
18**Modern emphasis (December 2025):** Feature stores, automated retraining, drift monitoring, and train-serve parity. Tools: LightGBM 4.6, scikit-learn 1.7, PyTorch 2.9.1, Polars 1.x.
19
20---
21
22## Quick Reference
23
24| Task | Tool/Framework | Command | When to Use |
25|------|----------------|---------|-------------|
26| EDA & Profiling | Pandas, Great Expectations | `df.describe()`, `ge.validate()` | Initial data exploration and quality checks |
27| Feature Engineering | Pandas, Polars, Feature Stores | `df.transform()`, Feast materialization | Creating lag, rolling, categorical features |
28| Model Training | Gradient boosting, linear models, scikit-learn | `lgb.train()`, `model.fit()` | Strong baselines for tabular ML |
29| Hyperparameter Tuning | Optuna, Ray Tune | `optuna.create_study()`, `tune.run()` | Optimizing model parameters |
30| SQL Transformation | SQLMesh | `sqlmesh plan`, `sqlmesh run` | Building staging/intermediate/marts layers |
31| Experiment Tracking | MLflow, W&B | `mlflow.log_metric()`, `wandb.log()` | Versioning experiments and models |
32| Model Evaluation | scikit-learn, custom metrics | `metrics.roc_auc_score()`, slice analysis | Validating model performance |
33
34---
35
36## When to Use This Skill
37
38Claude should invoke this skill when the user asks for **hands-on DS/ML workflow help**, e.g.:
39
40- "Help me explore this dataset / find issues."
41- "Design features for this problem."
42- "Choose metrics and evaluate this model."
43- "Write a model evaluation report or model card."
44- "Structure an end-to-end DS project."
45- "Set up SQL transformations with SQLMesh."
46- "Build incremental feature pipelines in SQL."
47- "Create staging/intermediate/marts layers."
48- "Set up MLOps: CI/CD, continuous training, monitoring."
49
50## Data Lake & Lakehouse
51
52For comprehensive data lake/lakehouse patterns (beyond SQLMesh transformation), see **[data-lake-platform](../data-lake-platform/SKILL.md)**:
53
54- **Table formats:** Apache Iceberg, Delta Lake, Apache Hudi
55- **Query engines:** ClickHouse, DuckDB, Apache Doris, StarRocks
56- **Alternative transformation:** dbt (alternative to SQLMesh)
57- **Ingestion:** dlt, Airbyte (connectors)
58- **Streaming:** Apache Kafka patterns
59- **Orchestration:** Dagster, Airflow
60
61This skill focuses on **ML feature engineering and modeling**. Use data-lake-platform for general-purpose data infrastructure.
62
63---
64
65## Related Skills
66
67For adjacent topics, reference:
68
69- **[ai-mlops](../ai-mlops/SKILL.md)** - APIs, batch jobs, monitoring, drift, data ingestion (dlt)
70- **[ai-llm](../ai-llm/SKILL.md)** - LLM prompting, fine-tuning, evaluation
71- **[ai-rag](../ai-rag/SKILL.md)** - RAG pipelines, chunking, retrieval
72- **[ai-llm-inference](../ai-llm-inference/SKILL.md)** - LLM inference optimization, quantization
73- **[ai-ml-timeseries](../ai-ml-timeseries/SKILL.md)** - Time series forecasting, backtesting
74- **[qa-testing-strategy](../qa-testing-strategy/SKILL.md)** - Test-driven development, coverage
75- **[data-sql-optimization](../data-sql-optimization/SKILL.md)** - SQL optimization, index patterns (complements SQLMesh)
76- **[data-lake-platform](../data-lake-platform/SKILL.md)** - Data lake/lakehouse infrastructure (ClickHouse, Iceberg, Kafka)
77
78---
79
80## Decision Tree: Choosing Data Science Approach
81
82```text
83User needs ML for: [Problem Type]
84 ├─ Tabular Data?
85 │ ├─ Small-Medium (<1M rows)? → **LightGBM** (fast, efficient)
86 │ ├─ Large & Complex (>1M rows)? → **LightGBM** first, then NN if needed
87 │ └─ High-dim sparse (text, counts)? → Linear models, then shallow NN
88 │
89 ├─ Time Series?
90 │ ├─ Seasonality? → LightGBM, then see ai-ml-timeseries skill
91 │ └─ Long-term dependencies? → Transformers (ai-ml-timeseries)
92 │
93 ├─ Text or Mixed Modalities?
94 │ └─ LLMs/Transformers → See ai-llm
95 │
96 └─ SQL Transformations?
97 └─ SQLMesh (staging/intermediate/marts layers)
98```
99
100**Rule of thumb:** For tabular data, tree-based gradient boosting is a strong baseline, but must be validated against alternatives and constraints.
101
102---
103
104## Core Concepts (Vendor-Agnostic)
105
106- **Problem framing**: define success metrics, baselines, and decision thresholds before modeling.
107- **Leakage prevention**: ensure all features are available at prediction time; split by time/group when appropriate.
108- **Uncertainty**: report confidence intervals and stability (fold variance, bootstrap) rather than single-point metrics.
109- **Reproducibility**: version code/data/features, fix seeds, and record the environment.
110- **Operational handoff**: define monitoring, retraining triggers, and rollback criteria with MLOps.
111
112## Implementation Practices (Tooling Examples)
113
114- Track experiments and artifacts (run id, commit hash, data version).
115- Add data validation gates in pipelines (schema + distribution + freshness).
116- Prefer reproducible, testable feature code (shared transforms, point-in-time correctness).
117- Use datasheets/model cards and eval reports as deployment prerequisites (Datasheets for Datasets: https://arxiv.org/abs/1803.09010; Model Cards: https://arxiv.org/abs/1810.03993).
118
119## Do / Avoid
120
121**Do**
122- Do start with baselines and a simple model to expose leakage and data issues early.
123- Do run slice analysis and document failure modes before recommending deployment.
124- Do keep an immutable eval set; refresh training data without contaminating evaluation.
125
126**Avoid**
127- Avoid random splits for temporal or user-correlated data.
128- Avoid “metric gaming” (optimizing the number without validating business impact).
129- Avoid training on labels created after the prediction timestamp (silent future leakage).
130
131# Core Patterns (Overview)
132
133## Pattern 1: End-to-End DS Project Lifecycle
134
135**Use when:** Starting or restructuring any DS/ML project.
136
137**Stages:**
138
1391. **Problem framing** - Business objective, success metrics, baseline
1402. **Data & feasibility** - Sources, coverage, granularity, label quality
1413. **EDA & data quality** - Schema, missingness, outliers, leakage checks
1424. **Feature engineering** - Per data type with feature store integration
1435. **Modelling** - Baselines first, then LightGBM, then complexity as needed
1446. **Evaluation** - Offline metrics, slice analysis, error analysis
1457. **Reporting** - Model evaluation report + model card
1468. **MLOps** - CI/CD, CT (continuous training), CM (continuous monitoring)
147
148**Detailed guide:** [EDA Best Practices](resources/eda-best-practices.md)
149
150---
151
152## Pattern 2: Feature Engineering
153
154**Use when:** Designing features before modelling or during model improvement.
155
156**By data type:**
157
158- **Numeric:** Standardize, handle outliers, transform skew, scale
159- **Categorical:** One-hot/ordinal (low cardinality), target/frequency/hashing (high cardinality)
160 - **Feature Store Integration:** Store encoders, mappings, statistics centrally
161- **Text:** Cleaning, TF-IDF, embeddings, simple stats
162- **Time:** Calendar features, recency, rolling/lag features
163
164**Key Modern Practice:** Use feature stores (Feast, Tecton, Databricks) for versioning, sharing, and train-serve parity.
165
166**Detailed guide:** [Feature Engineering Patterns](resources/feature-engineering-patterns.md)
167
168---
169
170## Pattern 3: Data Contracts & Lineage
171
172**Use when:** Building production ML systems with data quality requirements.
173
174**Components:**
175
176- **Contracts:** Schema + ranges/nullability + freshness SLAs
177- **Lineage:** Track source → feature store → train → serve
178- **Feature store hygiene:** Materialization cadence, backfill/replay, encoder versioning
179- **Schema evolution:** Backward/forward-compatible migrations with shadow runs
180
181**Detailed guide:** [Data Contracts & Lineage](resources/data-contracts-lineage.md)
182
183---
184
185## Pattern 4: Model Selection & Training
186
187**Use when:** Picking model families and starting experiments.
188
189**Decision guide (modern benchmarks):**
190
191- **Tabular:** Start with a **strong baseline** (linear/logistic, then gradient boosting) and iterate based on error analysis
192- **Baselines:** Always implement simple baselines first (majority class, mean, naive forecast)
193- **Train/val/test splits:** Time-based (forecasting), group-based (user/item leakage), or random (IID)
194- **Hyperparameter tuning:** Start manual, then Bayesian optimization (Optuna, Ray Tune)
195- **Overfitting control:** Regularization, early stopping, cross-validation
196
197**Detailed guide:** [Modelling Patterns](resources/modelling-patterns.md)
198
199---
200
201## Pattern 5: Evaluation & Reporting
202
203**Use when:** Finalizing a model candidate or handing over to production.
204
205**Key components:**
206
207- **Metric selection:** Primary (ROC-AUC, PR-AUC, RMSE) + guardrails (calibration, fairness)
208- **Threshold selection:** ROC/PR curves, cost-sensitive, F1 maximization
209- **Slice analysis:** Performance by geography, user segments, product categories
210- **Error analysis:** Collect high-error examples, cluster by error type, identify systematic failures
211- **Uncertainty:** Confidence intervals (bootstrap where appropriate), variance across folds, and stability checks
212- **Evaluation report:** 8-section report (objective, data, features, models, metrics, slices, risks, recommendation)
213- **Model card:** Documentation for stakeholders (intended use, data, performance, ethics, operations)
214
215**Detailed guide:** [Evaluation Patterns](resources/evaluation-patterns.md)
216
217---
218
219## Pattern 6: Reproducibility & MLOps
220
221**Use when:** Ensuring experiments are reproducible and production-ready.
222
223**Modern MLOps (CI/CD/CT/CM):**
224
225- **CI (Continuous Integration):** Automated testing, data validation, code quality
226- **CD (Continuous Delivery):** Environment-specific promotion (dev → staging → prod), canary deployment
227- **CT (Continuous Training):** Drift-triggered and scheduled retraining
228- **CM (Continuous Monitoring):** Real-time data drift, performance, system health
229
230**Versioning:**
231- Code (git commit), data (DVC, LakeFS), features (feature store), models (MLflow Registry)
232- Seeds (reproducibility), hyperparameters (experiment tracker)
233
234**Detailed guide:** [Reproducibility Checklist](resources/reproducibility-checklist.md)
235
236---
237
238## Pattern 7: Feature Freshness & Streaming
239
240**Use when:** Managing real-time features and streaming pipelines.
241
242**Components:**
243
244- **Freshness contracts:** Define freshness SLAs per feature, monitor lag, alert on breaches
245- **Batch + stream parity:** Same feature logic across batch/stream, idempotent upserts
246- **Schema evolution:** Version schemas, add forward/backward-compatible parsers, backfill with rollback
247- **Data quality gates:** PII/format checks, range checks, distribution drift (KL, KS, PSI)
248
249**Detailed guide:** [Feature Freshness & Streaming](resources/feature-freshness-streaming.md)
250
251---
252
253## Pattern 8: Production Feedback Loops
254
255**Use when:** Capturing production signals and implementing continuous improvement.
256
257**Components:**
258
259- **Signal capture:** Log predictions + user edits/acceptance/abandonment (scrub PII)
260- **Labeling:** Route failures/edge cases to human review, create balanced sets
261- **Dataset refresh:** Periodic refresh (weekly/monthly) with lineage, protect eval set
262- **Online eval:** Shadow/canary new models, track solve rate, calibration, cost, latency
263
264**Detailed guide:** [Production Feedback Loops](resources/production-feedback-loops.md)
265
266---
267
268## Resources (Detailed Guides)
269
270For comprehensive operational patterns and checklists, see:
271
272- [EDA Best Practices](resources/eda-best-practices.md) - Structured workflow for exploratory data analysis
273- [Feature Engineering Patterns](resources/feature-engineering-patterns.md) - Operational patterns by data type
274- [Data Contracts & Lineage](resources/data-contracts-lineage.md) - Data quality, versioning, feature store ops
275- [Modelling Patterns](resources/modelling-patterns.md) - Model selection, hyperparameter tuning, train/test splits
276- [Evaluation Patterns](resources/evaluation-patterns.md) - Metrics, slice analysis, evaluation reports, model cards
277- [Reproducibility Checklist](resources/reproducibility-checklist.md) - Experiment tracking, MLOps (CI/CD/CT/CM)
278- [Feature Freshness & Streaming](resources/feature-freshness-streaming.md) - Real-time features, schema evolution
279- [Production Feedback Loops](resources/production-feedback-loops.md) - Online learning, labeling, canary deployment
280
281---
282
283## Templates
284
285Use these as copy-paste starting points:
286
287### Project & Workflow Templates
288
289- **Standard DS project template:** `templates/project/template-standard.md`
290- **Quick DS experiment template:** `templates/project/template-quick.md`
291
292### Feature Engineering & EDA
293
294- **Feature engineering template:** `templates/features/template-feature-engineering.md`
295- **EDA checklist & notebook template:** `templates/eda/template-eda.md`
296
297### Evaluation & Reporting
298
299- **Model evaluation report:** `templates/evaluation/template-evaluation-report.md`
300- **Model card:** `templates/evaluation/template-model-card.md`
301- **ML experiment review:** `templates/review/experiment-review-template.md`
302
303### SQL Transformation (SQLMesh)
304
305For SQL-based data transformation and feature engineering:
306
307- **SQLMesh project setup:** `templates/transformation/template-sqlmesh-project.md`
308- **SQLMesh model types:** `templates/transformation/template-sqlmesh-model.md` (FULL, INCREMENTAL, VIEW)
309- **Incremental models:** `templates/transformation/template-sqlmesh-incremental.md`
310- **DAG and dependencies:** `templates/transformation/template-sqlmesh-dag.md`
311- **Testing and data quality:** `templates/transformation/template-sqlmesh-testing.md`
312
313**Use SQLMesh when:**
314- Building SQL-based feature pipelines
315- Managing incremental data transformations
316- Creating staging/intermediate/marts layers
317- Testing SQL logic with unit tests and audits
318
319**For data ingestion (loading raw data), use:**
320- [ai-mlops](../ai-mlops/SKILL.md) skill (dlt templates for REST APIs, databases, warehouses)
321
322## Navigation
323
324**Resources**
325- [resources/reproducibility-checklist.md](resources/reproducibility-checklist.md)
326- [resources/evaluation-patterns.md](resources/evaluation-patterns.md)
327- [resources/feature-engineering-patterns.md](resources/feature-engineering-patterns.md)
328- [resources/modelling-patterns.md](resources/modelling-patterns.md)
329- [resources/feature-freshness-streaming.md](resources/feature-freshness-streaming.md)
330- [resources/eda-best-practices.md](resources/eda-best-practices.md)
331- [resources/data-contracts-lineage.md](resources/data-contracts-lineage.md)
332- [resources/production-feedback-loops.md](resources/production-feedback-loops.md)
333
334**Templates**
335- [templates/project/template-standard.md](templates/project/template-standard.md)
336- [templates/project/template-quick.md](templates/project/template-quick.md)
337- [templates/features/template-feature-engineering.md](templates/features/template-feature-engineering.md)
338- [templates/eda/template-eda.md](templates/eda/template-eda.md)
339- [templates/evaluation/template-evaluation-report.md](templates/evaluation/template-evaluation-report.md)
340- [templates/evaluation/template-model-card.md](templates/evaluation/template-model-card.md)
341- [templates/review/experiment-review-template.md](templates/review/experiment-review-template.md)
342- [template-sqlmesh-project.md](../data-lake-platform/templates/transformation/sqlmesh/template-sqlmesh-project.md)
343- [template-sqlmesh-model.md](../data-lake-platform/templates/transformation/sqlmesh/template-sqlmesh-model.md)
344- [template-sqlmesh-incremental.md](../data-lake-platform/templates/transformation/sqlmesh/template-sqlmesh-incremental.md)
345- [template-sqlmesh-dag.md](../data-lake-platform/templates/transformation/sqlmesh/template-sqlmesh-dag.md)
346- [template-sqlmesh-testing.md](../data-lake-platform/templates/transformation/sqlmesh/template-sqlmesh-testing.md)
347
348**Data**
349- [data/sources.json](data/sources.json) — Curated external references
350
351---
352
353## External Resources
354
355See [data/sources.json](data/sources.json) for curated foundational and implementation references:
356
357- **Core ML/DL**: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, JAX
358- **Data processing**: pandas, NumPy, Polars, DuckDB, Spark, Dask
359- **SQL transformation**: SQLMesh, dbt (staging/marts/incremental patterns)
360- **Feature stores**: Feast, Tecton, Databricks Feature Store (centralized feature management)
361- **Data validation**: Pydantic, Great Expectations, Pandera, Evidently (quality + drift)
362- **Visualization**: Matplotlib, Seaborn, Plotly, Streamlit, Dash
363- **MLOps**: MLflow, W&B, DVC, Neptune (experiment tracking + model registry)
364- **Hyperparameter tuning**: Optuna, Ray Tune, Hyperopt
365- **Model serving**: BentoML, FastAPI, TorchServe, Seldon, Ray Serve
366- **Orchestration**: Kubeflow, Metaflow, Prefect, Airflow, ZenML
367- **Cloud platforms**: AWS SageMaker, Google Vertex AI, Azure ML, Databricks, Snowflake
368
369Use this skill to **execute data science projects end-to-end**: concrete checklists, patterns, and templates, not theory.