Data Science Skill
Use this skill for production ML systems, not basic model training:
When to Use
- Feature engineering: Designing features that improve model performance
- Model debugging: Understanding why models underperform, identifying data issues
- Pipeline optimization: Building efficient training/inference pipelines
- Experiment tracking: Reproducible ML experiments, versioning, A/B testing
- ML in production: Serving, monitoring, retraining strategies
Core Capabilities
- Feature engineering: Transform raw data into predictive features, handling categorical data, time series
- Model diagnostics: Identify overfitting, underfitting, data leakage, distribution shift
- Pipeline design: End-to-end ML pipelines with proper train/val/test splits, cross-validation
- Production ML: Model serving, monitoring, performance tracking, retraining triggers
- Experiment management: Track hyperparameters, metrics, reproducibility
Progressive Disclosure
- ml-engineering.md - Production ML systems, serving, monitoring
- reinforcement-learning.md - RL algorithms, environments, training strategies
Not For
- Basic pandas/numpy operations (already covered)
- Simple model.fit() calls
- Generic data visualization