1---2name: ml-best-practices3description: Model selection guidelines, feature engineering techniques, hyperparameter tuning strategies, evaluation metrics, and common ML frameworks4---5
6# ML Best Practices
7
8## Model Selection Guidelines
9
10### Problem Type Classification
11- **Supervised Learning**: Labeled data for training
12 - Regression: Predict continuous values (Linear Regression, Random Forest, Gradient Boosting)
13 - Classification: Predict discrete labels (Logistic Regression, SVM, Decision Trees, Neural Networks)
14- **Unsupervised Learning**: Unlabeled data exploration
15 - Clustering: Group similar data points (K-Means, DBSCAN, Hierarchical)
16 - Dimensionality Reduction: Reduce feature space (PCA, t-SNE, UMAP)
17 - Anomaly Detection: Identify outliers (Isolation Forest, One-Class SVM)
18- **Reinforcement Learning**: Learn through interaction with environment
19 - Policy-based: Learn policy directly (REINFORCE, PPO)
20 - Value-based: Learn value function (DQN, SARSA)
21
22### Algorithm Selection Criteria
23- **Data Size**: Small vs. large datasets
24- **Feature Types**: Numerical, categorical, text, image
25- **Interpretability**: Need for model explanations
26- **Training Time**: Constraints on model training
27- **Inference Latency**: Real-time vs. batch predictions
28- **Accuracy Requirements**: Trade-offs with complexity
29
30### Common ML Frameworks
31- **scikit-learn**: Traditional ML algorithms, easy to use
32- **TensorFlow/Keras**: Deep learning, production-ready
33- **PyTorch**: Research-friendly, dynamic computation graphs
34- **XGBoost/LightGBM**: Gradient boosting for tabular data
35- **Hugging Face Transformers**: Pre-trained NLP models
36
37## Feature Engineering Techniques
38
39### Numerical Features
40- **Scaling**: Standardization (z-score) or Min-Max scaling
41- **Binning**: Convert continuous to categorical
42- **Polynomial Features**: Create interaction terms
43- **Log Transformations**: Handle skewed distributions
44- **Normalization**: Scale to unit norm
45
46### Categorical Features
47- **One-Hot Encoding**: Binary columns for each category
48- **Label Encoding**: Map categories to integers
49- **Ordinal Encoding**: Preserve order for ordinal categories
50- **Target Encoding**: Replace with target mean (with regularization)
51- **Embedding**: Learn dense representations (for high cardinality)
52
53### Text Features
54- **Bag of Words**: Word frequency counts
55- **TF-IDF**: Term frequency-inverse document frequency
56- **N-grams**: Capture word sequences
57- **Word Embeddings**: Pre-trained (Word2Vec, GloVe) or learned
58- **Transformer Embeddings**: Contextual embeddings (BERT, RoBERTa)
59
60### Feature Selection
61- **Filter Methods**: Statistical tests, correlation analysis
62- **Wrapper Methods**: Recursive feature elimination, forward/backward selection
63- **Embedded Methods**: L1 regularization, tree-based feature importance
64- **Dimensionality Reduction**: PCA, LDA, autoencoders
65
66## Hyperparameter Tuning Strategies
67
68### Search Strategies
69- **Grid Search**: Exhaustive search over parameter grid
70- **Random Search**: Random sampling from parameter space
71- **Bayesian Optimization**: Use probabilistic model to guide search
72- **Evolutionary Algorithms**: Genetic algorithms for parameter evolution
73- **Successive Halving**: Early stopping for poor configurations
74
75### Common Hyperparameters
76- **Tree-based Models**: max_depth, n_estimators, learning_rate, min_samples_split
77- **Neural Networks**: learning_rate, batch_size, number of layers, number of units
78- **SVM**: C, kernel, gamma
79- **K-Means**: n_clusters, init, n_init
80
81### Tuning Best Practices
82- **Cross-Validation**: Use k-fold or stratified k-fold for robust evaluation
83- **Early Stopping**: Stop training when validation performance degrades
84- **Learning Rate Schedules**: Decay learning rate over time
85- **Ensembling**: Combine multiple models for better performance
86
87## Evaluation Metrics and Validation Methods
88
89### Regression Metrics
90- **Mean Squared Error (MSE)**: Average of squared errors
91- **Root Mean Squared Error (RMSE)**: Square root of MSE
92- **Mean Absolute Error (MAE)**: Average of absolute errors
93- **R-squared**: Proportion of variance explained
94- **Mean Absolute Percentage Error (MAPE)**: Percentage-based error
95
96### Classification Metrics
97- **Accuracy**: Overall correct predictions
98- **Precision**: True positives / (true positives + false positives)
99- **Recall**: True positives / (true positives + false negatives)
100- **F1-Score**: Harmonic mean of precision and recall
101- **ROC-AUC**: Area under ROC curve
102- **Confusion Matrix**: Detailed breakdown of predictions
103
104### Validation Methods
105- **Train-Test Split**: Simple holdout validation
106- **K-Fold Cross-Validation**: Divide data into k folds
107- **Stratified K-Fold**: Preserve class distribution in folds
108- **Time Series Split**: Respect temporal order
109- **Nested Cross-Validation**: Outer loop for evaluation, inner for tuning
110
111### Bias-Variance Trade-off
112- **High Bias**: Underfitting, model too simple
113- **High Variance**: Overfitting, model too complex
114- **Sweet Spot**: Balance between bias and variance
115- **Regularization**: Reduce variance by adding constraints
116
117## Model Interpretation
118
119### Feature Importance
120- **Permutation Importance**: Shuffle feature values and measure impact
121- **SHAP Values**: Game-theoretic approach to feature attribution
122- **LIME**: Local interpretable model-agnostic explanations
123- **Partial Dependence Plots**: Show relationship between feature and predictions
124
125### Model-Agnostic Methods
126- **SHAP**: Consistent, local feature attribution
127- **LIME**: Local linear approximations
128- **Permutation Importance**: Global feature importance
129- **Partial Dependence**: Global relationship visualization
130
131### Model-Specific Methods
132- **Linear Models**: Coefficients directly show feature impact
133- **Tree-based Models**: Feature importance from split criteria
134- **Neural Networks**: Attention weights, saliency maps