Regression Analysis & Predictive Modeling
A comprehensive regression analysis skill that automates the complete machine learning workflow from data preparation to model evaluation and interpretation, supporting multiple algorithms and business use cases.
Instructions
1. Data Preparation and Exploration
When users provide datasets for regression analysis:
- Load and validate the data structure and quality
- Handle missing values, outliers, and data type conversions
- Perform exploratory data analysis (EDA) with visualizations
- Identify potential predictors and target variables
- Support both English and Chinese column names and data
2. Feature Engineering
- Date Features: Extract time-based features from datetime columns
- Categorical Encoding: Convert categorical variables to numerical representations
- Feature Creation: Generate interaction terms, ratios, and derived features
- Feature Selection: Identify most predictive features using statistical methods
- Data Scaling: Standardize or normalize features as needed for different algorithms
3. Model Training and Selection
- Linear Regression: Baseline model with coefficient interpretation
- Decision Tree Regression: Non-linear relationships with feature importance
- Random Forest: Ensemble method for improved accuracy and robustness
- Cross-Validation: K-fold CV to ensure model stability
- Hyperparameter Tuning: Automatic optimization of model parameters
- Model Comparison: Rank models by performance metrics
4. Model Evaluation and Diagnostics
- Performance Metrics: R², MAE, RMSE, MAPE for comprehensive evaluation
- Residual Analysis: Diagnostic plots to check model assumptions
- Learning Curves: Analyze model performance with different data sizes
- Feature Importance: Identify key predictors for business insights
- Prediction Intervals: Quantify uncertainty in predictions
5. Visualization and Reporting
- Prediction vs Actual: Scatter plots showing prediction accuracy
- Residual Plots: Diagnostic visualizations for model assumptions
- Feature Importance Charts: Visual ranking of predictive factors
- Learning Curve Analysis: Model performance visualization
- Comprehensive Reports: Automated analysis summary with business insights
Usage Examples
Housing Price Prediction
Build a model to predict house prices:
[CSV with square_footage, rooms, location, age, amenities data]
Sales Forecasting
Create a sales prediction model:
[CSV with date, product_id, marketing_spend, seasonality data]
Risk Assessment
Predict risk scores based on customer attributes:
[CSV with demographic, behavioral, historical data]
Key Features
Automated ML Pipeline
- End-to-End Processing: From raw data to final predictions
- Multiple Algorithm Support: Linear, Tree-based, and Ensemble methods
- Smart Feature Engineering: Automatic creation of relevant features
- Model Selection: Data-driven algorithm recommendation
- Chinese Language Support: Full support for Chinese data and outputs
Business-Focused Outputs
- Actionable Insights: Feature importance translated to business context
- Model Interpretability: Clear explanations of prediction logic
- Performance Benchmarks: Industry-standard evaluation metrics
- Risk Assessment: Prediction confidence intervals
- ROI Analysis: Business impact quantification
Advanced Analytics
- Time Series Features: Automatic handling of temporal data
- Cross-Validation: Robust model performance estimation
- Ensemble Methods: Combining multiple models for better accuracy
- Hyperparameter Optimization: Automated model tuning
File Requirements
For General Regression:
- target_variable: Variable to predict (e.g., price, sales, risk score)
- predictor_variables: Features used for prediction
- Sufficient sample size: Minimum 100 rows for reliable modeling
Output Files Generated
- model_results.csv: Complete predictions with confidence intervals
- feature_importance.csv: Ranked feature importance with scores
- model_comparison.csv: Performance metrics for all tested models
- prediction_plots.png: Comprehensive visualization dashboard
- regression_analysis_report.md: Detailed analysis and business insights
- model_coefficients.csv: Linear regression model coefficients
Dependencies
- Core ML: scikit-learn, pandas, numpy
- Visualization: matplotlib, seaborn (with Chinese font support)
- Statistical Analysis: scipy for statistical tests
- Data Processing: Standard Python libraries for file operations
Best Practices
Data Preparation
- Ensure consistent data formatting and encoding
- Handle missing values appropriately (imputation vs removal)
- Remove or transform outliers based on domain knowledge
- Validate data types and ranges before modeling
Model Development
- Always split data into training and testing sets
- Use cross-validation for robust performance estimation
- Compare multiple algorithms before final selection
- Consider business constraints and interpretability requirements
Interpretation and Deployment
- Focus on business-relevant metrics over purely statistical ones
- Validate model predictions against domain expertise
- Document model limitations and appropriate use cases
- Establish monitoring procedures for deployed models
Advanced Features
Automated Feature Engineering
- Temporal Features: Time-based pattern extraction
- Interaction Terms: Automatic feature combination
- Polynomial Features: Non-linear relationship capture
Model Diagnostics
- Residual Analysis: Check model assumptions
- Leverage Points: Identify influential observations
- Multicollinearity: Detect correlated predictors
- Heteroscedasticity: Test for constant variance
Business Integration
- ROI Calculation: Business impact quantification
- Scenario Analysis: What-if predictions
- Threshold Optimization: Business-specific cutoff tuning
- A/B Testing Support: Model validation framework
1---2name: regression-analysis-modeling3description: Perform comprehensive regression analysis and predictive modeling using linear regression, decision trees, and random forests. Use when you need to predict continuous values like housing prices, sales forecasts, demand predictions, or any numerical target variables. Includes automated feature engineering, model comparison, and visualization with Chinese language support.4---5
6# Regression Analysis & Predictive Modeling
7
8A comprehensive regression analysis skill that automates the complete machine learning workflow from data preparation to model evaluation and interpretation, supporting multiple algorithms and business use cases.
9
10## Instructions
11
12### 1. Data Preparation and Exploration
13When users provide datasets for regression analysis:
14- Load and validate the data structure and quality
15- Handle missing values, outliers, and data type conversions
16- Perform exploratory data analysis (EDA) with visualizations
17- Identify potential predictors and target variables
18- Support both English and Chinese column names and data
19
20### 2. Feature Engineering
21- **Date Features**: Extract time-based features from datetime columns
22- **Categorical Encoding**: Convert categorical variables to numerical representations
23- **Feature Creation**: Generate interaction terms, ratios, and derived features
24- **Feature Selection**: Identify most predictive features using statistical methods
25- **Data Scaling**: Standardize or normalize features as needed for different algorithms
26
27### 3. Model Training and Selection
28- **Linear Regression**: Baseline model with coefficient interpretation
29- **Decision Tree Regression**: Non-linear relationships with feature importance
30- **Random Forest**: Ensemble method for improved accuracy and robustness
31- **Cross-Validation**: K-fold CV to ensure model stability
32- **Hyperparameter Tuning**: Automatic optimization of model parameters
33- **Model Comparison**: Rank models by performance metrics
34
35### 4. Model Evaluation and Diagnostics
36- **Performance Metrics**: R², MAE, RMSE, MAPE for comprehensive evaluation
37- **Residual Analysis**: Diagnostic plots to check model assumptions
38- **Learning Curves**: Analyze model performance with different data sizes
39- **Feature Importance**: Identify key predictors for business insights
40- **Prediction Intervals**: Quantify uncertainty in predictions
41
42### 5. Visualization and Reporting
43- **Prediction vs Actual**: Scatter plots showing prediction accuracy
44- **Residual Plots**: Diagnostic visualizations for model assumptions
45- **Feature Importance Charts**: Visual ranking of predictive factors
46- **Learning Curve Analysis**: Model performance visualization
47- **Comprehensive Reports**: Automated analysis summary with business insights
48
49## Usage Examples
50
51### Housing Price Prediction
52```
53Build a model to predict house prices:
54[CSV with square_footage, rooms, location, age, amenities data]
55```
56
57### Sales Forecasting
58```
59Create a sales prediction model:
60[CSV with date, product_id, marketing_spend, seasonality data]
61```
62
63### Risk Assessment
64```
65Predict risk scores based on customer attributes:
66[CSV with demographic, behavioral, historical data]
67```
68
69## Key Features
70
71### Automated ML Pipeline
72- **End-to-End Processing**: From raw data to final predictions
73- **Multiple Algorithm Support**: Linear, Tree-based, and Ensemble methods
74- **Smart Feature Engineering**: Automatic creation of relevant features
75- **Model Selection**: Data-driven algorithm recommendation
76- **Chinese Language Support**: Full support for Chinese data and outputs
77
78### Business-Focused Outputs
79- **Actionable Insights**: Feature importance translated to business context
80- **Model Interpretability**: Clear explanations of prediction logic
81- **Performance Benchmarks**: Industry-standard evaluation metrics
82- **Risk Assessment**: Prediction confidence intervals
83- **ROI Analysis**: Business impact quantification
84
85### Advanced Analytics
86- **Time Series Features**: Automatic handling of temporal data
87- **Cross-Validation**: Robust model performance estimation
88- **Ensemble Methods**: Combining multiple models for better accuracy
89- **Hyperparameter Optimization**: Automated model tuning
90
91## File Requirements
92
93### For General Regression:
94- **target_variable**: Variable to predict (e.g., price, sales, risk score)
95- **predictor_variables**: Features used for prediction
96- **Sufficient sample size**: Minimum 100 rows for reliable modeling
97
98## Output Files Generated
99
100- **model_results.csv**: Complete predictions with confidence intervals
101- **feature_importance.csv**: Ranked feature importance with scores
102- **model_comparison.csv**: Performance metrics for all tested models
103- **prediction_plots.png**: Comprehensive visualization dashboard
104- **regression_analysis_report.md**: Detailed analysis and business insights
105- **model_coefficients.csv**: Linear regression model coefficients
106
107## Dependencies
108
109- **Core ML**: scikit-learn, pandas, numpy
110- **Visualization**: matplotlib, seaborn (with Chinese font support)
111- **Statistical Analysis**: scipy for statistical tests
112- **Data Processing**: Standard Python libraries for file operations
113
114## Best Practices
115
116### Data Preparation
117- Ensure consistent data formatting and encoding
118- Handle missing values appropriately (imputation vs removal)
119- Remove or transform outliers based on domain knowledge
120- Validate data types and ranges before modeling
121
122### Model Development
123- Always split data into training and testing sets
124- Use cross-validation for robust performance estimation
125- Compare multiple algorithms before final selection
126- Consider business constraints and interpretability requirements
127
128### Interpretation and Deployment
129- Focus on business-relevant metrics over purely statistical ones
130- Validate model predictions against domain expertise
131- Document model limitations and appropriate use cases
132- Establish monitoring procedures for deployed models
133
134## Advanced Features
135
136### Automated Feature Engineering
137- **Temporal Features**: Time-based pattern extraction
138- **Interaction Terms**: Automatic feature combination
139- **Polynomial Features**: Non-linear relationship capture
140
141### Model Diagnostics
142- **Residual Analysis**: Check model assumptions
143- **Leverage Points**: Identify influential observations
144- **Multicollinearity**: Detect correlated predictors
145- **Heteroscedasticity**: Test for constant variance
146
147### Business Integration
148- **ROI Calculation**: Business impact quantification
149- **Scenario Analysis**: What-if predictions
150- **Threshold Optimization**: Business-specific cutoff tuning
151- **A/B Testing Support**: Model validation framework