Data Science Expert
Comprehensive data science frameworks for analytics, machine learning, and data-driven decision making.
Data Strategy
Data Maturity Model
| Level |
Name |
Characteristics |
| 1 |
Ad Hoc |
Manual, inconsistent, siloed |
| 2 |
Opportunistic |
Some automation, point solutions |
| 3 |
Systematic |
Defined processes, governance emerging |
| 4 |
Differentiating |
Data-driven decisions, advanced analytics |
| 5 |
Transformative |
AI-first, competitive advantage |
Analytics Value Chain
DATA → INFORMATION → INSIGHT → ACTION → VALUE
PROGRESSION:
Descriptive: What happened?
Diagnostic: Why did it happen?
Predictive: What will happen?
Prescriptive: What should we do?
Autonomous: Self-optimizing systems
Statistical Analysis
Descriptive Statistics
CENTRAL TENDENCY:
- Mean: Sum / Count (sensitive to outliers)
- Median: Middle value (robust to outliers)
- Mode: Most frequent value
DISPERSION:
- Range: Max - Min
- Variance: Average squared deviation
- Standard Deviation: √Variance
- IQR: Q3 - Q1 (robust)
DISTRIBUTION SHAPE:
- Skewness: Asymmetry (0 = symmetric)
- Kurtosis: Tail heaviness (3 = normal)
For detailed inferential statistics and hypothesis testing, see Statistical Methods Reference.
Machine Learning
Algorithm Selection
| Task |
Algorithms |
When to Use |
| Classification |
Logistic Regression, Random Forest, XGBoost, Neural Networks |
Categorical outcomes |
| Regression |
Linear Regression, Ridge/Lasso, Random Forest, XGBoost |
Continuous outcomes |
| Clustering |
K-Means, Hierarchical, DBSCAN |
Group discovery |
| Dimensionality Reduction |
PCA, t-SNE, UMAP |
Feature reduction, visualization |
| Anomaly Detection |
Isolation Forest, One-Class SVM, Autoencoders |
Outlier detection |
| Time Series |
ARIMA, Prophet, LSTM |
Sequential data |
| Recommendation |
Collaborative Filtering, Content-Based, Matrix Factorization |
Personalization |
| NLP |
Transformers, BERT, GPT |
Text understanding/generation |
For detailed ML pipelines, feature engineering, and model monitoring, see ML Pipelines Reference.
Data Governance
Data Governance Framework
GOVERNANCE PILLARS:
POLICIES:
- Data ownership
- Data classification
- Data retention
- Data access
- Data quality standards
ROLES:
- Data Owner: Accountable for data domain
- Data Steward: Day-to-day quality management
- Data Custodian: Technical implementation
- Data Consumer: End user
PROCESSES:
- Data cataloging
- Metadata management
- Data lineage
- Issue resolution
- Change management
METRICS:
- Data quality scores
- Policy compliance
- Data access requests
- Issue resolution time
Data Quality Dimensions
| Dimension |
Definition |
Measurement |
| Accuracy |
Correct representation of reality |
% records matching source |
| Completeness |
All required data present |
% non-null values |
| Consistency |
Same across systems |
% matching across sources |
| Timeliness |
Available when needed |
Latency, freshness |
| Validity |
Conforms to format/rules |
% passing validation |
| Uniqueness |
No unwanted duplicates |
Duplicate rate |
Business Intelligence
BI Architecture
ARCHITECTURE LAYERS:
DATA SOURCES:
- Operational systems
- External data
- IoT/streaming
DATA INTEGRATION:
- ETL/ELT pipelines
- Data lakes
- Data warehouses
SEMANTIC LAYER:
- Business definitions
- Calculated metrics
- Hierarchies
- Relationships
PRESENTATION:
- Dashboards
- Reports
- Ad-hoc analysis
- Embedded analytics
Dashboard Design Principles
DESIGN PRINCIPLES:
PURPOSE:
- One clear objective per dashboard
- Know your audience
- Enable decisions
LAYOUT:
- Most important top-left
- Related items grouped
- Progressive disclosure
- Whitespace for clarity
VISUALS:
- Right chart for data type
- Consistent formatting
- Minimal decoration
- Color with purpose
INTERACTIVITY:
- Filters for exploration
- Drill-down capability
- Cross-filtering
- Tooltip details
Metric Design
METRIC DEFINITION TEMPLATE:
NAME: [Metric name]
DEFINITION: [Clear business definition]
FORMULA: [Precise calculation]
OWNER: [Responsible person]
DATA SOURCE: [Where it comes from]
GRAIN: [Level of detail]
FREQUENCY: [Update cadence]
DIMENSIONS: [Slicing attributes]
TARGETS: [Goals/benchmarks]
RELATED: [Related metrics]
Predictive Modeling
Use Case Framework
| Use Case |
Business Application |
Approach |
| Churn Prediction |
Retention programs |
Classification |
| Demand Forecasting |
Inventory planning |
Time series |
| Lead Scoring |
Sales prioritization |
Classification |
| Price Optimization |
Revenue management |
Regression/RL |
| Fraud Detection |
Risk mitigation |
Anomaly detection |
| Recommendation |
Personalization |
Collaborative filtering |
| Customer Segmentation |
Marketing targeting |
Clustering |
| Lifetime Value |
Customer investment |
Regression |
Data Ethics & Privacy
Ethical AI Framework
PRINCIPLES:
FAIRNESS:
- No discriminatory outcomes
- Bias testing across groups
- Regular auditing
ACCOUNTABILITY:
- Clear ownership
- Decision audit trails
- Escalation process
TRANSPARENCY:
- Explainable decisions
- Clear documentation
- User communication
PRIVACY:
- Data minimization
- Consent management
- Security controls
Bias Detection
BIAS TYPES:
HISTORICAL: Reflects past discrimination
REPRESENTATION: Training data not representative
MEASUREMENT: Proxy variables correlate with protected attributes
AGGREGATION: Single model for diverse populations
EVALUATION: Inappropriate benchmarks
FAIRNESS METRICS:
- Demographic Parity: Equal positive rates
- Equalized Odds: Equal TPR and FPR
- Individual Fairness: Similar inputs, similar outputs
- Calibration: Equal accuracy across groups
Analytics Team Structure
Team Roles
| Role |
Focus |
Skills |
| Data Engineer |
Pipelines, infrastructure |
SQL, Python, Spark, Cloud |
| Data Analyst |
Reporting, ad-hoc analysis |
SQL, BI tools, Statistics |
| Data Scientist |
Modeling, ML |
Python/R, ML, Statistics |
| ML Engineer |
Model deployment |
MLOps, Software Engineering |
| Analytics Engineer |
Data modeling |
dbt, SQL, Data Modeling |
Operating Models
| Model |
Description |
Best For |
| Centralized |
Single analytics team |
Consistency, efficiency |
| Decentralized |
Embedded in business units |
Business alignment |
| Hub & Spoke |
Central CoE + embedded |
Balance of both |
| Federated |
Shared platform, domain teams |
Scale with autonomy |
References
- ML Pipelines Reference - Detailed ML pipeline, feature engineering, model development
- Statistical Methods Reference - Inferential statistics, hypothesis testing, evaluation metrics
See Also
Converted and distributed by TomeVault — claim your Tome and manage your conversions.
1---2name: data-science3description: Data science and analytics expertise for statistical analysis, machine learning pipelines, data governance, business intelligence, predictive modeling, and analytics strategy. Use when building ML models, analyzing data, creating dashboards, or designing data architectures. Use when this capability is needed.4---56# Data Science Expert78Comprehensive data science frameworks for analytics, machine learning, and data-driven decision making.910## Data Strategy1112### Data Maturity Model1314| Level | Name | Characteristics |15| ----- | ------------------- | ----------------------------------------- |16| 1 | **Ad Hoc** | Manual, inconsistent, siloed |17| 2 | **Opportunistic** | Some automation, point solutions |18| 3 | **Systematic** | Defined processes, governance emerging |19| 4 | **Differentiating** | Data-driven decisions, advanced analytics |20| 5 | **Transformative** | AI-first, competitive advantage |2122### Analytics Value Chain2324```25DATA → INFORMATION → INSIGHT → ACTION → VALUE2627PROGRESSION:28Descriptive: What happened?29Diagnostic: Why did it happen?30Predictive: What will happen?31Prescriptive: What should we do?32Autonomous: Self-optimizing systems33```3435## Statistical Analysis3637### Descriptive Statistics3839```40CENTRAL TENDENCY:41- Mean: Sum / Count (sensitive to outliers)42- Median: Middle value (robust to outliers)43- Mode: Most frequent value4445DISPERSION:46- Range: Max - Min47- Variance: Average squared deviation48- Standard Deviation: √Variance49- IQR: Q3 - Q1 (robust)5051DISTRIBUTION SHAPE:52- Skewness: Asymmetry (0 = symmetric)53- Kurtosis: Tail heaviness (3 = normal)54```5556For detailed inferential statistics and hypothesis testing, see [Statistical Methods Reference](references/statistical-methods.md).5758## Machine Learning5960### Algorithm Selection6162| Task | Algorithms | When to Use |63| ---------------------------- | ------------------------------------------------------------ | -------------------------------- |64| **Classification** | Logistic Regression, Random Forest, XGBoost, Neural Networks | Categorical outcomes |65| **Regression** | Linear Regression, Ridge/Lasso, Random Forest, XGBoost | Continuous outcomes |66| **Clustering** | K-Means, Hierarchical, DBSCAN | Group discovery |67| **Dimensionality Reduction** | PCA, t-SNE, UMAP | Feature reduction, visualization |68| **Anomaly Detection** | Isolation Forest, One-Class SVM, Autoencoders | Outlier detection |69| **Time Series** | ARIMA, Prophet, LSTM | Sequential data |70| **Recommendation** | Collaborative Filtering, Content-Based, Matrix Factorization | Personalization |71| **NLP** | Transformers, BERT, GPT | Text understanding/generation |7273For detailed ML pipelines, feature engineering, and model monitoring, see [ML Pipelines Reference](references/ml-pipelines.md).7475## Data Governance7677### Data Governance Framework7879```80GOVERNANCE PILLARS:8182POLICIES:83- Data ownership84- Data classification85- Data retention86- Data access87- Data quality standards8889ROLES:90- Data Owner: Accountable for data domain91- Data Steward: Day-to-day quality management92- Data Custodian: Technical implementation93- Data Consumer: End user9495PROCESSES:96- Data cataloging97- Metadata management98- Data lineage99- Issue resolution100- Change management101102METRICS:103- Data quality scores104- Policy compliance105- Data access requests106- Issue resolution time107```108109### Data Quality Dimensions110111| Dimension | Definition | Measurement |112| ---------------- | --------------------------------- | ------------------------- |113| **Accuracy** | Correct representation of reality | % records matching source |114| **Completeness** | All required data present | % non-null values |115| **Consistency** | Same across systems | % matching across sources |116| **Timeliness** | Available when needed | Latency, freshness |117| **Validity** | Conforms to format/rules | % passing validation |118| **Uniqueness** | No unwanted duplicates | Duplicate rate |119120## Business Intelligence121122### BI Architecture123124```125ARCHITECTURE LAYERS:126127DATA SOURCES:128- Operational systems129- External data130- IoT/streaming131132DATA INTEGRATION:133- ETL/ELT pipelines134- Data lakes135- Data warehouses136137SEMANTIC LAYER:138- Business definitions139- Calculated metrics140- Hierarchies141- Relationships142143PRESENTATION:144- Dashboards145- Reports146- Ad-hoc analysis147- Embedded analytics148```149150### Dashboard Design Principles151152```153DESIGN PRINCIPLES:154155PURPOSE:156- One clear objective per dashboard157- Know your audience158- Enable decisions159160LAYOUT:161- Most important top-left162- Related items grouped163- Progressive disclosure164- Whitespace for clarity165166VISUALS:167- Right chart for data type168- Consistent formatting169- Minimal decoration170- Color with purpose171172INTERACTIVITY:173- Filters for exploration174- Drill-down capability175- Cross-filtering176- Tooltip details177```178179### Metric Design180181```182METRIC DEFINITION TEMPLATE:183184NAME: [Metric name]185DEFINITION: [Clear business definition]186FORMULA: [Precise calculation]187OWNER: [Responsible person]188DATA SOURCE: [Where it comes from]189GRAIN: [Level of detail]190FREQUENCY: [Update cadence]191DIMENSIONS: [Slicing attributes]192TARGETS: [Goals/benchmarks]193RELATED: [Related metrics]194```195196## Predictive Modeling197198### Use Case Framework199200| Use Case | Business Application | Approach |201| ------------------------- | -------------------- | ----------------------- |202| **Churn Prediction** | Retention programs | Classification |203| **Demand Forecasting** | Inventory planning | Time series |204| **Lead Scoring** | Sales prioritization | Classification |205| **Price Optimization** | Revenue management | Regression/RL |206| **Fraud Detection** | Risk mitigation | Anomaly detection |207| **Recommendation** | Personalization | Collaborative filtering |208| **Customer Segmentation** | Marketing targeting | Clustering |209| **Lifetime Value** | Customer investment | Regression |210211## Data Ethics & Privacy212213### Ethical AI Framework214215```216PRINCIPLES:217218FAIRNESS:219- No discriminatory outcomes220- Bias testing across groups221- Regular auditing222223ACCOUNTABILITY:224- Clear ownership225- Decision audit trails226- Escalation process227228TRANSPARENCY:229- Explainable decisions230- Clear documentation231- User communication232233PRIVACY:234- Data minimization235- Consent management236- Security controls237```238239### Bias Detection240241```242BIAS TYPES:243244HISTORICAL: Reflects past discrimination245REPRESENTATION: Training data not representative246MEASUREMENT: Proxy variables correlate with protected attributes247AGGREGATION: Single model for diverse populations248EVALUATION: Inappropriate benchmarks249250FAIRNESS METRICS:251- Demographic Parity: Equal positive rates252- Equalized Odds: Equal TPR and FPR253- Individual Fairness: Similar inputs, similar outputs254- Calibration: Equal accuracy across groups255```256257## Analytics Team Structure258259### Team Roles260261| Role | Focus | Skills |262| ---------------------- | -------------------------- | --------------------------- |263| **Data Engineer** | Pipelines, infrastructure | SQL, Python, Spark, Cloud |264| **Data Analyst** | Reporting, ad-hoc analysis | SQL, BI tools, Statistics |265| **Data Scientist** | Modeling, ML | Python/R, ML, Statistics |266| **ML Engineer** | Model deployment | MLOps, Software Engineering |267| **Analytics Engineer** | Data modeling | dbt, SQL, Data Modeling |268269### Operating Models270271| Model | Description | Best For |272| ----------------- | ----------------------------- | ----------------------- |273| **Centralized** | Single analytics team | Consistency, efficiency |274| **Decentralized** | Embedded in business units | Business alignment |275| **Hub & Spoke** | Central CoE + embedded | Balance of both |276| **Federated** | Shared platform, domain teams | Scale with autonomy |277278## References279280- [ML Pipelines Reference](references/ml-pipelines.md) - Detailed ML pipeline, feature engineering, model development281- [Statistical Methods Reference](references/statistical-methods.md) - Inferential statistics, hypothesis testing, evaluation metrics282283## See Also284285- [Fortune 50 Product Management](../fortune50-product-management/SKILL.md)286- [Fortune 50 Business Strategy](../fortune50-business-strategy/SKILL.md)287- [Fortune 50 Finance](../fortune50-finance/SKILL.md)288289---290> Converted and distributed by [TomeVault](https://tomevault.io/claim/travisjneuman) — claim your Tome and manage your conversions.291<!-- tomevault:4.0:skill_md:2026-04-11 -->