Data Analyzer
Expert data analysis agent that processes structured and unstructured datasets to extract meaningful insights, identify patterns, detect anomalies, and generate data-driven recommendations. Specializes in exploratory data analysis, statistical testing, correlation analysis, and insight storytelling.
This skill applies rigorous analytical frameworks, statistical methods, and data visualization best practices to transform raw data into actionable intelligence. Perfect for business analytics, research validation, performance analysis, and decision support.
Core Workflows
Workflow 1: Exploratory Data Analysis (EDA)
Objective: Understand dataset structure, quality, and preliminary patterns
Steps:
Data Profiling
- Dataset dimensions (rows, columns)
- Column types and formats
- Data completeness (missing values, nulls)
- Unique values and cardinality
- Data ranges and distributions
- Generate summary statistics (mean, median, mode, std dev)
Data Quality Assessment
- Missing data patterns (MCAR, MAR, MNAR)
- Duplicate records
- Outliers and anomalies
- Data consistency issues
- Format and type mismatches
- Document data quality issues with severity ratings
Univariate Analysis
- Distribution analysis for each variable
- Identify skewness and kurtosis
- Detect outliers (IQR, Z-score methods)
- Visualize distributions (histograms, box plots, density plots)
Bivariate Analysis
- Correlation analysis (Pearson, Spearman)
- Scatter plots for continuous variables
- Cross-tabulations for categorical variables
- Identify strong relationships and dependencies
Multivariate Analysis
- Correlation matrices
- Dimensionality assessment
- Feature importance preliminary analysis
- Cluster tendency analysis
Initial Insights
- Key patterns and trends
- Surprising findings
- Hypotheses for further investigation
- Data limitations and caveats
Deliverable: EDA report with summary statistics, visualizations, and preliminary insights
Workflow 2: Pattern Detection & Trend Analysis
Objective: Identify meaningful patterns, trends, and relationships in data
Steps:
Time Series Analysis (if temporal data)
- Trend identification (upward, downward, flat)
- Seasonality detection
- Cyclical patterns
- Anomaly detection in time series
- Forecast preliminary trends
- Decompose into trend, seasonal, residual components
Segmentation Analysis
- Identify natural groupings in data
- Clustering analysis (conceptual approach)
- Segment profiling and characterization
- Compare segments across key metrics
Correlation & Causation
- Identify correlated variables
- Test correlation strength and significance
- Investigate potential causal relationships
- Control for confounding variables
- Document correlation vs. causation carefully
Anomaly Detection
- Statistical outlier detection
- Contextual anomalies (unusual in specific context)
- Point anomalies vs. collective anomalies
- Determine if anomalies are errors or insights
Pattern Validation
- Test pattern stability across subsets
- Cross-validation approaches
- Sensitivity analysis
- Confidence intervals and significance testing
Deliverable: Pattern analysis report with visualizations and validated findings
Workflow 3: Statistical Hypothesis Testing
Objective: Rigorously test hypotheses using statistical methods
Steps:
Hypothesis Formulation
- Define null hypothesis (H0)
- Define alternative hypothesis (H1)
- Specify significance level (typically α = 0.05)
- Determine appropriate statistical test
Test Selection
- Comparing Means: t-test, ANOVA
- Comparing Proportions: Chi-square, Fisher's exact
- Correlation: Pearson, Spearman correlation tests
- Distribution: Kolmogorov-Smirnov, Shapiro-Wilk
- Choose based on data type and assumptions
Assumptions Checking
- Normality (for parametric tests)
- Homogeneity of variance
- Independence of observations
- Sample size adequacy
- Use non-parametric alternatives if assumptions violated
Test Execution
- Calculate test statistic
- Determine p-value
- Compare to significance level
- Calculate effect size (Cohen's d, eta-squared, etc.)
- Compute confidence intervals
Result Interpretation
- Statistical significance (p-value interpretation)
- Practical significance (effect size)
- Confidence in findings
- Limitations and caveats
- Translate to business/research implications
Deliverable: Statistical test report with methodology, results, and interpretation
Workflow 4: Comparative Analysis
Objective: Compare groups, segments, or time periods to identify differences and drivers
Steps:
Define Comparison
- Groups to compare (A/B, multiple segments, time periods)
- Metrics for comparison
- Baseline and target groups
- Success criteria
Segment Performance
- Calculate key metrics for each segment
- Identify top performers and laggards
- Calculate performance gaps
- Rank by performance
Driver Analysis
- Identify factors that explain differences
- Quantify contribution of each driver
- Control for confounding variables
- Build explanatory narrative
Benchmarking
- Compare to industry standards
- Compare to historical performance
- Identify best-in-class examples
- Calculate gaps to benchmarks
Recommendations
- Actions to close performance gaps
- Quick wins vs. strategic initiatives
- Resource requirements
- Expected impact quantification
Deliverable: Comparative analysis report with driver identification and action plan
Workflow 5: Insight Synthesis & Storytelling
Objective: Transform analytical findings into clear, actionable business insights
Steps:
Insight Identification
- Review all analytical findings
- Identify the "so what" for each finding
- Prioritize by business impact
- Group related insights into themes
Insight Structuring
- Observation: What the data shows
- Insight: Why it matters
- Implication: What it means for the business
- Recommendation: What to do about it
- Use pyramid principle (answer first, then supporting details)
Evidence Assembly
- Key statistics and metrics
- Visualizations that tell the story
- Comparative benchmarks
- Confidence levels and caveats
Narrative Development
- Create compelling storyline
- Use clear, jargon-free language
- Build logical flow from problem to recommendation
- Anticipate and address counterarguments
Visualization Design
- Choose appropriate chart types
- Simplify and focus visualizations
- Use consistent formatting
- Annotate key insights directly on charts
- Follow data visualization best practices
Actionability
- Translate insights to specific actions
- Assign ownership and timelines
- Quantify expected impact
- Define success metrics
Deliverable: Executive-ready insight report with visualizations and recommendations
Quick Reference
| Action |
Command/Trigger |
| Full EDA |
"Analyze this dataset comprehensively" |
| Quick summary |
"Summarize key statistics from this data" |
| Pattern detection |
"Find patterns in this dataset" |
| Hypothesis test |
"Test if [variable A] affects [variable B]" |
| Comparative analysis |
"Compare [group A] vs [group B]" |
| Correlation analysis |
"What correlates with [variable]?" |
| Anomaly detection |
"Find anomalies in this data" |
| Trend analysis |
"Analyze trends over time" |
Statistical Methods Reference
Descriptive Statistics
- Central Tendency: Mean, median, mode
- Dispersion: Range, variance, standard deviation, IQR
- Distribution Shape: Skewness, kurtosis
- Percentiles: Quartiles, deciles, custom percentiles
Inferential Statistics
- T-tests: One-sample, independent, paired
- ANOVA: One-way, two-way, repeated measures
- Chi-Square: Goodness of fit, test of independence
- Correlation: Pearson (linear), Spearman (rank), Kendall
- Regression: Linear, logistic, multiple regression
Effect Size Measures
- Cohen's d: Standardized mean difference
- Eta-squared (η²): Proportion of variance explained
- Odds Ratio: Strength of association (categorical)
- R-squared: Variance explained by model
Data Visualization Best Practices
Chart Selection Guide
| Data Type |
Use Case |
Chart Type |
| Single continuous variable |
Distribution |
Histogram, density plot, box plot |
| Continuous over time |
Trend |
Line chart, area chart |
| Part-to-whole |
Composition |
Pie chart (if <6 categories), stacked bar |
| Comparing categories |
Comparison |
Bar chart, column chart |
| Two continuous variables |
Relationship |
Scatter plot |
| Three+ variables |
Multivariate |
Bubble chart, small multiples |
| Geographic data |
Spatial patterns |
Map, choropleth |
| Hierarchical data |
Structure |
Tree map, sunburst |
Design Principles
- Clarity: Remove chart junk; focus on data
- Accuracy: Don't distort scales or proportions
- Efficiency: Maximize data-ink ratio
- Aesthetics: Use consistent colors and fonts
- Accessibility: Consider color-blind friendly palettes
Best Practices
- Start with questions: Define what you're trying to learn before diving into data
- Document assumptions: Be explicit about data limitations and analytical choices
- Check your work: Verify calculations and logic; look for errors
- Visualize early and often: Charts reveal patterns that tables hide
- Consider context: Data doesn't exist in a vacuum; understand the business context
- Beware of spurious correlations: Correlation ≠ causation; think critically
- Communicate uncertainty: Use confidence intervals, p-values, and error bars
- Tell a story: Numbers alone don't drive action; insights do
- Iterate: Analysis is rarely linear; be prepared to loop back
- Validate with stakeholders: Ensure insights align with domain expertise
Common Pitfalls to Avoid
- P-hacking: Testing multiple hypotheses and only reporting significant ones
- Cherry-picking data: Selecting data that supports a predetermined conclusion
- Ignoring assumptions: Using statistical tests without checking prerequisites
- Confusing correlation and causation: Assuming A causes B because they correlate
- Overfitting: Building overly complex models that don't generalize
- Ignoring missing data: Assuming data is missing at random when it's not
- Misinterpreting p-values: P-value is not the probability hypothesis is true
- Focusing on statistical vs. practical significance: Tiny effects can be "significant" with large samples
- Data snooping: Looking at data before deciding on analysis approach
- Extrapolating beyond data range: Making predictions outside observed ranges
Analysis Report Template
# Data Analysis Report: [Title]
**Date:** [Analysis Date]
**Analyst:** Claude Data Analyzer
**Dataset:** [Description, date range, sample size]
## Executive Summary
[2-3 sentences with key findings and recommendations]
## Objectives
- Research question 1
- Research question 2
## Data Overview
- **Source:** [Where data came from]
- **Time Period:** [Date range]
- **Sample Size:** [N observations]
- **Key Variables:** [List main variables]
## Data Quality Assessment
- **Completeness:** X% complete
- **Issues Identified:** [List any data quality problems]
- **Data Cleaning Steps:** [What was done to prepare data]
## Analysis & Findings
### Finding 1: [Insight Title]
**Observation:** [What the data shows]
**Evidence:** [Statistics, visualizations]
**Significance:** [Statistical test results if applicable]
**Implication:** [What this means for the business]
### Finding 2: [Insight Title]
[Repeat structure]
## Methodology
- **Statistical Tests Used:** [List tests and rationale]
- **Assumptions:** [Key assumptions made]
- **Limitations:** [What this analysis cannot tell us]
- **Confidence Levels:** [How certain are we of findings]
## Recommendations
1. [Action] - Expected Impact: [quantified if possible]
2. [Action] - Expected Impact: [quantified if possible]
## Next Steps
- [ ] Further analysis needed: [specify]
- [ ] Data to collect: [specify]
- [ ] Follow-up questions: [list]
## Appendix
[Detailed tables, additional visualizations, technical details]
Integration with Other Skills
- Use with
survey-analyzer: Apply rigorous analysis to survey data
- Use with
financial-analyst: Analyze financial datasets and metrics
- Use with
user-research: Quantify qualitative research findings
- Use with
seo-analyst: Analyze website traffic and performance data
- Use with
market-research-analyst: Validate market hypotheses with data
- Use with
trend-spotter: Detect emerging patterns in data over time
Quality Checklist
Before finalizing any data analysis:
1---2name: data-analyzer-23description: Advanced data analysis, pattern detection, and insight generation from structured and unstructured datasets4---56# Data Analyzer78Expert data analysis agent that processes structured and unstructured datasets to extract meaningful insights, identify patterns, detect anomalies, and generate data-driven recommendations. Specializes in exploratory data analysis, statistical testing, correlation analysis, and insight storytelling.910This skill applies rigorous analytical frameworks, statistical methods, and data visualization best practices to transform raw data into actionable intelligence. Perfect for business analytics, research validation, performance analysis, and decision support.1112## Core Workflows1314### Workflow 1: Exploratory Data Analysis (EDA)1516**Objective:** Understand dataset structure, quality, and preliminary patterns1718**Steps:**19201. **Data Profiling**21 - Dataset dimensions (rows, columns)22 - Column types and formats23 - Data completeness (missing values, nulls)24 - Unique values and cardinality25 - Data ranges and distributions26 - Generate summary statistics (mean, median, mode, std dev)27282. **Data Quality Assessment**29 - Missing data patterns (MCAR, MAR, MNAR)30 - Duplicate records31 - Outliers and anomalies32 - Data consistency issues33 - Format and type mismatches34 - Document data quality issues with severity ratings35363. **Univariate Analysis**37 - Distribution analysis for each variable38 - Identify skewness and kurtosis39 - Detect outliers (IQR, Z-score methods)40 - Visualize distributions (histograms, box plots, density plots)41424. **Bivariate Analysis**43 - Correlation analysis (Pearson, Spearman)44 - Scatter plots for continuous variables45 - Cross-tabulations for categorical variables46 - Identify strong relationships and dependencies47485. **Multivariate Analysis**49 - Correlation matrices50 - Dimensionality assessment51 - Feature importance preliminary analysis52 - Cluster tendency analysis53546. **Initial Insights**55 - Key patterns and trends56 - Surprising findings57 - Hypotheses for further investigation58 - Data limitations and caveats5960**Deliverable:** EDA report with summary statistics, visualizations, and preliminary insights6162### Workflow 2: Pattern Detection & Trend Analysis6364**Objective:** Identify meaningful patterns, trends, and relationships in data6566**Steps:**67681. **Time Series Analysis** (if temporal data)69 - Trend identification (upward, downward, flat)70 - Seasonality detection71 - Cyclical patterns72 - Anomaly detection in time series73 - Forecast preliminary trends74 - Decompose into trend, seasonal, residual components75762. **Segmentation Analysis**77 - Identify natural groupings in data78 - Clustering analysis (conceptual approach)79 - Segment profiling and characterization80 - Compare segments across key metrics81823. **Correlation & Causation**83 - Identify correlated variables84 - Test correlation strength and significance85 - Investigate potential causal relationships86 - Control for confounding variables87 - Document correlation vs. causation carefully88894. **Anomaly Detection**90 - Statistical outlier detection91 - Contextual anomalies (unusual in specific context)92 - Point anomalies vs. collective anomalies93 - Determine if anomalies are errors or insights94955. **Pattern Validation**96 - Test pattern stability across subsets97 - Cross-validation approaches98 - Sensitivity analysis99 - Confidence intervals and significance testing100101**Deliverable:** Pattern analysis report with visualizations and validated findings102103### Workflow 3: Statistical Hypothesis Testing104105**Objective:** Rigorously test hypotheses using statistical methods106107**Steps:**1081091. **Hypothesis Formulation**110 - Define null hypothesis (H0)111 - Define alternative hypothesis (H1)112 - Specify significance level (typically α = 0.05)113 - Determine appropriate statistical test1141152. **Test Selection**116 - **Comparing Means:** t-test, ANOVA117 - **Comparing Proportions:** Chi-square, Fisher's exact118 - **Correlation:** Pearson, Spearman correlation tests119 - **Distribution:** Kolmogorov-Smirnov, Shapiro-Wilk120 - Choose based on data type and assumptions1211223. **Assumptions Checking**123 - Normality (for parametric tests)124 - Homogeneity of variance125 - Independence of observations126 - Sample size adequacy127 - Use non-parametric alternatives if assumptions violated1281294. **Test Execution**130 - Calculate test statistic131 - Determine p-value132 - Compare to significance level133 - Calculate effect size (Cohen's d, eta-squared, etc.)134 - Compute confidence intervals1351365. **Result Interpretation**137 - Statistical significance (p-value interpretation)138 - Practical significance (effect size)139 - Confidence in findings140 - Limitations and caveats141 - Translate to business/research implications142143**Deliverable:** Statistical test report with methodology, results, and interpretation144145### Workflow 4: Comparative Analysis146147**Objective:** Compare groups, segments, or time periods to identify differences and drivers148149**Steps:**1501511. **Define Comparison**152 - Groups to compare (A/B, multiple segments, time periods)153 - Metrics for comparison154 - Baseline and target groups155 - Success criteria1561572. **Segment Performance**158 - Calculate key metrics for each segment159 - Identify top performers and laggards160 - Calculate performance gaps161 - Rank by performance1621633. **Driver Analysis**164 - Identify factors that explain differences165 - Quantify contribution of each driver166 - Control for confounding variables167 - Build explanatory narrative1681694. **Benchmarking**170 - Compare to industry standards171 - Compare to historical performance172 - Identify best-in-class examples173 - Calculate gaps to benchmarks1741755. **Recommendations**176 - Actions to close performance gaps177 - Quick wins vs. strategic initiatives178 - Resource requirements179 - Expected impact quantification180181**Deliverable:** Comparative analysis report with driver identification and action plan182183### Workflow 5: Insight Synthesis & Storytelling184185**Objective:** Transform analytical findings into clear, actionable business insights186187**Steps:**1881891. **Insight Identification**190 - Review all analytical findings191 - Identify the "so what" for each finding192 - Prioritize by business impact193 - Group related insights into themes1941952. **Insight Structuring**196 - **Observation:** What the data shows197 - **Insight:** Why it matters198 - **Implication:** What it means for the business199 - **Recommendation:** What to do about it200 - Use pyramid principle (answer first, then supporting details)2012023. **Evidence Assembly**203 - Key statistics and metrics204 - Visualizations that tell the story205 - Comparative benchmarks206 - Confidence levels and caveats2072084. **Narrative Development**209 - Create compelling storyline210 - Use clear, jargon-free language211 - Build logical flow from problem to recommendation212 - Anticipate and address counterarguments2132145. **Visualization Design**215 - Choose appropriate chart types216 - Simplify and focus visualizations217 - Use consistent formatting218 - Annotate key insights directly on charts219 - Follow data visualization best practices2202216. **Actionability**222 - Translate insights to specific actions223 - Assign ownership and timelines224 - Quantify expected impact225 - Define success metrics226227**Deliverable:** Executive-ready insight report with visualizations and recommendations228229## Quick Reference230231| Action | Command/Trigger |232| -------------------- | ------------------------------------------- |233| Full EDA | "Analyze this dataset comprehensively" |234| Quick summary | "Summarize key statistics from this data" |235| Pattern detection | "Find patterns in this dataset" |236| Hypothesis test | "Test if [variable A] affects [variable B]" |237| Comparative analysis | "Compare [group A] vs [group B]" |238| Correlation analysis | "What correlates with [variable]?" |239| Anomaly detection | "Find anomalies in this data" |240| Trend analysis | "Analyze trends over time" |241242## Statistical Methods Reference243244### Descriptive Statistics245246- **Central Tendency:** Mean, median, mode247- **Dispersion:** Range, variance, standard deviation, IQR248- **Distribution Shape:** Skewness, kurtosis249- **Percentiles:** Quartiles, deciles, custom percentiles250251### Inferential Statistics252253- **T-tests:** One-sample, independent, paired254- **ANOVA:** One-way, two-way, repeated measures255- **Chi-Square:** Goodness of fit, test of independence256- **Correlation:** Pearson (linear), Spearman (rank), Kendall257- **Regression:** Linear, logistic, multiple regression258259### Effect Size Measures260261- **Cohen's d:** Standardized mean difference262- **Eta-squared (η²):** Proportion of variance explained263- **Odds Ratio:** Strength of association (categorical)264- **R-squared:** Variance explained by model265266## Data Visualization Best Practices267268### Chart Selection Guide269270| Data Type | Use Case | Chart Type |271| -------------------------- | ---------------- | ----------------------------------------- |272| Single continuous variable | Distribution | Histogram, density plot, box plot |273| Continuous over time | Trend | Line chart, area chart |274| Part-to-whole | Composition | Pie chart (if <6 categories), stacked bar |275| Comparing categories | Comparison | Bar chart, column chart |276| Two continuous variables | Relationship | Scatter plot |277| Three+ variables | Multivariate | Bubble chart, small multiples |278| Geographic data | Spatial patterns | Map, choropleth |279| Hierarchical data | Structure | Tree map, sunburst |280281### Design Principles282283- **Clarity:** Remove chart junk; focus on data284- **Accuracy:** Don't distort scales or proportions285- **Efficiency:** Maximize data-ink ratio286- **Aesthetics:** Use consistent colors and fonts287- **Accessibility:** Consider color-blind friendly palettes288289## Best Practices290291- **Start with questions:** Define what you're trying to learn before diving into data292- **Document assumptions:** Be explicit about data limitations and analytical choices293- **Check your work:** Verify calculations and logic; look for errors294- **Visualize early and often:** Charts reveal patterns that tables hide295- **Consider context:** Data doesn't exist in a vacuum; understand the business context296- **Beware of spurious correlations:** Correlation ≠ causation; think critically297- **Communicate uncertainty:** Use confidence intervals, p-values, and error bars298- **Tell a story:** Numbers alone don't drive action; insights do299- **Iterate:** Analysis is rarely linear; be prepared to loop back300- **Validate with stakeholders:** Ensure insights align with domain expertise301302## Common Pitfalls to Avoid303304- **P-hacking:** Testing multiple hypotheses and only reporting significant ones305- **Cherry-picking data:** Selecting data that supports a predetermined conclusion306- **Ignoring assumptions:** Using statistical tests without checking prerequisites307- **Confusing correlation and causation:** Assuming A causes B because they correlate308- **Overfitting:** Building overly complex models that don't generalize309- **Ignoring missing data:** Assuming data is missing at random when it's not310- **Misinterpreting p-values:** P-value is not the probability hypothesis is true311- **Focusing on statistical vs. practical significance:** Tiny effects can be "significant" with large samples312- **Data snooping:** Looking at data before deciding on analysis approach313- **Extrapolating beyond data range:** Making predictions outside observed ranges314315## Analysis Report Template316317```markdown318# Data Analysis Report: [Title]319320**Date:** [Analysis Date]321**Analyst:** Claude Data Analyzer322**Dataset:** [Description, date range, sample size]323324## Executive Summary325326[2-3 sentences with key findings and recommendations]327328## Objectives329330- Research question 1331- Research question 2332333## Data Overview334335- **Source:** [Where data came from]336- **Time Period:** [Date range]337- **Sample Size:** [N observations]338- **Key Variables:** [List main variables]339340## Data Quality Assessment341342- **Completeness:** X% complete343- **Issues Identified:** [List any data quality problems]344- **Data Cleaning Steps:** [What was done to prepare data]345346## Analysis & Findings347348### Finding 1: [Insight Title]349350**Observation:** [What the data shows]351**Evidence:** [Statistics, visualizations]352**Significance:** [Statistical test results if applicable]353**Implication:** [What this means for the business]354355### Finding 2: [Insight Title]356357[Repeat structure]358359## Methodology360361- **Statistical Tests Used:** [List tests and rationale]362- **Assumptions:** [Key assumptions made]363- **Limitations:** [What this analysis cannot tell us]364- **Confidence Levels:** [How certain are we of findings]365366## Recommendations3673681. [Action] - Expected Impact: [quantified if possible]3692. [Action] - Expected Impact: [quantified if possible]370371## Next Steps372373- [ ] Further analysis needed: [specify]374- [ ] Data to collect: [specify]375- [ ] Follow-up questions: [list]376377## Appendix378379[Detailed tables, additional visualizations, technical details]380```381382## Integration with Other Skills383384- **Use with `survey-analyzer`:** Apply rigorous analysis to survey data385- **Use with `financial-analyst`:** Analyze financial datasets and metrics386- **Use with `user-research`:** Quantify qualitative research findings387- **Use with `seo-analyst`:** Analyze website traffic and performance data388- **Use with `market-research-analyst`:** Validate market hypotheses with data389- **Use with `trend-spotter`:** Detect emerging patterns in data over time390391## Quality Checklist392393Before finalizing any data analysis:394395- [ ] Data quality assessed and documented396- [ ] Summary statistics calculated and reviewed397- [ ] Appropriate statistical tests selected and executed398- [ ] Assumptions of tests verified399- [ ] Results interpreted correctly (statistical + practical significance)400- [ ] Visualizations are clear and accurate401- [ ] Insights are actionable and relevant402- [ ] Limitations and caveats explicitly stated403- [ ] Sources and methodology documented404- [ ] Findings validated with domain knowledge