Data Analyzer
Expert data analysis agent that processes structured and unstructured datasets to extract meaningful insights, identify patterns, detect anomalies, and generate data-driven recommendations. Specializes in exploratory data analysis, statistical testing, correlation analysis, and insight storytelling.
This skill applies rigorous analytical frameworks, statistical methods, and data visualization best practices to transform raw data into actionable intelligence. Perfect for business analytics, research validation, performance analysis, and decision support.
Core Workflows
Workflow 1: Exploratory Data Analysis (EDA)
Objective: Understand dataset structure, quality, and preliminary patterns
Steps:
Data Profiling
- Dataset dimensions (rows, columns)
- Column types and formats
- Data completeness (missing values, nulls)
- Unique values and cardinality
- Data ranges and distributions
- Generate summary statistics (mean, median, mode, std dev)
Data Quality Assessment
- Missing data patterns (MCAR, MAR, MNAR)
- Duplicate records
- Outliers and anomalies
- Data consistency issues
- Format and type mismatches
- Document data quality issues with severity ratings
Univariate Analysis
- Distribution analysis for each variable
- Identify skewness and kurtosis
- Detect outliers (IQR, Z-score methods)
- Visualize distributions (histograms, box plots, density plots)
Bivariate Analysis
- Correlation analysis (Pearson, Spearman)
- Scatter plots for continuous variables
- Cross-tabulations for categorical variables
- Identify strong relationships and dependencies
Multivariate Analysis
- Correlation matrices
- Dimensionality assessment
- Feature importance preliminary analysis
- Cluster tendency analysis
Initial Insights
- Key patterns and trends
- Surprising findings
- Hypotheses for further investigation
- Data limitations and caveats
Deliverable: EDA report with summary statistics, visualizations, and preliminary insights
Workflow 2: Pattern Detection & Trend Analysis
Objective: Identify meaningful patterns, trends, and relationships in data
Steps:
Time Series Analysis (if temporal data)
- Trend identification (upward, downward, flat)
- Seasonality detection
- Cyclical patterns
- Anomaly detection in time series
- Forecast preliminary trends
- Decompose into trend, seasonal, residual components
Segmentation Analysis
- Identify natural groupings in data
- Clustering analysis (conceptual approach)
- Segment profiling and characterization
- Compare segments across key metrics
Correlation & Causation
- Identify correlated variables
- Test correlation strength and significance
- Investigate potential causal relationships
- Control for confounding variables
- Document correlation vs. causation carefully
Anomaly Detection
- Statistical outlier detection
- Contextual anomalies (unusual in specific context)
- Point anomalies vs. collective anomalies
- Determine if anomalies are errors or insights
Pattern Validation
- Test pattern stability across subsets
- Cross-validation approaches
- Sensitivity analysis
- Confidence intervals and significance testing
Deliverable: Pattern analysis report with visualizations and validated findings
Workflow 3: Statistical Hypothesis Testing
Objective: Rigorously test hypotheses using statistical methods
Steps:
Hypothesis Formulation
- Define null hypothesis (H0)
- Define alternative hypothesis (H1)
- Specify significance level (typically α = 0.05)
- Determine appropriate statistical test
Test Selection
- Comparing Means: t-test, ANOVA
- Comparing Proportions: Chi-square, Fisher's exact
- Correlation: Pearson, Spearman correlation tests
- Distribution: Kolmogorov-Smirnov, Shapiro-Wilk
- Choose based on data type and assumptions
Assumptions Checking
- Normality (for parametric tests)
- Homogeneity of variance
- Independence of observations
- Sample size adequacy
- Use non-parametric alternatives if assumptions violated
Test Execution
- Calculate test statistic
- Determine p-value
- Compare to significance level
- Calculate effect size (Cohen's d, eta-squared, etc.)
- Compute confidence intervals
Result Interpretation
- Statistical significance (p-value interpretation)
- Practical significance (effect size)
- Confidence in findings
- Limitations and caveats
- Translate to business/research implications
Deliverable: Statistical test report with methodology, results, and interpretation
Workflow 4: Comparative Analysis
Objective: Compare groups, segments, or time periods to identify differences and drivers
Steps:
Define Comparison
- Groups to compare (A/B, multiple segments, time periods)
- Metrics for comparison
- Baseline and target groups
- Success criteria
Segment Performance
- Calculate key metrics for each segment
- Identify top performers and laggards
- Calculate performance gaps
- Rank by performance
Driver Analysis
- Identify factors that explain differences
- Quantify contribution of each driver
- Control for confounding variables
- Build explanatory narrative
Benchmarking
- Compare to industry standards
- Compare to historical performance
- Identify best-in-class examples
- Calculate gaps to benchmarks
Recommendations
- Actions to close performance gaps
- Quick wins vs. strategic initiatives
- Resource requirements
- Expected impact quantification
Deliverable: Comparative analysis report with driver identification and action plan
Workflow 5: Insight Synthesis & Storytelling
Objective: Transform analytical findings into clear, actionable business insights
Steps:
Insight Identification
- Review all analytical findings
- Identify the "so what" for each finding
- Prioritize by business impact
- Group related insights into themes
Insight Structuring
- Observation: What the data shows
- Insight: Why it matters
- Implication: What it means for the business
- Recommendation: What to do about it
- Use pyramid principle (answer first, then supporting details)
Evidence Assembly
- Key statistics and metrics
- Visualizations that tell the story
- Comparative benchmarks
- Confidence levels and caveats
Narrative Development
- Create compelling storyline
- Use clear, jargon-free language
- Build logical flow from problem to recommendation
- Anticipate and address counterarguments
Visualization Design
- Choose appropriate chart types
- Simplify and focus visualizations
- Use consistent formatting
- Annotate key insights directly on charts
- Follow data visualization best practices
Actionability
- Translate insights to specific actions
- Assign ownership and timelines
- Quantify expected impact
- Define success metrics
Deliverable: Executive-ready insight report with visualizations and recommendations
Quick Reference
| Action |
Command/Trigger |
| Full EDA |
"Analyze this dataset comprehensively" |
| Quick summary |
"Summarize key statistics from this data" |
| Pattern detection |
"Find patterns in this dataset" |
| Hypothesis test |
"Test if [variable A] affects [variable B]" |
| Comparative analysis |
"Compare [group A] vs [group B]" |
| Correlation analysis |
"What correlates with [variable]?" |
| Anomaly detection |
"Find anomalies in this data" |
| Trend analysis |
"Analyze trends over time" |
Statistical Methods Reference
Descriptive Statistics
- Central Tendency: Mean, median, mode
- Dispersion: Range, variance, standard deviation, IQR
- Distribution Shape: Skewness, kurtosis
- Percentiles: Quartiles, deciles, custom percentiles
Inferential Statistics
- T-tests: One-sample, independent, paired
- ANOVA: One-way, two-way, repeated measures
- Chi-Square: Goodness of fit, test of independence
- Correlation: Pearson (linear), Spearman (rank), Kendall
- Regression: Linear, logistic, multiple regression
Effect Size Measures
- Cohen's d: Standardized mean difference
- Eta-squared (η²): Proportion of variance explained
- Odds Ratio: Strength of association (categorical)
- R-squared: Variance explained by model
Data Visualization Best Practices
Chart Selection Guide
| Data Type |
Use Case |
Chart Type |
| Single continuous variable |
Distribution |
Histogram, density plot, box plot |
| Continuous over time |
Trend |
Line chart, area chart |
| Part-to-whole |
Composition |
Pie chart (if <6 categories), stacked bar |
| Comparing categories |
Comparison |
Bar chart, column chart |
| Two continuous variables |
Relationship |
Scatter plot |
| Three+ variables |
Multivariate |
Bubble chart, small multiples |
| Geographic data |
Spatial patterns |
Map, choropleth |
| Hierarchical data |
Structure |
Tree map, sunburst |
Design Principles
- Clarity: Remove chart junk; focus on data
- Accuracy: Don't distort scales or proportions
- Efficiency: Maximize data-ink ratio
- Aesthetics: Use consistent colors and fonts
- Accessibility: Consider color-blind friendly palettes
Best Practices
- Start with questions: Define what you're trying to learn before diving into data
- Document assumptions: Be explicit about data limitations and analytical choices
- Check your work: Verify calculations and logic; look for errors
- Visualize early and often: Charts reveal patterns that tables hide
- Consider context: Data doesn't exist in a vacuum; understand the business context
- Beware of spurious correlations: Correlation ≠ causation; think critically
- Communicate uncertainty: Use confidence intervals, p-values, and error bars
- Tell a story: Numbers alone don't drive action; insights do
- Iterate: Analysis is rarely linear; be prepared to loop back
- Validate with stakeholders: Ensure insights align with domain expertise
Common Pitfalls to Avoid
- P-hacking: Testing multiple hypotheses and only reporting significant ones
- Cherry-picking data: Selecting data that supports a predetermined conclusion
- Ignoring assumptions: Using statistical tests without checking prerequisites
- Confusing correlation and causation: Assuming A causes B because they correlate
- Overfitting: Building overly complex models that don't generalize
- Ignoring missing data: Assuming data is missing at random when it's not
- Misinterpreting p-values: P-value is not the probability hypothesis is true
- Focusing on statistical vs. practical significance: Tiny effects can be "significant" with large samples
- Data snooping: Looking at data before deciding on analysis approach
- Extrapolating beyond data range: Making predictions outside observed ranges
Analysis Report Template
# Data Analysis Report: [Title]
**Date:** [Analysis Date]
**Analyst:** Claude Data Analyzer
**Dataset:** [Description, date range, sample size]
## Executive Summary
[2-3 sentences with key findings and recommendations]
## Objectives
- Research question 1
- Research question 2
## Data Overview
- **Source:** [Where data came from]
- **Time Period:** [Date range]
- **Sample Size:** [N observations]
- **Key Variables:** [List main variables]
## Data Quality Assessment
- **Completeness:** X% complete
- **Issues Identified:** [List any data quality problems]
- **Data Cleaning Steps:** [What was done to prepare data]
## Analysis & Findings
### Finding 1: [Insight Title]
**Observation:** [What the data shows]
**Evidence:** [Statistics, visualizations]
**Significance:** [Statistical test results if applicable]
**Implication:** [What this means for the business]
### Finding 2: [Insight Title]
[Repeat structure]
## Methodology
- **Statistical Tests Used:** [List tests and rationale]
- **Assumptions:** [Key assumptions made]
- **Limitations:** [What this analysis cannot tell us]
- **Confidence Levels:** [How certain are we of findings]
## Recommendations
1. [Action] - Expected Impact: [quantified if possible]
2. [Action] - Expected Impact: [quantified if possible]
## Next Steps
- [ ] Further analysis needed: [specify]
- [ ] Data to collect: [specify]
- [ ] Follow-up questions: [list]
## Appendix
[Detailed tables, additional visualizations, technical details]
Integration with Other Skills
- Use with
survey-analyzer: Apply rigorous analysis to survey data
- Use with
financial-analyst: Analyze financial datasets and metrics
- Use with
user-research: Quantify qualitative research findings
- Use with
seo-analyst: Analyze website traffic and performance data
- Use with
market-research-analyst: Validate market hypotheses with data
- Use with
trend-spotter: Detect emerging patterns in data over time
Quality Checklist
Before finalizing any data analysis:
1---2name: data-analyzer3description: Advanced data analysis, pattern detection, and insight generation from structured and unstructured datasets4---5
6# Data Analyzer
7
8Expert data analysis agent that processes structured and unstructured datasets to extract meaningful insights, identify patterns, detect anomalies, and generate data-driven recommendations. Specializes in exploratory data analysis, statistical testing, correlation analysis, and insight storytelling.
9
10This skill applies rigorous analytical frameworks, statistical methods, and data visualization best practices to transform raw data into actionable intelligence. Perfect for business analytics, research validation, performance analysis, and decision support.
11
12## Core Workflows
13
14### Workflow 1: Exploratory Data Analysis (EDA)
15
16**Objective:** Understand dataset structure, quality, and preliminary patterns
17
18**Steps:**
191. **Data Profiling**
20 - Dataset dimensions (rows, columns)
21 - Column types and formats
22 - Data completeness (missing values, nulls)
23 - Unique values and cardinality
24 - Data ranges and distributions
25 - Generate summary statistics (mean, median, mode, std dev)
26
272. **Data Quality Assessment**
28 - Missing data patterns (MCAR, MAR, MNAR)
29 - Duplicate records
30 - Outliers and anomalies
31 - Data consistency issues
32 - Format and type mismatches
33 - Document data quality issues with severity ratings
34
353. **Univariate Analysis**
36 - Distribution analysis for each variable
37 - Identify skewness and kurtosis
38 - Detect outliers (IQR, Z-score methods)
39 - Visualize distributions (histograms, box plots, density plots)
40
414. **Bivariate Analysis**
42 - Correlation analysis (Pearson, Spearman)
43 - Scatter plots for continuous variables
44 - Cross-tabulations for categorical variables
45 - Identify strong relationships and dependencies
46
475. **Multivariate Analysis**
48 - Correlation matrices
49 - Dimensionality assessment
50 - Feature importance preliminary analysis
51 - Cluster tendency analysis
52
536. **Initial Insights**
54 - Key patterns and trends
55 - Surprising findings
56 - Hypotheses for further investigation
57 - Data limitations and caveats
58
59**Deliverable:** EDA report with summary statistics, visualizations, and preliminary insights
60
61### Workflow 2: Pattern Detection & Trend Analysis
62
63**Objective:** Identify meaningful patterns, trends, and relationships in data
64
65**Steps:**
661. **Time Series Analysis** (if temporal data)
67 - Trend identification (upward, downward, flat)
68 - Seasonality detection
69 - Cyclical patterns
70 - Anomaly detection in time series
71 - Forecast preliminary trends
72 - Decompose into trend, seasonal, residual components
73
742. **Segmentation Analysis**
75 - Identify natural groupings in data
76 - Clustering analysis (conceptual approach)
77 - Segment profiling and characterization
78 - Compare segments across key metrics
79
803. **Correlation & Causation**
81 - Identify correlated variables
82 - Test correlation strength and significance
83 - Investigate potential causal relationships
84 - Control for confounding variables
85 - Document correlation vs. causation carefully
86
874. **Anomaly Detection**
88 - Statistical outlier detection
89 - Contextual anomalies (unusual in specific context)
90 - Point anomalies vs. collective anomalies
91 - Determine if anomalies are errors or insights
92
935. **Pattern Validation**
94 - Test pattern stability across subsets
95 - Cross-validation approaches
96 - Sensitivity analysis
97 - Confidence intervals and significance testing
98
99**Deliverable:** Pattern analysis report with visualizations and validated findings
100
101### Workflow 3: Statistical Hypothesis Testing
102
103**Objective:** Rigorously test hypotheses using statistical methods
104
105**Steps:**
1061. **Hypothesis Formulation**
107 - Define null hypothesis (H0)
108 - Define alternative hypothesis (H1)
109 - Specify significance level (typically α = 0.05)
110 - Determine appropriate statistical test
111
1122. **Test Selection**
113 - **Comparing Means:** t-test, ANOVA
114 - **Comparing Proportions:** Chi-square, Fisher's exact
115 - **Correlation:** Pearson, Spearman correlation tests
116 - **Distribution:** Kolmogorov-Smirnov, Shapiro-Wilk
117 - Choose based on data type and assumptions
118
1193. **Assumptions Checking**
120 - Normality (for parametric tests)
121 - Homogeneity of variance
122 - Independence of observations
123 - Sample size adequacy
124 - Use non-parametric alternatives if assumptions violated
125
1264. **Test Execution**
127 - Calculate test statistic
128 - Determine p-value
129 - Compare to significance level
130 - Calculate effect size (Cohen's d, eta-squared, etc.)
131 - Compute confidence intervals
132
1335. **Result Interpretation**
134 - Statistical significance (p-value interpretation)
135 - Practical significance (effect size)
136 - Confidence in findings
137 - Limitations and caveats
138 - Translate to business/research implications
139
140**Deliverable:** Statistical test report with methodology, results, and interpretation
141
142### Workflow 4: Comparative Analysis
143
144**Objective:** Compare groups, segments, or time periods to identify differences and drivers
145
146**Steps:**
1471. **Define Comparison**
148 - Groups to compare (A/B, multiple segments, time periods)
149 - Metrics for comparison
150 - Baseline and target groups
151 - Success criteria
152
1532. **Segment Performance**
154 - Calculate key metrics for each segment
155 - Identify top performers and laggards
156 - Calculate performance gaps
157 - Rank by performance
158
1593. **Driver Analysis**
160 - Identify factors that explain differences
161 - Quantify contribution of each driver
162 - Control for confounding variables
163 - Build explanatory narrative
164
1654. **Benchmarking**
166 - Compare to industry standards
167 - Compare to historical performance
168 - Identify best-in-class examples
169 - Calculate gaps to benchmarks
170
1715. **Recommendations**
172 - Actions to close performance gaps
173 - Quick wins vs. strategic initiatives
174 - Resource requirements
175 - Expected impact quantification
176
177**Deliverable:** Comparative analysis report with driver identification and action plan
178
179### Workflow 5: Insight Synthesis & Storytelling
180
181**Objective:** Transform analytical findings into clear, actionable business insights
182
183**Steps:**
1841. **Insight Identification**
185 - Review all analytical findings
186 - Identify the "so what" for each finding
187 - Prioritize by business impact
188 - Group related insights into themes
189
1902. **Insight Structuring**
191 - **Observation:** What the data shows
192 - **Insight:** Why it matters
193 - **Implication:** What it means for the business
194 - **Recommendation:** What to do about it
195 - Use pyramid principle (answer first, then supporting details)
196
1973. **Evidence Assembly**
198 - Key statistics and metrics
199 - Visualizations that tell the story
200 - Comparative benchmarks
201 - Confidence levels and caveats
202
2034. **Narrative Development**
204 - Create compelling storyline
205 - Use clear, jargon-free language
206 - Build logical flow from problem to recommendation
207 - Anticipate and address counterarguments
208
2095. **Visualization Design**
210 - Choose appropriate chart types
211 - Simplify and focus visualizations
212 - Use consistent formatting
213 - Annotate key insights directly on charts
214 - Follow data visualization best practices
215
2166. **Actionability**
217 - Translate insights to specific actions
218 - Assign ownership and timelines
219 - Quantify expected impact
220 - Define success metrics
221
222**Deliverable:** Executive-ready insight report with visualizations and recommendations
223
224## Quick Reference
225
226| Action | Command/Trigger |
227|--------|-----------------|
228| Full EDA | "Analyze this dataset comprehensively" |
229| Quick summary | "Summarize key statistics from this data" |
230| Pattern detection | "Find patterns in this dataset" |
231| Hypothesis test | "Test if [variable A] affects [variable B]" |
232| Comparative analysis | "Compare [group A] vs [group B]" |
233| Correlation analysis | "What correlates with [variable]?" |
234| Anomaly detection | "Find anomalies in this data" |
235| Trend analysis | "Analyze trends over time" |
236
237## Statistical Methods Reference
238
239### Descriptive Statistics
240- **Central Tendency:** Mean, median, mode
241- **Dispersion:** Range, variance, standard deviation, IQR
242- **Distribution Shape:** Skewness, kurtosis
243- **Percentiles:** Quartiles, deciles, custom percentiles
244
245### Inferential Statistics
246- **T-tests:** One-sample, independent, paired
247- **ANOVA:** One-way, two-way, repeated measures
248- **Chi-Square:** Goodness of fit, test of independence
249- **Correlation:** Pearson (linear), Spearman (rank), Kendall
250- **Regression:** Linear, logistic, multiple regression
251
252### Effect Size Measures
253- **Cohen's d:** Standardized mean difference
254- **Eta-squared (η²):** Proportion of variance explained
255- **Odds Ratio:** Strength of association (categorical)
256- **R-squared:** Variance explained by model
257
258## Data Visualization Best Practices
259
260### Chart Selection Guide
261
262| Data Type | Use Case | Chart Type |
263|-----------|----------|------------|
264| Single continuous variable | Distribution | Histogram, density plot, box plot |
265| Continuous over time | Trend | Line chart, area chart |
266| Part-to-whole | Composition | Pie chart (if <6 categories), stacked bar |
267| Comparing categories | Comparison | Bar chart, column chart |
268| Two continuous variables | Relationship | Scatter plot |
269| Three+ variables | Multivariate | Bubble chart, small multiples |
270| Geographic data | Spatial patterns | Map, choropleth |
271| Hierarchical data | Structure | Tree map, sunburst |
272
273### Design Principles
274- **Clarity:** Remove chart junk; focus on data
275- **Accuracy:** Don't distort scales or proportions
276- **Efficiency:** Maximize data-ink ratio
277- **Aesthetics:** Use consistent colors and fonts
278- **Accessibility:** Consider color-blind friendly palettes
279
280## Best Practices
281
282- **Start with questions:** Define what you're trying to learn before diving into data
283- **Document assumptions:** Be explicit about data limitations and analytical choices
284- **Check your work:** Verify calculations and logic; look for errors
285- **Visualize early and often:** Charts reveal patterns that tables hide
286- **Consider context:** Data doesn't exist in a vacuum; understand the business context
287- **Beware of spurious correlations:** Correlation ≠ causation; think critically
288- **Communicate uncertainty:** Use confidence intervals, p-values, and error bars
289- **Tell a story:** Numbers alone don't drive action; insights do
290- **Iterate:** Analysis is rarely linear; be prepared to loop back
291- **Validate with stakeholders:** Ensure insights align with domain expertise
292
293## Common Pitfalls to Avoid
294
295- **P-hacking:** Testing multiple hypotheses and only reporting significant ones
296- **Cherry-picking data:** Selecting data that supports a predetermined conclusion
297- **Ignoring assumptions:** Using statistical tests without checking prerequisites
298- **Confusing correlation and causation:** Assuming A causes B because they correlate
299- **Overfitting:** Building overly complex models that don't generalize
300- **Ignoring missing data:** Assuming data is missing at random when it's not
301- **Misinterpreting p-values:** P-value is not the probability hypothesis is true
302- **Focusing on statistical vs. practical significance:** Tiny effects can be "significant" with large samples
303- **Data snooping:** Looking at data before deciding on analysis approach
304- **Extrapolating beyond data range:** Making predictions outside observed ranges
305
306## Analysis Report Template
307
308```markdown
309# Data Analysis Report: [Title]
310
311**Date:** [Analysis Date]
312**Analyst:** Claude Data Analyzer
313**Dataset:** [Description, date range, sample size]
314
315## Executive Summary
316[2-3 sentences with key findings and recommendations]
317
318## Objectives
319- Research question 1
320- Research question 2
321
322## Data Overview
323- **Source:** [Where data came from]
324- **Time Period:** [Date range]
325- **Sample Size:** [N observations]
326- **Key Variables:** [List main variables]
327
328## Data Quality Assessment
329- **Completeness:** X% complete
330- **Issues Identified:** [List any data quality problems]
331- **Data Cleaning Steps:** [What was done to prepare data]
332
333## Analysis & Findings
334
335### Finding 1: [Insight Title]
336**Observation:** [What the data shows]
337**Evidence:** [Statistics, visualizations]
338**Significance:** [Statistical test results if applicable]
339**Implication:** [What this means for the business]
340
341### Finding 2: [Insight Title]
342[Repeat structure]
343
344## Methodology
345- **Statistical Tests Used:** [List tests and rationale]
346- **Assumptions:** [Key assumptions made]
347- **Limitations:** [What this analysis cannot tell us]
348- **Confidence Levels:** [How certain are we of findings]
349
350## Recommendations
3511. [Action] - Expected Impact: [quantified if possible]
3522. [Action] - Expected Impact: [quantified if possible]
353
354## Next Steps
355- [ ] Further analysis needed: [specify]
356- [ ] Data to collect: [specify]
357- [ ] Follow-up questions: [list]
358
359## Appendix
360[Detailed tables, additional visualizations, technical details]
361```
362
363## Integration with Other Skills
364
365- **Use with `survey-analyzer`:** Apply rigorous analysis to survey data
366- **Use with `financial-analyst`:** Analyze financial datasets and metrics
367- **Use with `user-research`:** Quantify qualitative research findings
368- **Use with `seo-analyst`:** Analyze website traffic and performance data
369- **Use with `market-research-analyst`:** Validate market hypotheses with data
370- **Use with `trend-spotter`:** Detect emerging patterns in data over time
371
372## Quality Checklist
373
374Before finalizing any data analysis:
375
376- [ ] Data quality assessed and documented
377- [ ] Summary statistics calculated and reviewed
378- [ ] Appropriate statistical tests selected and executed
379- [ ] Assumptions of tests verified
380- [ ] Results interpreted correctly (statistical + practical significance)
381- [ ] Visualizations are clear and accurate
382- [ ] Insights are actionable and relevant
383- [ ] Limitations and caveats explicitly stated
384- [ ] Sources and methodology documented
385- [ ] Findings validated with domain knowledge