What I do
- Explore datasets to understand structure
- Identify patterns and relationships
- Detect anomalies and outliers
- Generate summary statistics
- Create visualizations for data understanding
- Form and test hypotheses
- Guide feature selection for modeling
When to use me
Use me when:
- Starting a new data analysis project
- Understanding data before modeling
- Identifying data quality issues
- Discovering patterns in data
- Preparing for feature engineering
Key Concepts
EDA Process
- Data Collection: Load and understand data
- Data Description: Summary statistics
- Data Cleaning: Handle missing, outliers
- Univariate Analysis: Single variable patterns
- Bivariate Analysis: Relationships between variables
- Multivariate Analysis: Complex relationships
Python EDA Example
import pandas as pd
import numpy as np
import seaborn as sns
import matplotlib.pyplot as plt
# Load data
df = pd.read_csv("data.csv")
# Basic statistics
print(df.describe())
print(df.dtypes)
print(df.isnull().sum())
# Distribution analysis
fig, axes = plt.subplots(2, 2, figsize=(12, 10))
# Histogram
sns.histplot(df["age"], kde=True, ax=axes[0, 0])
# Box plot for outliers
sns.boxplot(x="income", y="education", data=df, ax=axes[0, 1])
# Correlation heatmap
corr = df.select_dtypes(include=[np.number]).corr()
sns.heatmap(corr, annot=True, cmap="coolwarm", ax=axes[1, 0])
# Scatter with regression
sns.regplot(x="age", y="income", data=df, ax=axes[1, 1])
plt.tight_layout()
plt.show()
# Categorical analysis
print(df["category"].value_counts())
print(pd.crosstab(df["category"], df["outcome"]))
Key Metrics
- Central tendency: Mean, median, mode
- Spread: Std dev, variance, IQR
- Shape: Skewness, kurtosis
- Correlation: Pearson, Spearman
1---2name: eda3description: Exploratory data analysis4license: MIT5---67## What I do89- Explore datasets to understand structure10- Identify patterns and relationships11- Detect anomalies and outliers12- Generate summary statistics13- Create visualizations for data understanding14- Form and test hypotheses15- Guide feature selection for modeling1617## When to use me1819Use me when:20- Starting a new data analysis project21- Understanding data before modeling22- Identifying data quality issues23- Discovering patterns in data24- Preparing for feature engineering2526## Key Concepts2728### EDA Process291. **Data Collection**: Load and understand data302. **Data Description**: Summary statistics313. **Data Cleaning**: Handle missing, outliers324. **Univariate Analysis**: Single variable patterns335. **Bivariate Analysis**: Relationships between variables346. **Multivariate Analysis**: Complex relationships3536### Python EDA Example37```python38import pandas as pd39import numpy as np40import seaborn as sns41import matplotlib.pyplot as plt4243# Load data44df = pd.read_csv("data.csv")4546# Basic statistics47print(df.describe())48print(df.dtypes)49print(df.isnull().sum())5051# Distribution analysis52fig, axes = plt.subplots(2, 2, figsize=(12, 10))5354# Histogram55sns.histplot(df["age"], kde=True, ax=axes[0, 0])5657# Box plot for outliers58sns.boxplot(x="income", y="education", data=df, ax=axes[0, 1])5960# Correlation heatmap61corr = df.select_dtypes(include=[np.number]).corr()62sns.heatmap(corr, annot=True, cmap="coolwarm", ax=axes[1, 0])6364# Scatter with regression65sns.regplot(x="age", y="income", data=df, ax=axes[1, 1])6667plt.tight_layout()68plt.show()6970# Categorical analysis71print(df["category"].value_counts())72print(pd.crosstab(df["category"], df["outcome"]))73```7475### Key Metrics76- **Central tendency**: Mean, median, mode77- **Spread**: Std dev, variance, IQR78- **Shape**: Skewness, kurtosis79- **Correlation**: Pearson, Spearman