What I do
- Design and implement big data architectures
- Process large-scale datasets with distributed systems
- Optimize data pipelines for throughput
- Work with Hadoop, Spark, and cloud data platforms
- Implement real-time streaming data processing
- Manage data lakes and warehouses at scale
When to use me
Use me when:
- Working with datasets beyond single-machine capacity
- Building data pipelines at scale
- Processing streaming data in real-time
- Designing data lake architectures
- Optimizing big data workflows
- Managing petabyte-scale storage
Key Concepts
Big Data Ecosystem
- Storage: HDFS, S3, Azure Blob, GCS
- Processing: Spark, Flink, Hadoop MapReduce
- Query: Hive, Presto, BigQuery, Snowflake
- Stream: Kafka, Pulsar, Kinesis, Dataflow
- Orchestration: Airflow, Dagster, Prefect
Spark DataFrame Example
from pyspark.sql import SparkSession
from pyspark.sql.functions import col, sum, avg
spark = SparkSession.builder \
.appName("Analytics") \
.config("spark.sql.shuffle.partitions", 200) \
.getOrCreate()
# Read from multiple sources
df = spark.read \
.parquet("s3://data-lake/raw/events/") \
.filter(col("date") >= "2024-01-01")
# Transform and aggregate
result = df.groupBy("user_id", "product_category") \
.agg(
sum("purchase_amount").alias("total_spent"),
avg("purchase_amount").alias("avg_purchase"),
count("*").alias("num_purchases")
) \
.orderBy(col("total_spent").desc())
# Write aggregated results
result.write \
.mode("overwrite") \
.partitionBy("product_category") \
.parquet("s3://data-warehouse/analytics/")
Data Processing Patterns
- Batch: Scheduled, periodic processing
- Streaming: Continuous, real-time
- Lambda: Batch + speed layers
- Kappa: Streaming-only architecture
Cloud Big Data Services
- AWS: EMR, Redshift, Athena, Kinesis
- Azure: Databricks, Synapse, Data Lake
- GCP: Dataproc, BigQuery, Dataflow
1---2name: big-data3description: Designs and implements big data architectures, processes large-scale datasets with distributed systems, and optimizes data pipelines for throughput using Hadoop, Spark, and cloud platforms.4license: MIT5---67## What I do89- Design and implement big data architectures10- Process large-scale datasets with distributed systems11- Optimize data pipelines for throughput12- Work with Hadoop, Spark, and cloud data platforms13- Implement real-time streaming data processing14- Manage data lakes and warehouses at scale1516## When to use me1718Use me when:19- Working with datasets beyond single-machine capacity20- Building data pipelines at scale21- Processing streaming data in real-time22- Designing data lake architectures23- Optimizing big data workflows24- Managing petabyte-scale storage2526## Key Concepts2728### Big Data Ecosystem29- **Storage**: HDFS, S3, Azure Blob, GCS30- **Processing**: Spark, Flink, Hadoop MapReduce31- **Query**: Hive, Presto, BigQuery, Snowflake32- **Stream**: Kafka, Pulsar, Kinesis, Dataflow33- **Orchestration**: Airflow, Dagster, Prefect3435### Spark DataFrame Example36```python37from pyspark.sql import SparkSession38from pyspark.sql.functions import col, sum, avg3940spark = SparkSession.builder \41 .appName("Analytics") \42 .config("spark.sql.shuffle.partitions", 200) \43 .getOrCreate()4445# Read from multiple sources46df = spark.read \47 .parquet("s3://data-lake/raw/events/") \48 .filter(col("date") >= "2024-01-01")4950# Transform and aggregate51result = df.groupBy("user_id", "product_category") \52 .agg(53 sum("purchase_amount").alias("total_spent"),54 avg("purchase_amount").alias("avg_purchase"),55 count("*").alias("num_purchases")56 ) \57 .orderBy(col("total_spent").desc())5859# Write aggregated results60result.write \61 .mode("overwrite") \62 .partitionBy("product_category") \63 .parquet("s3://data-warehouse/analytics/")64```6566### Data Processing Patterns67- **Batch**: Scheduled, periodic processing68- **Streaming**: Continuous, real-time69- **Lambda**: Batch + speed layers70- **Kappa**: Streaming-only architecture7172### Cloud Big Data Services73- **AWS**: EMR, Redshift, Athena, Kinesis74- **Azure**: Databricks, Synapse, Data Lake75- **GCP**: Dataproc, BigQuery, Dataflow