Senior Data Engineer
Core Capabilities
- [Capability 1] - [Description]
- [Capability 2] - [Description]
- [Capability 3] - [Description]
- [Capability 4] - [Description]
Key Workflows
Workflow 1: [Workflow Name]
Time: [Duration estimate]
Steps:
- [Step 1]
- [Step 2]
- [Step 3]
Expected Output: [What success looks like]
Workflow 2: [Workflow Name]
Time: [Duration estimate]
Steps:
- [Step 1]
- [Step 2]
- [Step 3]
Expected Output: [What success looks like]
World-class data engineering for production-grade data systems, scalable pipelines, and enterprise data platforms.
Overview
This skill provides comprehensive expertise in data engineering fundamentals through advanced production patterns. From designing medallion architectures to implementing real-time streaming pipelines, it covers the full spectrum of modern data engineering including ETL/ELT design, data quality frameworks, pipeline orchestration, and DataOps practices.
What This Skill Provides:
- Production-ready pipeline templates (Airflow, Spark, dbt)
- Comprehensive data quality validation framework
- Performance optimization and cost analysis tools
- Data architecture patterns (Lambda, Kappa, Medallion)
- Complete DataOps CI/CD workflows
Best For:
- Building scalable data pipelines for enterprise systems
- Implementing data quality and governance frameworks
- Optimizing ETL performance and cloud costs
- Designing modern data architectures (lake, warehouse, lakehouse)
- Production ML/AI data infrastructure
Quick Start
Pipeline Orchestration
# Generate Airflow DAG from configuration
python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --output dags/
# Validate pipeline configuration
python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --validate
# Use incremental load template
python scripts/pipeline_orchestrator.py --template incremental --output dags/
Data Quality Validation
# Validate CSV file with quality checks
python scripts/data_quality_validator.py --input data/sales.csv --output report.html
# Validate database table with custom rules
python scripts/data_quality_validator.py \
--connection postgresql://user:pass@host/db \
--table sales_transactions \
--rules rules/sales_validation.yaml \
--threshold 0.95
Performance Optimization
# Analyze pipeline performance and get recommendations
python scripts/etl_performance_optimizer.py \
--airflow-db postgresql://host/airflow \
--dag-id sales_etl_pipeline \
--days 30 \
--optimize
# Analyze Spark job performance
python scripts/etl_performance_optimizer.py \
--spark-history-server http://spark-history:18080 \
--app-id app-20250115-001
Core Workflows
1. Building Production Data Pipelines
Steps:
- Design Architecture: Choose pattern (Lambda, Kappa, Medallion) based on requirements
- Configure Pipeline: Create YAML configuration with sources, transformations, targets
- Generate DAG:
python scripts/pipeline_orchestrator.py --config config.yaml
- Add Quality Checks: Define validation rules for data quality
- Deploy & Monitor: Deploy to Airflow, configure alerts, track metrics
Pipeline Patterns: See frameworks.md for Lambda Architecture, Kappa Architecture, Medallion Architecture (Bronze/Silver/Gold), and Microservices Data patterns.
Templates: See templates.md for complete Airflow DAG templates, Spark job templates, dbt models, and Docker configurations.
2. Data Quality Management
Steps:
- Define Rules: Create validation rules covering completeness, accuracy, consistency
- Run Validation:
python scripts/data_quality_validator.py --rules rules.yaml
- Review Results: Analyze quality scores and failed checks
- Integrate CI/CD: Add validation to pipeline deployment process
- Monitor Trends: Track quality scores over time
Quality Framework: See frameworks.md for complete Data Quality Framework covering all dimensions (completeness, accuracy, consistency, timeliness, validity).
Validation Templates: See templates.md for validation configuration examples and Python API usage.
3. Data Modeling & Transformation
Steps:
- Choose Modeling Approach: Dimensional (Kimball), Data Vault 2.0, or One Big Table
- Design Schema: Define fact tables, dimensions, and relationships
- Implement with dbt: Create staging, intermediate, and mart models
- Handle SCD: Implement slowly changing dimension logic (Type 1/2/3)
- Test & Deploy: Run dbt tests, generate documentation, deploy
Modeling Patterns: See frameworks.md for Dimensional Modeling (Kimball), Data Vault 2.0, One Big Table (OBT), and SCD implementations.
dbt Templates: See templates.md for complete dbt model templates including staging, intermediate, fact tables, and SCD Type 2 logic.
4. Performance Optimization
Steps:
- Profile Pipeline: Run performance analyzer on recent pipeline executions
- Identify Bottlenecks: Review execution time breakdown and slow tasks
- Apply Optimizations: Implement recommendations (partitioning, indexing, batching)
- Tune Spark Jobs: Optimize memory, parallelism, and shuffle settings
- Measure Impact: Compare before/after metrics, track cost savings
Optimization Strategies: See frameworks.md for performance best practices including partitioning strategies, query optimization, and Spark tuning.
Analysis Tools: See tools.md for complete documentation on etl_performance_optimizer.py with query analysis and Spark tuning.
Python Tools
pipeline_orchestrator.py
Automated Airflow DAG generation with intelligent dependency resolution and monitoring.
Key Features:
- Generate production-ready DAGs from YAML configuration
- Automatic task dependency resolution
- Built-in retry logic and error handling
- Multi-source support (PostgreSQL, S3, BigQuery, Snowflake)
- Integrated quality checks and alerting
Usage:
# Basic DAG generation
python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --output dags/
# With validation
python scripts/pipeline_orchestrator.py --config config.yaml --validate
# From template
python scripts/pipeline_orchestrator.py --template incremental --output dags/
Complete Documentation: See tools.md for full configuration options, templates, and integration examples.
data_quality_validator.py
Comprehensive data quality validation framework with automated checks and reporting.
Capabilities:
- Multi-dimensional validation (completeness, accuracy, consistency, timeliness, validity)
- Great Expectations integration
- Custom business rule validation
- HTML/PDF report generation
- Anomaly detection
- Historical trend tracking
Usage:
# Validate with custom rules
python scripts/data_quality_validator.py \
--input data/sales.csv \
--rules rules/sales_validation.yaml \
--output report.html
# Database table validation
python scripts/data_quality_validator.py \
--connection postgresql://host/db \
--table sales_transactions \
--threshold 0.95
Complete Documentation: See tools.md for rule configuration, API usage, and integration patterns.
etl_performance_optimizer.py
Pipeline performance analysis with actionable optimization recommendations.
Capabilities:
- Airflow DAG execution profiling
- Bottleneck detection and analysis
- SQL query optimization suggestions
- Spark job tuning recommendations
- Cost analysis and optimization
- Historical performance trending
Usage:
# Analyze Airflow DAG
python scripts/etl_performance_optimizer.py \
--airflow-db postgresql://host/airflow \
--dag-id sales_etl_pipeline \
--days 30 \
--optimize
# Spark job analysis
python scripts/etl_performance_optimizer.py \
--spark-history-server http://spark-history:18080 \
--app-id app-20250115-001
Complete Documentation: See tools.md for profiling options, optimization strategies, and cost analysis.
Reference Documentation
Frameworks (frameworks.md)
Comprehensive data engineering frameworks and patterns:
- Architecture Patterns: Lambda, Kappa, Medallion, Microservices data architecture
- Data Modeling: Dimensional (Kimball), Data Vault 2.0, One Big Table
- ETL/ELT Patterns: Full load, incremental load, CDC, SCD, idempotent pipelines
- Data Quality: Complete framework covering all quality dimensions
- DataOps: CI/CD for data pipelines, testing strategies, monitoring
- Orchestration: Airflow DAG patterns, backfill strategies
- Streaming: Kafka-based streaming, Spark Structured Streaming
- Governance: Data catalog, lineage tracking, access control
Templates (templates.md)
Production-ready code templates and examples:
- Airflow DAGs: Complete ETL DAG, incremental load, dynamic task generation
- Spark Jobs: Batch processing, streaming, optimized configurations
- dbt Models: Staging, intermediate, fact tables, dimensions with SCD Type 2
- SQL Patterns: Incremental merge (upsert), deduplication, date spine, window functions
- Python Pipelines: Data quality validation class, retry decorators, error handling
- Docker: Dockerfiles for data pipelines, Docker Compose for local development
- Configuration: dbt project config, Spark configuration, Airflow variables
- Testing: pytest fixtures, integration tests, data quality tests
Tools (tools.md)
Python automation tool documentation:
- pipeline_orchestrator.py: Complete usage guide, configuration format, DAG templates
- data_quality_validator.py: Validation rules, dimension checks, Great Expectations integration
- etl_performance_optimizer.py: Performance analysis, query optimization, Spark tuning
- Integration Patterns: Airflow, dbt, CI/CD, monitoring systems
- Best Practices: Configuration management, error handling, performance, monitoring
Tech Stack
Core Technologies:
- Languages: Python 3.8+, SQL, Scala (Spark)
- Orchestration: Apache Airflow, Prefect, Dagster
- Processing: Apache Spark, dbt, Pandas
- Streaming: Apache Kafka, Spark Streaming, Flink
- Storage: PostgreSQL, BigQuery, Snowflake, Redshift, S3, GCS
- Containerization: Docker, Kubernetes
- Monitoring: Datadog, Prometheus, Grafana
Data Platforms:
- Cloud Data Warehouses: Snowflake, BigQuery, Redshift
- Data Lakes: Delta Lake, Apache Iceberg, Apache Hudi
- Streaming: Kafka, Kinesis, Pub/Sub
- Workflow: Airflow, Prefect, Dagster
Integration Points
This skill integrates with:
- Orchestration: Airflow, Prefect, Dagster for workflow management
- Transformation: dbt for SQL transformations and testing
- Quality: Great Expectations for data validation
- Monitoring: Datadog, Prometheus for pipeline monitoring
- BI Tools: Looker, Tableau, Power BI for analytics
- ML Platforms: MLflow, Kubeflow for ML pipeline integration
- Version Control: Git for pipeline code and configuration
See tools.md for detailed integration patterns and examples.
Best Practices
Pipeline Design:
- Idempotent operations for safe reruns
- Incremental processing where possible
- Clear data lineage and documentation
- Comprehensive error handling
- Automated recovery mechanisms
Data Quality:
- Define quality rules early
- Validate at every pipeline stage
- Automate quality monitoring
- Track quality trends over time
- Block bad data from downstream
Performance:
- Partition large tables by date/region
- Use columnar formats (Parquet, ORC)
- Leverage predicate pushdown
- Optimize for your query patterns
- Monitor and tune regularly
Operations:
- Version control everything
- Automate testing and deployment
- Implement comprehensive monitoring
- Document runbooks for incidents
- Regular performance reviews
Performance Targets
Pipeline Execution:
- P50 latency: < 5 minutes (hourly pipelines)
- P95 latency: < 15 minutes
- Success rate: > 99%
- Data freshness: < 1 hour behind source
Data Quality:
- Quality score: > 95%
- Completeness: > 99%
- Timeliness: < 2 hours data lag
- Zero critical failures
Cost Efficiency:
- Cost per GB processed: < $0.10
- Cloud cost trend: Stable or decreasing
- Resource utilization: > 70%
Resources
- Frameworks Guide: references/frameworks.md
- Code Templates: references/templates.md
- Tool Documentation: references/tools.md
- Python Scripts:
scripts/ directory
Version: 1.0.0
Last Updated: 2025-11-08
Documentation Structure: Progressive disclosure with comprehensive references
1---2name: senior-data-engineer3description: World-class data engineering skill for building scalable data pipelines, ETL/ELT systems, and data infrastructure. Expertise in Python, SQL, Spark, Airflow, dbt, Kafka, and modern data stack. Includes data modeling, pipeline orchestration, data quality, and DataOps. Use when designing data architectures, building data pipelines, optimizing data workflows, or implementing data governance.4license: MIT5---67# Senior Data Engineer89## Core Capabilities1011- **[Capability 1]** - [Description]12- **[Capability 2]** - [Description]13- **[Capability 3]** - [Description]14- **[Capability 4]** - [Description]151617## Key Workflows1819### Workflow 1: [Workflow Name]2021**Time:** [Duration estimate]2223**Steps:**241. [Step 1]252. [Step 2]263. [Step 3]2728**Expected Output:** [What success looks like]2930### Workflow 2: [Workflow Name]3132**Time:** [Duration estimate]3334**Steps:**351. [Step 1]362. [Step 2]373. [Step 3]3839**Expected Output:** [What success looks like]404142World-class data engineering for production-grade data systems, scalable pipelines, and enterprise data platforms.4344## Overview4546This skill provides comprehensive expertise in data engineering fundamentals through advanced production patterns. From designing medallion architectures to implementing real-time streaming pipelines, it covers the full spectrum of modern data engineering including ETL/ELT design, data quality frameworks, pipeline orchestration, and DataOps practices.4748**What This Skill Provides:**49- Production-ready pipeline templates (Airflow, Spark, dbt)50- Comprehensive data quality validation framework51- Performance optimization and cost analysis tools52- Data architecture patterns (Lambda, Kappa, Medallion)53- Complete DataOps CI/CD workflows5455**Best For:**56- Building scalable data pipelines for enterprise systems57- Implementing data quality and governance frameworks58- Optimizing ETL performance and cloud costs59- Designing modern data architectures (lake, warehouse, lakehouse)60- Production ML/AI data infrastructure6162## Quick Start6364### Pipeline Orchestration6566```bash67# Generate Airflow DAG from configuration68python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --output dags/6970# Validate pipeline configuration71python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --validate7273# Use incremental load template74python scripts/pipeline_orchestrator.py --template incremental --output dags/75```7677### Data Quality Validation7879```bash80# Validate CSV file with quality checks81python scripts/data_quality_validator.py --input data/sales.csv --output report.html8283# Validate database table with custom rules84python scripts/data_quality_validator.py \85 --connection postgresql://user:pass@host/db \86 --table sales_transactions \87 --rules rules/sales_validation.yaml \88 --threshold 0.9589```9091### Performance Optimization9293```bash94# Analyze pipeline performance and get recommendations95python scripts/etl_performance_optimizer.py \96 --airflow-db postgresql://host/airflow \97 --dag-id sales_etl_pipeline \98 --days 30 \99 --optimize100101# Analyze Spark job performance102python scripts/etl_performance_optimizer.py \103 --spark-history-server http://spark-history:18080 \104 --app-id app-20250115-001105```106107## Core Workflows108109### 1. Building Production Data Pipelines110111**Steps:**1121. **Design Architecture:** Choose pattern (Lambda, Kappa, Medallion) based on requirements1132. **Configure Pipeline:** Create YAML configuration with sources, transformations, targets1143. **Generate DAG:** `python scripts/pipeline_orchestrator.py --config config.yaml`1154. **Add Quality Checks:** Define validation rules for data quality1165. **Deploy & Monitor:** Deploy to Airflow, configure alerts, track metrics117118**Pipeline Patterns:** See [frameworks.md](references/frameworks.md) for Lambda Architecture, Kappa Architecture, Medallion Architecture (Bronze/Silver/Gold), and Microservices Data patterns.119120**Templates:** See [templates.md](references/templates.md) for complete Airflow DAG templates, Spark job templates, dbt models, and Docker configurations.121122### 2. Data Quality Management123124**Steps:**1251. **Define Rules:** Create validation rules covering completeness, accuracy, consistency1262. **Run Validation:** `python scripts/data_quality_validator.py --rules rules.yaml`1273. **Review Results:** Analyze quality scores and failed checks1284. **Integrate CI/CD:** Add validation to pipeline deployment process1295. **Monitor Trends:** Track quality scores over time130131**Quality Framework:** See [frameworks.md](references/frameworks.md) for complete Data Quality Framework covering all dimensions (completeness, accuracy, consistency, timeliness, validity).132133**Validation Templates:** See [templates.md](references/templates.md) for validation configuration examples and Python API usage.134135### 3. Data Modeling & Transformation136137**Steps:**1381. **Choose Modeling Approach:** Dimensional (Kimball), Data Vault 2.0, or One Big Table1392. **Design Schema:** Define fact tables, dimensions, and relationships1403. **Implement with dbt:** Create staging, intermediate, and mart models1414. **Handle SCD:** Implement slowly changing dimension logic (Type 1/2/3)1425. **Test & Deploy:** Run dbt tests, generate documentation, deploy143144**Modeling Patterns:** See [frameworks.md](references/frameworks.md) for Dimensional Modeling (Kimball), Data Vault 2.0, One Big Table (OBT), and SCD implementations.145146**dbt Templates:** See [templates.md](references/templates.md) for complete dbt model templates including staging, intermediate, fact tables, and SCD Type 2 logic.147148### 4. Performance Optimization149150**Steps:**1511. **Profile Pipeline:** Run performance analyzer on recent pipeline executions1522. **Identify Bottlenecks:** Review execution time breakdown and slow tasks1533. **Apply Optimizations:** Implement recommendations (partitioning, indexing, batching)1544. **Tune Spark Jobs:** Optimize memory, parallelism, and shuffle settings1555. **Measure Impact:** Compare before/after metrics, track cost savings156157**Optimization Strategies:** See [frameworks.md](references/frameworks.md) for performance best practices including partitioning strategies, query optimization, and Spark tuning.158159**Analysis Tools:** See [tools.md](references/tools.md) for complete documentation on etl_performance_optimizer.py with query analysis and Spark tuning.160161## Python Tools162163### pipeline_orchestrator.py164165Automated Airflow DAG generation with intelligent dependency resolution and monitoring.166167**Key Features:**168- Generate production-ready DAGs from YAML configuration169- Automatic task dependency resolution170- Built-in retry logic and error handling171- Multi-source support (PostgreSQL, S3, BigQuery, Snowflake)172- Integrated quality checks and alerting173174**Usage:**175```bash176# Basic DAG generation177python scripts/pipeline_orchestrator.py --config pipeline_config.yaml --output dags/178179# With validation180python scripts/pipeline_orchestrator.py --config config.yaml --validate181182# From template183python scripts/pipeline_orchestrator.py --template incremental --output dags/184```185186**Complete Documentation:** See [tools.md](references/tools.md) for full configuration options, templates, and integration examples.187188### data_quality_validator.py189190Comprehensive data quality validation framework with automated checks and reporting.191192**Capabilities:**193- Multi-dimensional validation (completeness, accuracy, consistency, timeliness, validity)194- Great Expectations integration195- Custom business rule validation196- HTML/PDF report generation197- Anomaly detection198- Historical trend tracking199200**Usage:**201```bash202# Validate with custom rules203python scripts/data_quality_validator.py \204 --input data/sales.csv \205 --rules rules/sales_validation.yaml \206 --output report.html207208# Database table validation209python scripts/data_quality_validator.py \210 --connection postgresql://host/db \211 --table sales_transactions \212 --threshold 0.95213```214215**Complete Documentation:** See [tools.md](references/tools.md) for rule configuration, API usage, and integration patterns.216217### etl_performance_optimizer.py218219Pipeline performance analysis with actionable optimization recommendations.220221**Capabilities:**222- Airflow DAG execution profiling223- Bottleneck detection and analysis224- SQL query optimization suggestions225- Spark job tuning recommendations226- Cost analysis and optimization227- Historical performance trending228229**Usage:**230```bash231# Analyze Airflow DAG232python scripts/etl_performance_optimizer.py \233 --airflow-db postgresql://host/airflow \234 --dag-id sales_etl_pipeline \235 --days 30 \236 --optimize237238# Spark job analysis239python scripts/etl_performance_optimizer.py \240 --spark-history-server http://spark-history:18080 \241 --app-id app-20250115-001242```243244**Complete Documentation:** See [tools.md](references/tools.md) for profiling options, optimization strategies, and cost analysis.245246## Reference Documentation247248### Frameworks ([frameworks.md](references/frameworks.md))249250Comprehensive data engineering frameworks and patterns:251- **Architecture Patterns:** Lambda, Kappa, Medallion, Microservices data architecture252- **Data Modeling:** Dimensional (Kimball), Data Vault 2.0, One Big Table253- **ETL/ELT Patterns:** Full load, incremental load, CDC, SCD, idempotent pipelines254- **Data Quality:** Complete framework covering all quality dimensions255- **DataOps:** CI/CD for data pipelines, testing strategies, monitoring256- **Orchestration:** Airflow DAG patterns, backfill strategies257- **Streaming:** Kafka-based streaming, Spark Structured Streaming258- **Governance:** Data catalog, lineage tracking, access control259260### Templates ([templates.md](references/templates.md))261262Production-ready code templates and examples:263- **Airflow DAGs:** Complete ETL DAG, incremental load, dynamic task generation264- **Spark Jobs:** Batch processing, streaming, optimized configurations265- **dbt Models:** Staging, intermediate, fact tables, dimensions with SCD Type 2266- **SQL Patterns:** Incremental merge (upsert), deduplication, date spine, window functions267- **Python Pipelines:** Data quality validation class, retry decorators, error handling268- **Docker:** Dockerfiles for data pipelines, Docker Compose for local development269- **Configuration:** dbt project config, Spark configuration, Airflow variables270- **Testing:** pytest fixtures, integration tests, data quality tests271272### Tools ([tools.md](references/tools.md))273274Python automation tool documentation:275- **pipeline_orchestrator.py:** Complete usage guide, configuration format, DAG templates276- **data_quality_validator.py:** Validation rules, dimension checks, Great Expectations integration277- **etl_performance_optimizer.py:** Performance analysis, query optimization, Spark tuning278- **Integration Patterns:** Airflow, dbt, CI/CD, monitoring systems279- **Best Practices:** Configuration management, error handling, performance, monitoring280281## Tech Stack282283**Core Technologies:**284- **Languages:** Python 3.8+, SQL, Scala (Spark)285- **Orchestration:** Apache Airflow, Prefect, Dagster286- **Processing:** Apache Spark, dbt, Pandas287- **Streaming:** Apache Kafka, Spark Streaming, Flink288- **Storage:** PostgreSQL, BigQuery, Snowflake, Redshift, S3, GCS289- **Containerization:** Docker, Kubernetes290- **Monitoring:** Datadog, Prometheus, Grafana291292**Data Platforms:**293- **Cloud Data Warehouses:** Snowflake, BigQuery, Redshift294- **Data Lakes:** Delta Lake, Apache Iceberg, Apache Hudi295- **Streaming:** Kafka, Kinesis, Pub/Sub296- **Workflow:** Airflow, Prefect, Dagster297298## Integration Points299300This skill integrates with:301- **Orchestration:** Airflow, Prefect, Dagster for workflow management302- **Transformation:** dbt for SQL transformations and testing303- **Quality:** Great Expectations for data validation304- **Monitoring:** Datadog, Prometheus for pipeline monitoring305- **BI Tools:** Looker, Tableau, Power BI for analytics306- **ML Platforms:** MLflow, Kubeflow for ML pipeline integration307- **Version Control:** Git for pipeline code and configuration308309See [tools.md](references/tools.md) for detailed integration patterns and examples.310311## Best Practices312313**Pipeline Design:**3141. Idempotent operations for safe reruns3152. Incremental processing where possible3163. Clear data lineage and documentation3174. Comprehensive error handling3185. Automated recovery mechanisms319320**Data Quality:**3211. Define quality rules early3222. Validate at every pipeline stage3233. Automate quality monitoring3244. Track quality trends over time3255. Block bad data from downstream326327**Performance:**3281. Partition large tables by date/region3292. Use columnar formats (Parquet, ORC)3303. Leverage predicate pushdown3314. Optimize for your query patterns3325. Monitor and tune regularly333334**Operations:**3351. Version control everything3362. Automate testing and deployment3373. Implement comprehensive monitoring3384. Document runbooks for incidents3395. Regular performance reviews340341## Performance Targets342343**Pipeline Execution:**344- P50 latency: < 5 minutes (hourly pipelines)345- P95 latency: < 15 minutes346- Success rate: > 99%347- Data freshness: < 1 hour behind source348349**Data Quality:**350- Quality score: > 95%351- Completeness: > 99%352- Timeliness: < 2 hours data lag353- Zero critical failures354355**Cost Efficiency:**356- Cost per GB processed: < $0.10357- Cloud cost trend: Stable or decreasing358- Resource utilization: > 70%359360## Resources361362- **Frameworks Guide:** [references/frameworks.md](references/frameworks.md)363- **Code Templates:** [references/templates.md](references/templates.md)364- **Tool Documentation:** [references/tools.md](references/tools.md)365- **Python Scripts:** `scripts/` directory366367---368369**Version:** 1.0.0370**Last Updated:** 2025-11-08371**Documentation Structure:** Progressive disclosure with comprehensive references