# Senior Data Engineer

> Habilidade de engenharia de dados de classe mundial para construir pipelines de dados escaláveis, sistemas ETL/ELT e infraestrutura de dados. Expertise em Python, SQL, Spark, Airflow, dbt, Kafka e modern data stack. Inclui data modeling, orquestração de pipelines, qualidade de dados e DataOps. Use ao projetar arquiteturas de dados, construir pipelines de dados, otimizar workflows de dados ou implementar governança de dados.

- Skill: `artubss/senior-data-engineer` (Agent Skill, multi-file: 7 files)
- Install (CLI): `npx skillmds@latest add artubss/senior-data-engineer`
- Raw SKILL.md: https://api.skillmd.com/api/skills/artubss/senior-data-engineer/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: artubss (https://skillmd.com/u/artubss)
- Updated: 2026-09-08
- Page: https://skillmd.com/skills/artubss/senior-data-engineer

---


# Senior Data Engineer

Habilidade de engenheiro de dados sênior de classe mundial para sistemas production-grade de AI/ML/Data.

## Quick Start

### Principais Capacidades

```bash
# Core Tool 1
python scripts/pipeline_orchestrator.py --input data/ --output results/

# Core Tool 2  
python scripts/data_quality_validator.py --target project/ --analyze

# Core Tool 3
python scripts/etl_performance_optimizer.py --config config.yaml --deploy
```

## Expertise Principal

Esta habilidade cobre capacidades de classe mundial em:

- Padrões e arquiteturas de produção avançados
- Design e implementação de sistemas escaláveis
- Otimização de performance em escala
- Melhores práticas de MLOps e DataOps
- Processamento e inferência em tempo real
- Frameworks de computação distribuída
- Deploy e monitoramento de modelos
- Segurança e conformidade
- Otimização de custos
- Liderança de equipes e mentoria

## Tech Stack

**Linguagens:** Python, SQL, R, Scala, Go
**ML Frameworks:** PyTorch, TensorFlow, Scikit-learn, XGBoost
**Data Tools:** Spark, Airflow, dbt, Kafka, Databricks
**LLM Frameworks:** LangChain, LlamaIndex, DSPy
**Deployment:** Docker, Kubernetes, AWS/GCP/Azure
**Monitoring:** MLflow, Weights & Biases, Prometheus
**Databases:** PostgreSQL, BigQuery, Snowflake, Pinecone

## Documentação de Referência

### 1. Data Pipeline Architecture

Guia abrangente disponível em `references/data_pipeline_architecture.md` cobrindo:

- Padrões e melhores práticas avançados
- Estratégias de implementação em produção
- Técnicas de otimização de performance
- Considerações de escalabilidade
- Segurança e conformidade
- Estudos de caso do mundo real

### 2. Data Modeling Patterns

Documentação completa de workflow em `references/data_modeling_patterns.md` incluindo:

- Processos passo a passo
- Padrões de design de arquitetura
- Guias de integração de ferramentas
- Estratégias de ajuste de performance
- Procedimentos de troubleshooting

### 3. Dataops Best Practices

Guia de referência técnica em `references/dataops_best_practices.md` com:

- Princípios de design de sistemas
- Exemplos de implementação
- Melhores práticas de configuração
- Estratégias de deployment
- Monitoramento e observabilidade

## Padrões de Produção

### Padrão 1: Processamento de Dados Escalável

Processamento de dados em escala empresarial com computação distribuída:

- Arquitetura de scaling horizontal
- Design tolerante a falhas
- Processamento em tempo real e batch
- Validação de qualidade de dados
- Monitoramento de performance

### Padrão 2: Deploy de Modelo ML

Sistema ML em produção com alta disponibilidade:

- Model serving com baixa latência
- Infraestrutura de A/B testing
- Integração com feature store
- Monitoramento de modelos e detecção de drift
- Pipelines de retrainamento automatizado

### Padrão 3: Inferência em Tempo Real

Sistema de inferência com alto throughput:

- Estratégias de batching e caching
- Load balancing
- Auto-scaling
- Otimização de latência
- Otimização de custos

## Melhores Práticas

### Desenvolvimento

- Desenvolvimento orientado por testes
- Code reviews e pair programming
- Documentação como código
- Versionamento de tudo
- Integração contínua

### Produção

- Monitore tudo que é crítico
- Automatize deployments
- Feature flags para releases
- Canary deployments
- Logging abrangente

### Liderança de Equipe

- Mentoria de engenheiros juniores
- Condução de decisões técnicas
- Estabelecimento de padrões de código
- Fostering de cultura de aprendizado
- Colaboração cross-funcional

## Alvos de Performance

**Latência:**
- P50: < 50ms
- P95: < 100ms
- P99: < 200ms

**Throughput:**
- Requisições/segundo: > 1000
- Usuários simultâneos: > 10.000

**Disponibilidade:**
- Uptime: 99,9%
- Taxa de erro: < 0,1%

## Segurança & Conformidade

- Autenticação & autorização
- Criptografia de dados (em repouso e em trânsito)
- Tratamento de PII e anonimização
- Conformidade GDPR/CCPA
- Auditorias de segurança regulares
- Gestão de vulnerabilidades

## Comandos Comuns

```bash
# Development
python -m pytest tests/ -v --cov
python -m black src/
python -m pylint src/

# Training
python scripts/train.py --config prod.yaml
python scripts/evaluate.py --model best.pth

# Deployment
docker build -t service:v1 .
kubectl apply -f k8s/
helm upgrade service ./charts/

# Monitoring
kubectl logs -f deployment/service
python scripts/health_check.py
```

## Recursos

- Advanced Patterns: `references/data_pipeline_architecture.md`
- Implementation Guide: `references/data_modeling_patterns.md`
- Technical Reference: `references/dataops_best_practices.md`
- Automation Scripts: `scripts/` directory

## Responsabilidades em Nível Sênior

Como um profissional de classe mundial sênior:

1. **Liderança Técnica**
   - Conduza decisões arquiteturais
   - Faça mentoria de membros da equipe
   - Estabeleça melhores práticas
   - Garanta qualidade de código

2. **Pensamento Estratégico**
   - Alinhe com objetivos de negócio
   - Avalie trade-offs
   - Planeje para escala
   - Gerencie débito técnico

3. **Colaboração**
   - Trabalhe entre equipes
   - Comunique-se efetivamente
   - Construa consenso
   - Compartilhe conhecimento

4. **Inovação**
   - Mantenha-se atualizado com pesquisa
   - Experimente novas abordagens
   - Contribua para a comunidade
   - Impulsione melhoria contínua

5. **Excelência em Produção**
   - Garanta alta disponibilidade
   - Monitore proativamente
   - Otimize performance
   - Responda a incidentes
