Senior Data Engineer
Habilidade de engenheiro de dados sênior de classe mundial para sistemas production-grade de AI/ML/Data.
Quick Start
Principais Capacidades
# Core Tool 1
python scripts/pipeline_orchestrator.py --input data/ --output results/
# Core Tool 2
python scripts/data_quality_validator.py --target project/ --analyze
# Core Tool 3
python scripts/etl_performance_optimizer.py --config config.yaml --deploy
Expertise Principal
Esta habilidade cobre capacidades de classe mundial em:
- Padrões e arquiteturas de produção avançados
- Design e implementação de sistemas escaláveis
- Otimização de performance em escala
- Melhores práticas de MLOps e DataOps
- Processamento e inferência em tempo real
- Frameworks de computação distribuída
- Deploy e monitoramento de modelos
- Segurança e conformidade
- Otimização de custos
- Liderança de equipes e mentoria
Tech Stack
Linguagens: Python, SQL, R, Scala, Go ML Frameworks: PyTorch, TensorFlow, Scikit-learn, XGBoost Data Tools: Spark, Airflow, dbt, Kafka, Databricks LLM Frameworks: LangChain, LlamaIndex, DSPy Deployment: Docker, Kubernetes, AWS/GCP/Azure Monitoring: MLflow, Weights & Biases, Prometheus Databases: PostgreSQL, BigQuery, Snowflake, Pinecone
Documentação de Referência
1. Data Pipeline Architecture
Guia abrangente disponível em references/data_pipeline_architecture.md cobrindo:
- Padrões e melhores práticas avançados
- Estratégias de implementação em produção
- Técnicas de otimização de performance
- Considerações de escalabilidade
- Segurança e conformidade
- Estudos de caso do mundo real
2. Data Modeling Patterns
Documentação completa de workflow em references/data_modeling_patterns.md incluindo:
- Processos passo a passo
- Padrões de design de arquitetura
- Guias de integração de ferramentas
- Estratégias de ajuste de performance
- Procedimentos de troubleshooting
3. Dataops Best Practices
Guia de referência técnica em references/dataops_best_practices.md com:
- Princípios de design de sistemas
- Exemplos de implementação
- Melhores práticas de configuração
- Estratégias de deployment
- Monitoramento e observabilidade
Padrões de Produção
Padrão 1: Processamento de Dados Escalável
Processamento de dados em escala empresarial com computação distribuída:
- Arquitetura de scaling horizontal
- Design tolerante a falhas
- Processamento em tempo real e batch
- Validação de qualidade de dados
- Monitoramento de performance
Padrão 2: Deploy de Modelo ML
Sistema ML em produção com alta disponibilidade:
- Model serving com baixa latência
- Infraestrutura de A/B testing
- Integração com feature store
- Monitoramento de modelos e detecção de drift
- Pipelines de retrainamento automatizado
Padrão 3: Inferência em Tempo Real
Sistema de inferência com alto throughput:
- Estratégias de batching e caching
- Load balancing
- Auto-scaling
- Otimização de latência
- Otimização de custos
Melhores Práticas
Desenvolvimento
- Desenvolvimento orientado por testes
- Code reviews e pair programming
- Documentação como código
- Versionamento de tudo
- Integração contínua
Produção
- Monitore tudo que é crítico
- Automatize deployments
- Feature flags para releases
- Canary deployments
- Logging abrangente
Liderança de Equipe
- Mentoria de engenheiros juniores
- Condução de decisões técnicas
- Estabelecimento de padrões de código
- Fostering de cultura de aprendizado
- Colaboração cross-funcional
Alvos de Performance
Latência:
- P50: < 50ms
- P95: < 100ms
- P99: < 200ms
Throughput:
- Requisições/segundo: > 1000
- Usuários simultâneos: > 10.000
Disponibilidade:
- Uptime: 99,9%
- Taxa de erro: < 0,1%
Segurança & Conformidade
- Autenticação & autorização
- Criptografia de dados (em repouso e em trânsito)
- Tratamento de PII e anonimização
- Conformidade GDPR/CCPA
- Auditorias de segurança regulares
- Gestão de vulnerabilidades
Comandos Comuns
# Development
python -m pytest tests/ -v --cov
python -m black src/
python -m pylint src/
# Training
python scripts/train.py --config prod.yaml
python scripts/evaluate.py --model best.pth
# Deployment
docker build -t service:v1 .
kubectl apply -f k8s/
helm upgrade service ./charts/
# Monitoring
kubectl logs -f deployment/service
python scripts/health_check.py
Recursos
- Advanced Patterns:
references/data_pipeline_architecture.md - Implementation Guide:
references/data_modeling_patterns.md - Technical Reference:
references/dataops_best_practices.md - Automation Scripts:
scripts/directory
Responsabilidades em Nível Sênior
Como um profissional de classe mundial sênior:
Liderança Técnica
- Conduza decisões arquiteturais
- Faça mentoria de membros da equipe
- Estabeleça melhores práticas
- Garanta qualidade de código
Pensamento Estratégico
- Alinhe com objetivos de negócio
- Avalie trade-offs
- Planeje para escala
- Gerencie débito técnico
Colaboração
- Trabalhe entre equipes
- Comunique-se efetivamente
- Construa consenso
- Compartilhe conhecimento
Inovação
- Mantenha-se atualizado com pesquisa
- Experimente novas abordagens
- Contribua para a comunidade
- Impulsione melhoria contínua
Excelência em Produção
- Garanta alta disponibilidade
- Monitore proativamente
- Otimize performance
- Responda a incidentes