Senior Data Scientist
Competência senior em ciência de dados de nível mundial para sistemas de AI/ML/Data em produção.
Quick Start
Capacidades Principais
# Core Tool 1
python scripts/experiment_designer.py --input data/ --output results/
# Core Tool 2
python scripts/feature_engineering_pipeline.py --target project/ --analyze
# Core Tool 3
python scripts/model_evaluation_suite.py --config config.yaml --deploy
Expertise Principal
Esta competência cobre capacidades de nível mundial em:
- Padrões e arquiteturas avançados de produção
- Design e implementação de sistemas escaláveis
- Otimização de performance em escala
- Melhores práticas em MLOps e DataOps
- Processamento em tempo real e inferência
- Frameworks de computação distribuída
- Deployment e monitoramento de modelos
- Segurança e conformidade
- Otimização de custos
- Liderança de equipes e mentoria
Tech Stack
Languages: Python, SQL, R, Scala, Go ML Frameworks: PyTorch, TensorFlow, Scikit-learn, XGBoost Data Tools: Spark, Airflow, dbt, Kafka, Databricks LLM Frameworks: LangChain, LlamaIndex, DSPy Deployment: Docker, Kubernetes, AWS/GCP/Azure Monitoring: MLflow, Weights & Biases, Prometheus Databases: PostgreSQL, BigQuery, Snowflake, Pinecone
Documentação de Referência
1. Métodos Estatísticos Avançados
Guia completo disponível em references/statistical_methods_advanced.md cobrindo:
- Padrões avançados e melhores práticas
- Estratégias de implementação em produção
- Técnicas de otimização de performance
- Considerações de escalabilidade
- Segurança e conformidade
- Estudos de casos reais
2. Frameworks de Design de Experimentos
Documentação de workflow completa em references/experiment_design_frameworks.md incluindo:
- Processos passo a passo
- Padrões de design de arquitetura
- Guias de integração de ferramentas
- Estratégias de ajuste de performance
- Procedimentos de troubleshooting
3. Padrões de Engenharia de Features
Guia de referência técnica em references/feature_engineering_patterns.md com:
- Princípios de design de sistemas
- Exemplos de implementação
- Melhores práticas de configuração
- Estratégias de deployment
- Monitoramento e observabilidade
Padrões de Produção
Padrão 1: Processamento de Dados Escalável
Processamento de dados em escala corporativa com computação distribuída:
- Arquitetura de scaling horizontal
- Design tolerante a falhas
- Processamento em tempo real e batch
- Validação de qualidade de dados
- Monitoramento de performance
Padrão 2: Deployment de Modelos ML
Sistema ML em produção com alta disponibilidade:
- Model serving com baixa latência
- Infraestrutura para testes A/B
- Integração com feature store
- Monitoramento de modelos e drift detection
- Pipelines de retreinamento automatizados
Padrão 3: Inferência em Tempo Real
Sistema de inferência de alto throughput:
- Estratégias de batching e caching
- Load balancing
- Auto-scaling
- Otimização de latência
- Otimização de custos
Melhores Práticas
Development
- Test-driven development
- Code reviews e pair programming
- Documentação como código
- Versionamento de tudo
- Integração contínua
Production
- Monitore tudo que é crítico
- Automatize deployments
- Feature flags para releases
- Canary deployments
- Logging abrangente
Liderança de Equipes
- Mentoria de engenheiros juniores
- Impulsione decisões técnicas
- Estabeleça padrões de codificação
- Promova cultura de aprendizado
- Colaboração cross-funcional
Metas de Performance
Latência:
- P50: < 50ms
- P95: < 100ms
- P99: < 200ms
Throughput:
- Requests/segundo: > 1000
- Usuários concorrentes: > 10.000
Disponibilidade:
- Uptime: 99,9%
- Taxa de erro: < 0,1%
Segurança & Conformidade
- Autenticação & autorização
- Criptografia de dados (em repouso e em trânsito)
- Manipulação e anonimização de PII
- Conformidade GDPR/CCPA
- Auditorias de segurança regulares
- Gerenciamento de vulnerabilidades
Comandos Comuns
# Development
python -m pytest tests/ -v --cov
python -m black src/
python -m pylint src/
# Training
python scripts/train.py --config prod.yaml
python scripts/evaluate.py --model best.pth
# Deployment
docker build -t service:v1 .
kubectl apply -f k8s/
helm upgrade service ./charts/
# Monitoring
kubectl logs -f deployment/service
python scripts/health_check.py
Recursos
- Padrões Avançados:
references/statistical_methods_advanced.md - Guia de Implementação:
references/experiment_design_frameworks.md - Referência Técnica:
references/feature_engineering_patterns.md - Scripts de Automação:
scripts/directory
Responsabilidades de Nível Senior
Como um profissional senior de nível mundial:
Liderança Técnica
- Impulsione decisões arquiteturais
- Oriente membros da equipe
- Estabeleça melhores práticas
- Garanta qualidade de código
Pensamento Estratégico
- Alinhe com objetivos de negócio
- Avalie trade-offs
- Planeje para escala
- Gerencie débito técnico
Colaboração
- Trabalhe entre equipes
- Comunique-se efetivamente
- Construa consenso
- Compartilhe conhecimento
Inovação
- Mantenha-se atual com pesquisa
- Experimente novas abordagens
- Contribua para a comunidade
- Impulsione melhoria contínua
Excelência em Produção
- Garanta alta disponibilidade
- Monitore proativamente
- Otimize performance
- Responda a incidentes