# Senior Ml Engineer

> Habilidade de engenharia de ML de classe mundial para produtivizar modelos de ML, MLOps e construir sistemas de ML escaláveis. Expertise em PyTorch, TensorFlow, deploy de modelos, feature stores, monitoramento de modelos e infraestrutura de ML. Inclui integração de LLM, fine-tuning, sistemas RAG e IA agêntica. Use ao fazer deploy de modelos de ML, construir plataformas de ML, implementar MLOps ou integrar LLMs em sistemas em produção.

- Skill: `artubss/senior-ml-engineer` (Agent Skill, multi-file: 7 files)
- Install (CLI): `npx skillmds@latest add artubss/senior-ml-engineer`
- Raw SKILL.md: https://api.skillmd.com/api/skills/artubss/senior-ml-engineer/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: DevOps & Infra
- Author: artubss (https://skillmd.com/u/artubss)
- Updated: 2026-09-08
- Page: https://skillmd.com/skills/artubss/senior-ml-engineer

---


# Engenheiro Sênior de ML/IA

Habilidade de engenheiro sênior de ML/IA de classe mundial para sistemas de dados/ML/IA em nível de produção.

## Início Rápido

### Principais Capacidades

```bash
# Core Tool 1
python scripts/model_deployment_pipeline.py --input data/ --output results/

# Core Tool 2  
python scripts/rag_system_builder.py --target project/ --analyze

# Core Tool 3
python scripts/ml_monitoring_suite.py --config config.yaml --deploy
```

## Expertise Principal

Esta habilidade cobre capacidades de classe mundial em:

- Padrões e arquiteturas avançadas de produção
- Design e implementação de sistemas escaláveis
- Otimização de performance em larga escala
- Melhores práticas de MLOps e DataOps
- Processamento e inferência em tempo real
- Frameworks de computação distribuída
- Deploy e monitoramento de modelos
- Segurança e conformidade
- Otimização de custos
- Liderança de equipe e mentoring

## Stack Tecnológico

**Linguagens:** Python, SQL, R, Scala, Go
**ML Frameworks:** PyTorch, TensorFlow, Scikit-learn, XGBoost
**Data Tools:** Spark, Airflow, dbt, Kafka, Databricks
**LLM Frameworks:** LangChain, LlamaIndex, DSPy
**Deployment:** Docker, Kubernetes, AWS/GCP/Azure
**Monitoring:** MLflow, Weights & Biases, Prometheus
**Databases:** PostgreSQL, BigQuery, Snowflake, Pinecone

## Documentação de Referência

### 1. Padrões de Produção MLOps

Guia abrangente disponível em `references/mlops_production_patterns.md` cobrindo:

- Padrões avançados e melhores práticas
- Estratégias de implementação em produção
- Técnicas de otimização de performance
- Considerações de escalabilidade
- Segurança e conformidade
- Estudos de caso do mundo real

### 2. Guia de Integração de LLM

Documentação de workflow completo em `references/llm_integration_guide.md` incluindo:

- Processos passo a passo
- Padrões de design de arquitetura
- Guias de integração de ferramentas
- Estratégias de ajuste de performance
- Procedimentos de troubleshooting

### 3. Arquitetura de Sistema RAG

Guia de referência técnica em `references/rag_system_architecture.md` com:

- Princípios de design de sistema
- Exemplos de implementação
- Melhores práticas de configuração
- Estratégias de deployment
- Monitoramento e observabilidade

## Padrões de Produção

### Padrão 1: Processamento de Dados Escalável

Processamento de dados em escala empresarial com computação distribuída:

- Arquitetura de scaling horizontal
- Design tolerante a falhas
- Processamento em tempo real e em lote
- Validação de qualidade de dados
- Monitoramento de performance

### Padrão 2: Deploy de Modelo de ML

Sistema de ML em produção com alta disponibilidade:

- Serving de modelo com baixa latência
- Infraestrutura de testes A/B
- Integração com feature store
- Monitoramento de modelo e detecção de drift
- Pipelines de retreinamento automatizado

### Padrão 3: Inferência em Tempo Real

Sistema de inferência de alto throughput:

- Estratégias de batching e caching
- Load balancing
- Auto-scaling
- Otimização de latência
- Otimização de custos

## Melhores Práticas

### Desenvolvimento

- Desenvolvimento dirigido por testes
- Code reviews e pair programming
- Documentação como código
- Versionamento de tudo
- Integração contínua

### Produção

- Monitore tudo que é crítico
- Automatize deployments
- Feature flags para releases
- Deployments canário
- Logging abrangente

### Liderança de Equipe

- Mentoring de engenheiros juniores
- Direcionamento de decisões técnicas
- Estabelecimento de padrões de código
- Fomento de cultura de aprendizado
- Colaboração cross-funcional

## Metas de Performance

**Latência:**
- P50: < 50ms
- P95: < 100ms
- P99: < 200ms

**Throughput:**
- Requisições/segundo: > 1000
- Usuários simultâneos: > 10.000

**Disponibilidade:**
- Uptime: 99,9%
- Taxa de erro: < 0,1%

## Segurança e Conformidade

- Autenticação e autorização
- Criptografia de dados (em repouso e em trânsito)
- Tratamento de PII e anonimização
- Conformidade GDPR/CCPA
- Auditorias de segurança regulares
- Gestão de vulnerabilidades

## Comandos Comuns

```bash
# Development
python -m pytest tests/ -v --cov
python -m black src/
python -m pylint src/

# Training
python scripts/train.py --config prod.yaml
python scripts/evaluate.py --model best.pth

# Deployment
docker build -t service:v1 .
kubectl apply -f k8s/
helm upgrade service ./charts/

# Monitoring
kubectl logs -f deployment/service
python scripts/health_check.py
```

## Recursos

- Padrões Avançados: `references/mlops_production_patterns.md`
- Guia de Implementação: `references/llm_integration_guide.md`
- Referência Técnica: `references/rag_system_architecture.md`
- Scripts de Automação: diretório `scripts/`

## Responsabilidades no Nível Sênior

Como profissional de classe mundial sênior:

1. **Liderança Técnica**
   - Direcionamento de decisões arquiteturais
   - Mentoring de membros da equipe
   - Estabelecimento de melhores práticas
   - Garantia de qualidade de código

2. **Pensamento Estratégico**
   - Alinhamento com objetivos de negócio
   - Avaliação de trade-offs
   - Planejamento para escala
   - Gestão de débito técnico

3. **Colaboração**
   - Trabalho entre equipes
   - Comunicação eficaz
   - Construção de consenso
   - Compartilhamento de conhecimento

4. **Inovação**
   - Atualização com pesquisas recentes
   - Experimentação com novas abordagens
   - Contribuição para a comunidade
   - Direcionamento de melhoria contínua

5. **Excelência em Produção**
   - Garantia de alta disponibilidade
   - Monitoramento proativo
   - Otimização de performance
   - Resposta a incidentes
