# Prelaunch Ml Genai

> Checklist técnico de pré-lançamento para ML, GenAI e Agentes de IA. Use ao preparar releases de modelos de ML tradicionais, pipelines RAG, aplicações LLM, agentes com tool calling ou qualquer sistema com IA generativa. Cobre qualidade de dados, engenharia de prompt, RAG, tool calling, segurança IA, LLMOps e monitoramento.

- Skill: `paulohfs/prelaunch-ml-genai` (Agent Skill)
- Install (CLI): `npx skillmds@latest add paulohfs/prelaunch-ml-genai`
- Raw SKILL.md: https://api.skillmd.com/api/skills/paulohfs/prelaunch-ml-genai/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: PauloHFS (https://skillmd.com/u/paulohfs)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/paulohfs/prelaunch-ml-genai

---


# Checklist Técnico de Pré-Lançamento — ML, GenAI e Agentes de IA

Checklist de referência para validação antes de qualquer deploy de sistema de IA/ML para produção. Antes de considerar o lançamento aprovado, verifique cada item aplicável ao projeto. Item não verificado = corrigir ou documentar explicitamente por que não se aplica ao contexto.

## 1. Machine Learning Tradicional (Dados e Modelagem)

### Qualidade e Sanitização de Dados
- [ ] Validação de esquemas de dados de entrada (Data Validation) contra dados nulos, fora de distribuição (Out-of-Distribution) ou tipos incorretos
- [ ] Verificação de vazamento de dados (Data Leakage) entre conjuntos de treino, validação e teste

### Reprodutibilidade e Rastreabilidade
- [ ] Versionamento de artefatos de modelo, código e dados (DVC, MLflow, Weights & Biases)
- [ ] Fixação de sementes aleatórias (random seeds) para reprodutibilidade de inferência

### Métricas e Baselines
- [ ] Avaliação offline comparada contra baselines heurísticas e modelos legados
- [ ] Análise de desempenho por subgrupos (Slicing Analysis) para evitar degradação em nichos específicos

### Otimização de Inferência
- [ ] Aplicação de quantização (ex: FP16, INT8), poda (pruning) ou destilação de modelos quando aplicável
- [ ] Dimensionamento de latência (p95/p99) e throughput sob carga máxima

## 2. Generative AI e LLMs (RAG e Engenharia de Prompt)

### Gestão de Prompts
- [ ] Versionamento estrito de prompts e templates no repositório ou registro de prompts
- [ ] Separação clara entre instruções de sistema (System Prompts) e entradas não confiáveis do utilizador (User Inputs)

### Otimização de RAG (Retrieval-Augmented Generation)
- [ ] Avaliação das métricas de RAG: Fidelidade (Faithfulness), Relevância da Resposta (Answer Relevance), Precisão e Recuperação de Contexto (Context Precision/Recall)
- [ ] Otimização do tamanho de chunks, sobreposição (overlap) e estratégia de embedding
- [ ] Implementação de re-ranking de documentos (Cross-Encoders) para filtragem do contexto

### Gestão de Custos e Limites
- [ ] Cálculo e limitação do número máximo de tokens por requisição (Input/Output)
- [ ] Estratégia de cache de respostas/embeddings (ex: Redis, GPTCache) para requisições idênticas ou semanticamente similares
- [ ] Estruturação de limites de taxa (Rate Limits) por utilizador/chave para mitigar estouro de quota de API

## 3. Agentes de IA e Tool Calling

### Validação de Ferramentas (Tool/Function Calling)
- [ ] Validação estrita de esquema (Pydantic, JSON Schema) dos argumentos gerados pela LLM antes de chamar funções internas/APIs
- [ ] Tratamento de exceções e retorno de mensagens de erro estruturadas para o agente quando a chamada a uma ferramenta falhar

### Controle de Execução e Loops
- [ ] Definição rígida do número máximo de iterações (Max Iterations/Depth) para evitar loops infinitos de raciocínio
- [ ] Implementação de tempo limite (Timeout) global para a execução completa do agente

### Human-in-the-Loop (HITL)
- [ ] Intervenção humana obrigatória para ações de alto risco, irreversíveis ou com impacto financeiro/escrita em banco de dados

### Isolamento e Segurança de Ambientes (Sandboxing)
- [ ] Execução de código gerado por IA exclusivamente em ambientes isolados (Containers efêmeros, microVMs, gVisor)
- [ ] Restrição de acesso a redes internas e variáveis de ambiente sensíveis a partir do agente

### Gestão de Memória
- [ ] Estratégia de compressão ou sumarização do histórico de conversas quando o limite de contexto for atingido

## 4. Segurança, Governança e IA Ética

### Proteção contra Injeção de Prompt
- [ ] Testes de Red Teaming para detecção de Direct Prompt Injection e Indirect Prompt Injection (via documentos/RAG/APIs)
- [ ] Implementação de camadas de defesa (Guardrails) na entrada e na saída (ex: NeMo Guardrails, Llama Guard)

### Sanitização de Dados Sensíveis (PII)
- [ ] Filtragem e mascaramento automatizado de dados de identificação pessoal (PII) nos logs e nos dados enviados a APIs de terceiros

### Detecção de Alucinação e Toxicidade
- [ ] Validadores de saída para checar conformidade estrutural, toxicidade, discurso de ódio e factualidade

### Explicabilidade e Conformidade
- [ ] Registro auditável de decisões da IA, origens do contexto RAG e ferramentas executadas
- [ ] Alinhamento com regulamentações aplicáveis (ex: EU AI Act, LGPD)

## 5. LLMOps e Monitoramento Contínuo

### Telemetria e Observabilidade
- [ ] Implementação de rastreamento de execuções (Tracing) para visualizar chamadas encadeadas de LLMs, embeddings e ferramentas (ex: LangSmith, Arize Phoenix, OpenTelemetry)

### Resiliência e Fallbacks
- [ ] Estratégia de Fallback para modelos secundários (locais ou de provedores alternativos) em caso de indisponibilidade da API principal
- [ ] Tratamento do código de erro 429 Too Many Requests com retentativas e tempo de espera exponencial (Exponential Backoff)

### Monitoramento Contínuo
- [ ] Alertas de desvio de distribuição (Data Drift e Concept Drift)
- [ ] Monitoramento contínuo de latência, consumo de tokens, custos acumulados e taxa de erro das chamadas de IA
