Checklist Técnico de Pré-Lançamento — ML, GenAI e Agentes de IA
Checklist de referência para validação antes de qualquer deploy de sistema de IA/ML para produção. Antes de considerar o lançamento aprovado, verifique cada item aplicável ao projeto. Item não verificado = corrigir ou documentar explicitamente por que não se aplica ao contexto.
1. Machine Learning Tradicional (Dados e Modelagem)
Qualidade e Sanitização de Dados
- Validação de esquemas de dados de entrada (Data Validation) contra dados nulos, fora de distribuição (Out-of-Distribution) ou tipos incorretos
- Verificação de vazamento de dados (Data Leakage) entre conjuntos de treino, validação e teste
Reprodutibilidade e Rastreabilidade
- Versionamento de artefatos de modelo, código e dados (DVC, MLflow, Weights & Biases)
- Fixação de sementes aleatórias (random seeds) para reprodutibilidade de inferência
Métricas e Baselines
- Avaliação offline comparada contra baselines heurísticas e modelos legados
- Análise de desempenho por subgrupos (Slicing Analysis) para evitar degradação em nichos específicos
Otimização de Inferência
- Aplicação de quantização (ex: FP16, INT8), poda (pruning) ou destilação de modelos quando aplicável
- Dimensionamento de latência (p95/p99) e throughput sob carga máxima
2. Generative AI e LLMs (RAG e Engenharia de Prompt)
Gestão de Prompts
- Versionamento estrito de prompts e templates no repositório ou registro de prompts
- Separação clara entre instruções de sistema (System Prompts) e entradas não confiáveis do utilizador (User Inputs)
Otimização de RAG (Retrieval-Augmented Generation)
- Avaliação das métricas de RAG: Fidelidade (Faithfulness), Relevância da Resposta (Answer Relevance), Precisão e Recuperação de Contexto (Context Precision/Recall)
- Otimização do tamanho de chunks, sobreposição (overlap) e estratégia de embedding
- Implementação de re-ranking de documentos (Cross-Encoders) para filtragem do contexto
Gestão de Custos e Limites
- Cálculo e limitação do número máximo de tokens por requisição (Input/Output)
- Estratégia de cache de respostas/embeddings (ex: Redis, GPTCache) para requisições idênticas ou semanticamente similares
- Estruturação de limites de taxa (Rate Limits) por utilizador/chave para mitigar estouro de quota de API
3. Agentes de IA e Tool Calling
Validação de Ferramentas (Tool/Function Calling)
- Validação estrita de esquema (Pydantic, JSON Schema) dos argumentos gerados pela LLM antes de chamar funções internas/APIs
- Tratamento de exceções e retorno de mensagens de erro estruturadas para o agente quando a chamada a uma ferramenta falhar
Controle de Execução e Loops
- Definição rígida do número máximo de iterações (Max Iterations/Depth) para evitar loops infinitos de raciocínio
- Implementação de tempo limite (Timeout) global para a execução completa do agente
Human-in-the-Loop (HITL)
- Intervenção humana obrigatória para ações de alto risco, irreversíveis ou com impacto financeiro/escrita em banco de dados
Isolamento e Segurança de Ambientes (Sandboxing)
- Execução de código gerado por IA exclusivamente em ambientes isolados (Containers efêmeros, microVMs, gVisor)
- Restrição de acesso a redes internas e variáveis de ambiente sensíveis a partir do agente
Gestão de Memória
- Estratégia de compressão ou sumarização do histórico de conversas quando o limite de contexto for atingido
4. Segurança, Governança e IA Ética
Proteção contra Injeção de Prompt
- Testes de Red Teaming para detecção de Direct Prompt Injection e Indirect Prompt Injection (via documentos/RAG/APIs)
- Implementação de camadas de defesa (Guardrails) na entrada e na saída (ex: NeMo Guardrails, Llama Guard)
Sanitização de Dados Sensíveis (PII)
- Filtragem e mascaramento automatizado de dados de identificação pessoal (PII) nos logs e nos dados enviados a APIs de terceiros
Detecção de Alucinação e Toxicidade
- Validadores de saída para checar conformidade estrutural, toxicidade, discurso de ódio e factualidade
Explicabilidade e Conformidade
- Registro auditável de decisões da IA, origens do contexto RAG e ferramentas executadas
- Alinhamento com regulamentações aplicáveis (ex: EU AI Act, LGPD)
5. LLMOps e Monitoramento Contínuo
Telemetria e Observabilidade
- Implementação de rastreamento de execuções (Tracing) para visualizar chamadas encadeadas de LLMs, embeddings e ferramentas (ex: LangSmith, Arize Phoenix, OpenTelemetry)
Resiliência e Fallbacks
- Estratégia de Fallback para modelos secundários (locais ou de provedores alternativos) em caso de indisponibilidade da API principal
- Tratamento do código de erro 429 Too Many Requests com retentativas e tempo de espera exponencial (Exponential Backoff)
Monitoramento Contínuo
- Alertas de desvio de distribuição (Data Drift e Concept Drift)
- Monitoramento contínuo de latência, consumo de tokens, custos acumulados e taxa de erro das chamadas de IA