Toolkit de Engenharia de Prompt
Visão Geral
Use esta skill para mover prompts de rascunhos ad-hoc para ativos de produção com testes repetíveis, versionamento e segurança de regressão. Ela enfatiza qualidade mensurável sobre intuição. Aplique-a quando lançar um novo recurso de LLM que precisa de saídas confiáveis, quando a qualidade do prompt piora após mudanças de modelo ou instrução, quando múltiplos membros do time editam prompts e precisam de histórico/diffs, quando você precisa de escolha de prompt baseada em evidências para implantação em produção, ou quando você quer governança de prompt consistente entre ambientes.
Capacidades Principais
- Avaliação de prompt A/B contra casos de teste estruturados
- Pontuação quantitativa para aderência, relevância e verificações de segurança
- Rastreamento de versão de prompt com histórico imutável e changelog
- Diffs de prompt para revisar edições com impacto no comportamento
- Templates de prompt reutilizáveis e orientação de seleção
- Fluxos de trabalho favoráveis à regressão para atualizações de modelo/prompt
Fluxos de Trabalho Principais
1. Executar Teste A/B de Prompt
Prepare casos de teste JSON e execute:
python3 scripts/prompt_tester.py \
--prompt-a-file prompts/a.txt \
--prompt-b-file prompts/b.txt \
--cases-file testcases.json \
--runner-cmd 'my-llm-cli --prompt {prompt} --input {input}' \
--format text
A entrada também pode vir de stdin/--input JSON payload.
2. Escolher Vencedor com Evidências
O testador pontua saídas por caso e agrega:
- cobertura de conteúdo esperado
- violações de conteúdo proibido
- conformidade de regex/formato
- sanidade de comprimento de saída
Use o prompt de maior pontuação como baseline candidato, depois execute a suite de regressão.
3. Versionar Prompts
# Adicionar versão
python3 scripts/prompt_versioner.py add \
--name support_classifier \
--prompt-file prompts/support_v3.txt \
--author alice
# Diff de versões
python3 scripts/prompt_versioner.py diff --name support_classifier --from-version 2 --to-version 3
# Changelog
python3 scripts/prompt_versioner.py changelog --name support_classifier
4. Loop de Regressão
- Armazene versão baseline.
- Proponha edições de prompt.
- Execute novamente o teste A/B.
- Promova apenas se pontuação e restrições de segurança melhorarem.
Interfaces de Script
python3 scripts/prompt_tester.py --help- Lê prompts/casos de stdin ou
--input - Comando de runner externo opcional
- Emite métricas de texto ou JSON
- Lê prompts/casos de stdin ou
python3 scripts/prompt_versioner.py --help- Gerencia histórico de prompt (
add,list,diff,changelog) - Armazena metadados e snapshots de conteúdo localmente
- Gerencia histórico de prompt (
Armadilhas, Melhores Práticas & Checklist de Revisão
Evite esses erros:
- Escolher prompts de saídas de caso único — use uma suite de teste realista e rica em casos extremos.
- Mudar prompt e modelo simultaneamente — sempre isole variáveis.
- Perder verificações de
must_not_contain(conteúdo proibido) nos critérios de avaliação. - Editar prompts sem metadados de versão, autor ou justificativa de mudança.
- Pular diffs semânticos antes de implantar uma nova versão de prompt.
- Otimizar um benchmark enquanto prejudica casos extremos — rastreie a suite completa.
- Troca de modelo sem reexecutar a suite A/B baseline.
Antes de promover qualquer prompt, confirme:
- A intenção da tarefa é explícita e inequívoca.
- O schema/formato de saída é explícito.
- Restrições de segurança e exclusão são explícitas.
- Sem instruções contraditórias.
- Sem tokens de verbosidade desnecessários.
- A pontuação A/B melhora e a contagem de violação permanece zero.
Referências
- references/prompt-templates.md
- references/technique-guide.md
- references/evaluation-rubric.md
- README.md
Design de Avaliação
Cada caso de teste deve definir:
input: entrada realista similar à produçãoexpected_contains: marcadores/conteúdo obrigatóriosforbidden_contains: frases ou conteúdo inseguro não permitidoexpected_regex: padrões estruturais obrigatórios
Isso habilita gradação determinística entre variantes de prompt.
Política de Versionamento
- Use identificadores de prompt semânticos por funcionalidade (
support_classifier,ad_copy_shortform). - Registre autor + nota de mudança para cada revisão.
- Nunca sobrescreva versões históricas.
- Faça diff antes de promover um novo prompt para produção.
Estratégia de Implantação
- Crie versão de prompt baseline.
- Proponha prompt candidato.
- Execute suite A/B contra os mesmos casos.
- Promova apenas se o vencedor melhora a média e mantém a contagem de violação em zero.
- Rastreie feedback pós-lançamento e alimente novos casos de falha de volta na suite de teste.