Constitutional AI

Método da Anthropic para treinar IA inofensiva através de auto-aprimoramento. Abordagem em duas fases - aprendizado supervisionado com auto-crítica/revisão, depois RLAIF (RL from AI Feedback). Use para alinhamento de segurança, redução de outputs prejudiciais sem rótulos humanos. Alimenta o sistema de segurança do Claude.

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/safety-alignment-constitutional-ai commit 0e4cbadc66

Frequently asked questions

npx skillmds@latest add artubss/constitutional-ai