Llamaguard

Meta's 7-8B specialized moderation model for LLM input/output filtering. 6 safety categories - violence/hate, sexual content, weapons, substances, self-harm, criminal planning. 94-95% accuracy. Deploy with vLLM, HuggingFace, Sagemaker. Integrates with NeMo Guardrails.

qcmuu Updated 0 repo stars

File contents

qcmuu/AI-Research-Skills/tree/main/07-safety-alignment/llamaguard commit 69a6b24144

Frequently asked questions

npx skillmds@latest add qcmuu/llamaguard