Gguf Quantization

Formato GGUF e quantização llama.cpp para inferência eficiente em CPU/GPU. Use ao implantar modelos em hardware de consumidor, Apple Silicon, ou quando precisar de quantização flexível de 2-8 bits sem requisitos de GPU.

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/optimization-gguf commit 50e866ff02

Frequently asked questions

npx skillmds@latest add artubss/gguf-quantization