Gguf Quantization

GGUF format and llama.cpp quantization for efficient CPU/GPU inference. Use when deploying models on consumer hardware, Apple Silicon, or when needing flexible quantization from 2-8 bit without GPU requirements. Use when this capability is needed.

tomevault-io Updated

File contents

tomevault-io/skills-registry/tree/main/davila7--claude-code-templates--optimization-gguf commit 2d1edaeef0

Frequently asked questions

npx skillmds@latest add tomevault-io/gguf-quantization