Gptq

Post-training 4-bit quantization for LLMs with minimal accuracy loss. Use for deploying large models (70B, 405B) on consumer GPUs, when you need 4× memory reduction with <2% perplexity degradation, or for faster inference (3-4× speedup) vs FP16. Integrates with transformers and PEFT for QLoRA fine-tuning. Use when this capability is needed.

tomevault-io 93a9a9a 2 files · 11.9 KB Updated

File contents

tomevault-io/skills-registry/tree/main/davila7--claude-code-templates--optimization-gptq commit 93a9a9a927

Frequently asked questions

npx skillmds@latest add tomevault-io/gptq