Gptq

Quantização pós-treinamento em 4-bits para LLMs com perda mínima de precisão. Use para implantar modelos grandes (70B, 405B) em GPUs de consumo, quando você precisa de redução de memória 4× com <2% de degradação de perplexidade, ou para inferência mais rápida (aceleração de 3-4×) vs FP16. Integra com transformers e PEFT para fine-tuning QLoRA.

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/optimization-gptq commit 89d90bdbe4

Frequently asked questions

npx skillmds@latest add artubss/gptq