Awq Quantization

Quantize large language models to 4-bit using activation-aware weight quantization, achieving ~3x speedup with minimal accuracy loss for deployment on limited GPU memory.

Orchestra Research Updated 10.4k repo stars

File contents

Orchestra-Research/AI-Research-SKILLs/tree/main/10-optimization/awq commit 773a52944b

Frequently asked questions

npx skillmds@latest add orchestra-research/awq-quantization