Hqq Quantization

Quantize large language models to 8/4/3/2/1-bit precision without calibration data, using multiple optimized backends for deployment with vLLM or HuggingFace Transformers.

Orchestra Research Updated 10.4k repo stars

File contents

Orchestra-Research/AI-Research-SKILLs/tree/main/10-optimization/hqq commit 773a52944b

Frequently asked questions

npx skillmds@latest add orchestra-research/hqq-quantization