Uniql Quantization Pruning

Single cloud-side weight-sorting and fine-tuning supporting multiple on-device pruning rates via efficient SVD and MLP decomposition, achieving 4-5.7× memory reduction and 2.7-3.4× throughput across Transformers, SSMs, and hybrid architectures.

adu2021 ba61108 3.5 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/uniql-quantization-pruning commit ba61108b9a

Frequently asked questions

npx skillmds@latest add adu2021/uniql-quantization-pruning