Ptq

Use when the user asks to "quantize a model", "run PTQ", "post-training quantization", "NVFP4 quantization", "FP8 quantization", "INT8 quantization", "INT4 AWQ", "quantize LLM", "quantize MoE", "quantize VLM", or needs to produce a quantized HuggingFace checkpoint from a pretrained model using ModelOpt. Do NOT use for multi-candidate recipe exploration or optimization (use quant-recipe-search).

NVIDIA afa5f6c 6 files · 54.9 KB Updated 2.2k repo stars

File contents

nvidia/model-optimizer/tree/main/plugins/modelopt/skills/ptq commit afa5f6ca9f

Frequently asked questions

npx skillmds@latest add nvidia/ptq