Qad

Run explicitly requested ModelOpt Quantization-Aware Distillation (QAD) on Slurm through Megatron Bridge to recover a measured BF16-to-PTQ accuracy gap. Use only when the user explicitly asks for QAD, including its topology, data preparation, Slurm launch, resume, checkpoint export, or recovery decisions.

NVIDIA 37e20ee 5.4 KB Updated 2.2k repo stars

File contents

nvidia/model-optimizer/tree/main/plugins/modelopt/skills/qad commit 37e20ee7e5

Frequently asked questions

npx skillmds@latest add nvidia/qad