Deployment

Serve a quantized or unquantized LLM checkpoint as an OpenAI-compatible API endpoint using vLLM, SGLang, or TRT-LLM. Use when user says "deploy model", "serve model", "start vLLM server", "launch SGLang", "TRT-LLM deploy", "AutoDeploy", "benchmark throughput", "serve checkpoint", or needs an inference endpoint from a HuggingFace or ModelOpt-quantized checkpoint. Do NOT use for quantizing models (use ptq) or evaluating accuracy (use evaluation).

NVIDIA f9b25eb 10 files · 61.6 KB Updated 2.2k repo stars

File contents

nvidia/model-optimizer/tree/main/plugins/modelopt/skills/deployment commit f9b25eb3c5

Frequently asked questions

npx skillmds@latest add nvidia/deployment