Production Add Diffusion Model

Productionize a vLLM-Omni diffusion model after its Day-0 vertical slice works. Use when work requires official API parity and input limits, feature-combination evidence, online FP8, distributed layerwise offload, per-request Cache-DiT, CUDA/ROCm/NPU/XPU recipes, faster or sparse attention, fused operators, USP or disaggregation analysis, continuous batching and abort handling, long-running RPS stability, or accuracy/performance/reliability CI. For initial architecture porting, registry wiring, and basic weight loading, use add-diffusion-model first.

vllm-project a54e728 6 files · 90.7 KB Updated

File contents

vllm-project/vllm-omni/tree/main/.claude/skills/production-add-diffusion-model commit a54e72823a

Frequently asked questions

npx skillmds add vllm-project-vllm-omni/production-add-diffusion-model