Vllm Caching

vLLM tiered KV cache configuration for production H100/H200 clusters. Native CPU offload, LMCache (CPU+NVMe+GDS), NixlConnector (disaggregated prefill), MooncakeConnector (RDMA), MultiConnector composition. Version gates, sizing math (flag total across TP, not per-GPU — opposite of SGLang), KV-vs-weights offload distinction operators most often get wrong.

air-gapped 7c41f74 8 files · 114.2 KB Updated

File contents

air-gapped/skills/tree/main/.claude/skills/vllm-caching commit 7c41f7428a

Frequently asked questions

npx skillmds@latest add air-gapped/vllm-caching