LLM Serving Capacity Planner

Parse SGLang/vLLM startup logs for GPU memory decomposition (weights, KV pool, CUDA graph, overhead) and max-concurrency estimates. Use for KV cache budget, mem-fraction-static tuning, OOM triage, or explaining why concurrency is capped.

Saddss Updated

File contents

Saddss/cursor-skills/tree/main/skills/llm-serving-capacity-planner commit 24bf11a8ec

Frequently asked questions

npx skillmds@latest add saddss/llm-serving-capacity-planner