Vllm Serving Planner

Use when planning, reviewing, or tuning vLLM or OpenAI-compatible LLM serving for throughput, latency, KV-cache pressure, batching, quantization, prefix caching, or multimodal serving.

mouadja02 812468d 3 files · 5.5 KB Updated

File contents

mouadja02/skills/tree/main/skills/llm-tooling/vllm-serving-planner commit 812468db35

Frequently asked questions

npx skillmds@latest add mouadja02/vllm-serving-planner