Speculative Decoding

Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies. Use when this capability is needed.

tomevault-io ea9f0a0 2 files · 14.4 KB Updated

File contents

tomevault-io/skills-registry/tree/main/davila7--claude-code-templates--emerging-techniques-speculative-decoding commit ea9f0a0341

Frequently asked questions

npx skillmds@latest add tomevault-io/speculative-decoding