Adaptive Speculative Decoding

Accelerate LLM inference 1.5-2x using a universal draft model that adapts to user data in real-time, handling different target models and tokenizers via online n-gram cache and hybrid distillation.

adu2021 22aeaf3 18.2 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/adaptive-speculative-decoding commit 22aeaf33bd

Frequently asked questions

npx skillmds@latest add adu2021/adaptive-speculative-decoding