Dflash Block Diffusion Speculative Decoding

Accelerate LLM inference 6x by using block diffusion for parallel token drafting with tight coupling to the target model's hidden representations, achieving higher speedups than existing speculative methods without quality loss.

adu2021 df746cd 8.4 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/dflash-block-diffusion-speculative-decoding commit df746cdd9b

Frequently asked questions

npx skillmds@latest add adu2021/dflash-block-diffusion-speculative-decoding