Llada2 Diffusion Scaling

Convert pre-trained autoregressive models into large-scale diffusion language models via Warmup-Stable-Decay training strategy. Progressively increase block size during warmup, perform stable diffusion training, then decay to smaller blocks for inference. Achieve 535 tokens-per-second with document-level masking and confidence-aware training.

adu2021 3e855ba 3.3 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/llada2-diffusion-scaling commit 3e855ba69f

Frequently asked questions

npx skillmds@latest add adu2021/llada2-diffusion-scaling