Vfm Visual Tokenizer

Use frozen vision foundation models like DINOv2 and CLIP as image tokenizers for autoregressive generation. Region-adaptive quantization identifies semantically coherent areas and reduces redundancy. Achieves 256-token encoding (vs. 576), 3× AR model speedup, state-of-the-art 1.36 gFID on ImageNet while eliminating classifier-free guidance.

adu2021 38d3828 16.2 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/vfm-visual-tokenizer commit 38d3828e65

Frequently asked questions

npx skillmds@latest add adu2021/vfm-visual-tokenizer