Spatial Forcing Vla

Align intermediate visual embeddings in vision-language-action models with 3D geometric representations from pretrained foundation models. Improves spatial understanding and enables faster training (3.8x speedup) without explicit 3D inputs.

adu2021 f3a4ddf 10.1 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/spatial-forcing-vla commit f3a4ddf24f

Frequently asked questions

npx skillmds@latest add adu2021/spatial-forcing-vla