Livr Visual Reasoning

Enable richer visual reasoning in multimodal models via learnable latent tokens trained with visual bottlenecking. Introduces special tokens that implicitly learn task-relevant visual abstractions without explicit supervision, through attention masking forcing visual information through latents—improving vision-heavy tasks without task-specific annotations.

adu2021 dbf0601 2.6 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/livr-visual-reasoning commit dbf060134f

Frequently asked questions

npx skillmds@latest add adu2021/livr-visual-reasoning