Monet Latent Visual Reasoning

Enable multimodal LLMs to generate and reason with latent visual embeddings as intermediate thoughts: implement supervised fine-tuning to produce continuous visual representations, then optimize via VLPO to treat embeddings as learnable actions in reinforcement learning.

adu2021 b058697 16.0 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/monet-latent-visual-reasoning commit b0586979ef

Frequently asked questions

npx skillmds@latest add adu2021/monet-latent-visual-reasoning