Rl Visual Reasoning

RL in vision-language models improves inference-time alignment between vision and reasoning in mid-to-late layers, not vision ability or reasoning separately. Strategic layer freezing enables diagnosis of which components contribute to RL gains.

adu2021 38d1747 12.9 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/rl-visual-reasoning commit 38d1747538

Frequently asked questions

npx skillmds@latest add adu2021/rl-visual-reasoning