Listener Rewarded Vlm Preferences

Aligns reasoning traces with final decisions in preference models using an independent frozen VLM as listener. Achieves 67.4% accuracy on ImageReward by enforcing consistency between explanations and choices. Use when training reward models for image generation quality where both reasoning quality and accuracy matter.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/listener-rewarded-vlm-preferences commit 0ca0140680

Frequently asked questions

npx skillmds@latest add adu2021/listener-rewarded-vlm-preferences