Clipo Contrastive Policy Optimization

Augment verifiable reward RL (RLVR) with contrastive learning to generate dense auxiliary rewards. Enforce proximity among correct reasoning trajectories in embedding space while suppressing errors, amplifying invariant reasoning patterns.

adu2021 e35d073 8.8 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/clipo-contrastive-policy-optimization commit e35d073610

Frequently asked questions

npx skillmds@latest add adu2021/clipo-contrastive-policy-optimization