Gdpo Multi Reward Optimization

Optimize language models against multiple reward signals simultaneously by decoupling reward normalization. GDPO prevents reward combination collapse that undermines training signal quality when aligning models to multiple human preferences like accuracy, safety, efficiency, and format compliance.

adu2021 abb8d73 3.9 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/gdpo-multi-reward-optimization commit abb8d73dae

Frequently asked questions

npx skillmds@latest add adu2021/gdpo-multi-reward-optimization