Margin Adaptive Dpo

Adapt DPO temperature parameters per sample using reward model margins, amplifying learning signals for hard preference pairs while dampening easy ones.

adu2021 11d9e96 9.2 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/margin-adaptive-dpo commit 11d9e96a95

Frequently asked questions

npx skillmds@latest add adu2021/margin-adaptive-dpo