Dppo Divergence Policy

Replace PPO's heuristic ratio-based clipping with Divergence Proximal Policy Optimization (DPPO) that directly constrains policy divergence using either Total Variation or KL, enabling lightweight approximations (Binary, Top-K) for vocabulary-scale computations while improving stability and efficiency.

adu2021 7698dc0 9.2 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/dppo-divergence-policy commit 7698dc05d5

Frequently asked questions

npx skillmds@latest add adu2021/dppo-divergence-policy