Atr Grpo Policy Divergence

Replace ratio-based clipping in GRPO with KL-divergence constraints using the KL3 estimator, improving exploration and training stability with asymmetric clipping that requires no additional computation.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/atr-grpo-policy-divergence commit 08a0c312c8

Frequently asked questions

npx skillmds@latest add adu2021/atr-grpo-policy-divergence