Exgrpo Learning From Experience

Improve LLM reasoning efficiency by systematically reusing past rollouts through experience replay. ExGRPO organizes training data by success and diversity, applying a mixed-policy objective that prioritizes high-quality examples while maintaining exploration, achieving 3.5-7.6 point gains over on-policy methods.

adu2021 c382a33 14.5 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/exgrpo-learning-from-experience commit c382a33bfb

Frequently asked questions

npx skillmds@latest add adu2021/exgrpo-learning-from-experience