Epo Entropy Regularized Policy Optimization

Stabilize multi-turn LLM agent training with entropy-regularized policy optimization that prevents exploration-exploitation cascade failures in sparse-reward environments through trajectory-level entropy regulation, historical smoothing, and adaptive phase-based weighting. Achieve up to 152% performance improvement on scientific reasoning tasks and 19.8% on embodied control by maintaining controlled entropy oscillations across 30+ interaction turns.

adu2021 d72ea87 19.0 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/epo-entropy-regularized-policy-optimization commit d72ea8719d

Frequently asked questions

npx skillmds@latest add adu2021/epo-entropy-regularized-policy-optimization