Segment Policy Optimization

Segment-level credit assignment for RL in LLMs using Monte Carlo advantage estimation, enabling precise reward attribution without critic models for improved reasoning task performance.

adu2021 436f01e 5.4 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/segment-policy-optimization commit 436f01ef3c

Frequently asked questions

npx skillmds@latest add adu2021/segment-policy-optimization