Dsdr Dual Scale Diversity Regularization

Improve LLM reasoning by promoting diversity at both trajectory and token levels simultaneously. Global (trajectory) scale rewards distinct correct solutions; local (token) scale applies entropy regularization per decision point. Dual-scale approach couples these via diversity-weighted allocation: solutions that are globally more distinctive receive stronger local regularization, focusing exploration where it matters most among underexplored correct modes.

adu2021 5605b29 8.4 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/dsdr-dual-scale-diversity-regularization commit 5605b29d3f

Frequently asked questions

npx skillmds@latest add adu2021/dsdr-dual-scale-diversity-regularization