Vcrl Variance Curriculum Rl

VCRL improves LLM mathematical reasoning by dynamically adjusting training sample difficulty based on group reward variance. Uses variance-based sampling with memory replay to focus on moderately-difficult samples where models succeed ~50% of the time, achieving 4.67-point improvement over GRPO on 8B models.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/vcrl-variance-curriculum-rl commit 52d9498f29

Frequently asked questions

npx skillmds@latest add adu2021/vcrl-variance-curriculum-rl