Reinforce Ada Adaptive Sampling Rl Llms

Recover learning signals in RL for LLM reasoning by dynamically allocating sampling budget based on prompt difficulty. Use log-objective weighting (1/p for pass rate p) to prioritize challenging examples, achieving 2x convergence speedup versus uniform sampling while maintaining identical compute budgets across math, coding, and general benchmarks.

adu2021 7847ced 10.3 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/reinforce-ada-adaptive-sampling-rl-llms commit 7847cedf53

Frequently asked questions

npx skillmds@latest add adu2021/reinforce-ada-adaptive-sampling-rl-llms