Rloo

Reinforcement Learning with Leave-One-Out estimation for policy optimization. Covers RLOOTrainer, reward function integration, baseline estimation, and variance reduction techniques for stable RL training. Includes thinking-aware patterns.

majiayu000 c5a47b1 2 files · 10.8 KB Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/data/rloo commit c5a47b1421

Frequently asked questions

npx skillmds add majiayu000/rloo