Openrlhf Ray Distributed Reinforcement Learning

Distributed RLHF training (PPO, GRPO, DPO) for large models using Ray.

robertoatila Updated

File contents

robertoatila/jarvis-skill-registry/tree/main/skills/openrlhf-ray-distributed-reinforcement-learning commit 2f9433c01c

Frequently asked questions

npx skillmds@latest add robertoatila/openrlhf-ray-distributed-reinforcement-learning