Trl Fine Tuning

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

gabrielmoreira Updated 17 repo stars

File contents

gabrielmoreira/agent-skills-mirror/tree/main/mirrors/repos/NousResearch@hermes-agent/optional-skills/mlops/training/trl-fine-tuning commit 7e250364eb

Frequently asked questions

npx skillmds@latest add gabrielmoreira/trl-fine-tuning