Fine Tuning With Trl

TRL: SFT, DPO, PPO, GRPO, reward modeling for LLM RLHF.

WyattJY Updated

File contents

WyattJY/codex-skills/tree/main/skills/t7-shield-full/hermes/hermes-agent/skills/mlops/training/trl-fine-tuning commit 4a6b31659c

Frequently asked questions

npx skillmds@latest add wyattjy/fine-tuning-with-trl