Fine Tuning With Trl

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

NousResearch Updated

File contents

NousResearch/hermes-agent commit fd3342af63

Frequently asked questions

npx skillmds@latest add nousresearch/fine-tuning-with-trl