Fine Tuning With Trl

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

gabrielmoreira Updated 17 repo stars

File contents

gabrielmoreira/agent-skills-mirror/tree/main/mirrors/repos/moltis-org@moltis/crates/skills/src/assets/mlops/training/fine-tuning-with-trl commit 1bc8fe394d

Frequently asked questions

npx skillmds@latest add gabrielmoreira/fine-tuning-with-trl