Trl Training

Trains Hugging Face TRL jobs: trl sft/dpo/grpo/kto/rloo/reward, YAML configs, LoRA/PEFT, and Accelerate multi-GPU. Use when fine-tuning or aligning transformer LMs with TRL CLI. Not for vLLM OpenAI serving, local Hub evals (hugging-face-community-evals), or sentence-transformers embedding training.

Kayforkind 488dd84 11.7 KB Updated

File contents

Kayforkind/skill-slice commit 488dd84b8c

Frequently asked questions

npx skillmds@latest add kayforkind/trl-training