Rlhf

Understanding Reinforcement Learning from Human Feedback (RLHF) for aligning language models. Use when learning about preference data, reward modeling, policy optimization, or direct alignment algorithms like DPO.

majiayu000 e04c2dd 2 files · 13.1 KB Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/data/rlhf commit e04c2dd0a0

Frequently asked questions

npx skillmds add majiayu000/rlhf