AI Post Training

Post-training and alignment: reward modeling, RLHF/PPO, DPO/DAAs, GRPO, RLVR, RLAIF, over-optimization. Use when adapting an SFT model with preference or verifiable-reward signals.

majiayu000 ca249a6 2 files · 15.6 KB Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/other/ai-post-training commit ca249a6b98

Frequently asked questions

npx skillmds add majiayu000/ai-post-training