AI Post Training

Post-training and alignment: reward modeling, RLHF/PPO, DPO/DAAs, GRPO, RLVR, RLAIF, over-optimization. Use when adapting an SFT model with preference or verifiable-reward signals.

gabrielmoreira Updated 17 repo stars

File contents

gabrielmoreira/agent-skills-mirror/tree/main/mirrors/repos/vasilyu1983@AI-Agents-public/frameworks/shared-skills/skills/ai-post-training commit f12a3b5519

Frequently asked questions

npx skillmds@latest add gabrielmoreira/ai-post-training