Ml Alignment Rlhf

对齐方法论:下一词预测≠听人话、RLHF 三阶段(SFT→奖励模型→PPO)、奖励黑客识别与缓解、 DPO 免强化学习替代、对齐税权衡。用户问"RLHF 怎么回事/为何先 SFT 再训奖励模型/base 和 chat 模型差在哪"、纠结"PPO 还是 DPO"、发现模型讨好废话格式空转时激活;E 为对齐决策树。 不适用于: 微调档位(ml-pretraining-paradigm)、大模型评测(ml-llm-evaluation)。 trigger: RLHF, reward model 奖励模型, PPO, DPO, reward hacking 奖励黑客

fieldlu 6e5e758 2 files · 23.8 KB Updated

File contents

fieldlu/Machine-learning-skills/tree/main/skills/ml-alignment-rlhf commit 6e5e7581d7

Frequently asked questions

npx skillmds@latest add fieldlu/ml-alignment-rlhf