Ml Deep Training Playbook

深度网络训练不动的系统排查纪律。当用户报"loss 不降/NaN/训练发散"、纠结初始化(Xavier/He)、 BatchNorm 还是 LayerNorm、Adam 还是 SGD、warmup、梯度消失爆炸怎么治时激活。核心动作:按 "数据管道→小样本过拟合→初始化归一化→学习率扫描→优化器调度→梯度监控"固定顺序排除, 先廉价检查后昂贵实验,每步带完成标准与判停条件。不适用于:训练正常但泛化差(ml-diagnosis)、 架构未定(ml-transformer-era)。触发词: loss 不降, NaN, diverge, gradient vanishing, warmup, Adam vs SGD

fieldlu b3464b2 2 files · 20.0 KB Updated

File contents

fieldlu/Machine-learning-skills/tree/main/skills/ml-deep-training-playbook commit b3464b2231

Frequently asked questions

npx skillmds@latest add fieldlu/ml-deep-training-playbook