Ml Rl Decision Loop

判断任务是否该用强化学习、选哪条路线。用户问"强化学习适不适合/reward 怎么设计/ Q-learning 和 Sarsa 区别/exploration exploitation/agent 训练不动"时激活。 动作: 验资格(延迟奖赏+序贯决策缺一不可)→模型可知否(有模型→动态规划; 免模型→蒙特 卡罗 vs 时序差分)→配探索利用折中(ε贪心/Softmax)→状态大时表格升级函数逼近。 不适用于: 一次性预测、有即时标签任务。 trigger: reinforcement learning, MDP, reward design, Q-learning, Sarsa, exploration exploitation, 奖赏函数。

fieldlu 76863e8 2 files · 22.1 KB Updated

File contents

fieldlu/Machine-learning-skills/tree/main/skills/ml-rl-decision-loop commit 76863e8fbf

Frequently asked questions

npx skillmds@latest add fieldlu/ml-rl-decision-loop