Value V(s) 表示 state 长期有多好。TD-learning 用 immediate reward 和 next-state value 来更新当前 value。Q-learning 把 value 扩展到 state-action pair Q(s,a),并使用 next state 的最大 Q 来学习 optimal action。真实问题 state 太多,lookup table 不现实,所以用 neural network 去近似 V 或 Q。但是 neural network 本质是 supervised learning 需要 target,而 RL 没有人工 label,所以 TD 方法用后面的 value 作为当前 state 的训练目标。
原图逐条转写
原笔记完整保留- RL 没有每一步标准答案,而是通过 Reward 学习。
- S = State,A = Action,R = Reward,π = Policy。
- Policy = 在什么 State 下选择什么 Action。
- π* = 让长期 cumulative reward 最大的最佳策略。
- γ = Discount Factor;小看眼前,大看未来。
- Exploration = 尝试未知;Exploitation = 利用当前最好。
- ε-greedy = 大部分选当前最好,少部分随机探索。
- V(s) 看 State;Q(s,a) 看 State + Action;两个都是长期价值。
- TD-Learning = 用 Next State 的 Value 修正 Current State 的 Value。
- TD Error = 新估计 − 旧估计。
- Q-Learning = 用 Next State 中最大的 Q 更新当前 Q。
- V*(s) = maxa Q*(s,a);π*(s) = argmaxa Q*(s,a)。
- max 给最大数值;argmax 给最佳 Action。
- Value Learning 学“有多好”;Policy Learning 学“怎么做”。
- Policy Gradient:结果好就提高刚才 Action 的 probability;Actor–Critic = Actor 做动作,Critic 打分。