![RL-07-赵-不基于模型2-计算V/StateValue-TD算法:狭义TD算法02【公式:vₜ₊₁(sₜ)=vₜ(sₜ)−αₜ(sₜ)[vₜ(sₜ)-[rₜ₊₁+γvₜ(sₜ₊₁)]] 】](http://pic.xiahunao.cn/yaotu/RL-07-赵-不基于模型2-计算V/StateValue-TD算法:狭义TD算法02【公式:vₜ₊₁(sₜ)=vₜ(sₜ)−αₜ(sₜ)[vₜ(sₜ)-[rₜ₊₁+γvₜ(sₜ₊₁)]] 】)
1、时序差分学习(Temporal-Difference Learning,TD Learning)概览图 1|第 7 讲:时序差分学习的整体内容这张课件给出了第 7 讲Temporal-Difference Learning(时序差分学习)的整体结构。课程共分为 8 个部分:Motivating example(激励示例),9 分钟;TD algorithm: introduction and interpretation(TD 算法:介绍与解释),14 分钟;TD algorithm: convergence and comparison(TD 算法:收敛性与比较),16 分钟;Sarsa,16 分钟;Expected Sarsa and n-step Sarsa(Expected Sarsa 与