RL-07-赵-不基于模型2-计算V/StateValue-TD算法:狭义TD算法02【公式:vₜ₊₁(sₜ)=vₜ(sₜ)−αₜ(sₜ)[vₜ(sₜ)-[rₜ₊₁+γvₜ(sₜ₊₁)]] 】
2026/9/28 21:15:59
网站建设
项目流程
1、时序差分学习(Temporal-Difference Learning,TD Learning)概览
![]()
图 1|第 7 讲:时序差分学习的整体内容
这张课件给出了第 7 讲Temporal-Difference Learning(时序差分学习)的整体结构。课程共分为 8 个部分:
- Motivating example(激励示例),9 分钟;
- TD algorithm: introduction and interpretation(TD 算法:介绍与解释),14 分钟;
- TD algorithm: convergence and comparison(TD 算法:收敛性与比较),16 分钟;
- Sarsa,16 分钟;
- Expected Sarsa and n-step Sarsa(Expected Sarsa 与