☰
RL-07-赵-不基于模型2-计算V/StateValue-TD算法:狭义TD算法02【公式:vₜ₊₁(sₜ)=vₜ(sₜ)−αₜ(sₜ)[vₜ(sₜ)-[rₜ₊₁+γvₜ(sₜ₊₁)]] 】
2026/9/28 21:15:59 网站建设 项目流程

1、时序差分学习(Temporal-Difference Learning,TD Learning)概览

图 1|第 7 讲:时序差分学习的整体内容

这张课件给出了第 7 讲Temporal-Difference Learning(时序差分学习)的整体结构。课程共分为 8 个部分:

  1. Motivating example(激励示例),9 分钟;
  2. TD algorithm: introduction and interpretation(TD 算法:介绍与解释),14 分钟;
  3. TD algorithm: convergence and comparison(TD 算法:收敛性与比较),16 分钟;
  4. Sarsa,16 分钟;
  5. Expected Sarsa and n-step Sarsa(Expected Sarsa 与

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询