☰
RL-10-TD算法-ActorCritic02-离线算法03-赵:Off-Policy Policy Gradient
2026/10/2 13:54:57 网站建设 项目流程



3、off-policy Policy Gradient

有了刚刚的重要性采样,我们就把这个技术应用到policy gradient当中,去实现off-policy的学习。

下面其实我们有两个步骤,第一个步骤就是要得到gradient它的表达式是什么,在得到这个gradient表达式之后,我们就可以把它应用到梯度上升的方法当中去进行优化。

就像上面的on-policy的情况,我们需要将policy gradient推导到off-policy的情

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询