ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-10-TD算法-ActorCritic02-离线算法04-赵:Off-Policy AC【与On-Policy AC的唯一区别:分母用β(aₜ|sₜ)代替π(aₜ|sₜ,θₜ), 没有了探索性】

RL-10-TD算法-ActorCritic02-离线算法04-赵:Off-Policy AC【与On-Policy AC的唯一区别:分母用β(aₜ|sₜ)代替π(aₜ|sₜ,θₜ), 没有了探索性】 4、off-policy actor-critic 算法同样地,TheOff-Policy Policy Gradient减去一个baselineb ( s ) b(s)
返回列表