ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-10-赵-Actor-Critic03:DPG03【Deterministic Actor-Critic】【梯度优化:θₜ₊₁=θₜ+αᶿ∇ᶿμ(sₜ)(∇ₐqᵤ(sₜ,a))|a=μ(sₜ)】

RL-10-赵-Actor-Critic03:DPG03【Deterministic Actor-Critic】【梯度优化:θₜ₊₁=θₜ+αᶿ∇ᶿμ(sₜ)(∇ₐqᵤ(sₜ,a))|a=μ(sₜ)】 二、The algorithm of deterministic actor-critic基于policy gradient,the gradient-ascent algorithm就可以最大化J ( θ ) J(\theta)
返回列表