ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-10-TD算法-ActorCritic04-连续动作控制03:TD3

RL-10-TD算法-ActorCritic04-连续动作控制03:TD3 第一章 TD3简介1 TD3出现的背景在深度强化学习的发展过程中,连续动作控制(Continuous Action Control)一直是一个非常重要的问题。例如:自动驾驶中的方向盘角度控制;机械臂关节力矩控制;无人机姿态控制;机器人行走控制。这些任务中的动作通常不是简单的几个离散选项,而是:a∈Rna\in\mathbb{R}^na∈
返回列表