RL-02-赵-基于模型:贝尔曼/Bellman公式02【状态价值(State Values):v_π(s)】【①依赖于状态 s;②依赖于策略 π;③不依赖于时间步 t】 发布时间:2026/9/29 2:10:37 拓冰企业网站定制 2.3 状态价值(State Values)前面提到,回报(Returns)可以用于评价策略(Policies)。但是,在随机系统(Stochastic Systems)中,直接使用单条轨迹的回报并不合适,因为从同一状态出发可能得到不同的回报。为了解决这一问题,本节引入状态价值(State Value)的概念。首先,需要介绍一些必要的符号。考虑时间步序列t=0,1,2,…t=0,1,2,\ldotst 网站建设 企业官网 运营推广 返回列表