RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】

发布时间:2026/9/24 2:45:26
RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】 二、TD learning of state valuesTD learning既可以指一大类的强化学习算法,也可以指一个具体的estimating state values的算法。TD算法是基于数据,也就是不基于模型来实现强化学习。1、TD算法描述TD算法要求的data/experience如下:给定π ππ产生的( s 0 , r 1 , s 1 , … , s t , r t + 1 , s t + 1 , … ) o r { ( s t , r t + 1 , s t + 1 ) } t (s_0,r_1,s_1,\ldots,s_t,r_{t+1},s_{t+1},\ldots)\mathrm{~or~}\{(s_t,r_{t+1},s_{t+1})\}_t(s0​,r1​,s1​,…,st​,rt+1​,st+1​,…)or{(st​,rt+1​,st+1​)}t​TD算法如下:{ v t + 1 ( s t ) = v t ( s t ) − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ] ] v t + 1 ( s ) = v t ( s ) , ∀ s ≠ s t \color{red}{ \left \{\begin{array} {l}v_{t+1}(s_t)=v_t(s_t)-\alpha_t(s_t)\Big[v_t(s_t)-[r_{t+1}+\gamma v_t(s_{t+1})]\Big]\\[1ex] \\v_{t+1}(s)=v_t(s),\quad\forall s\neq s_t \end{array} \right.}⎩⎨⎧​vt+1​(st​)=vt​(st​)−αt​(st​)[vt​(st​)−[rt+1​+γvt​(st+1​)]]vt+1​(s)=vt​(s),∀s=st​​其中:t = 0 , 1 , 2 , . . . t=0,1,2,...t=0,1,2,...,这里的v t ( s t ) v_t(s_t)vt​(st​)是v π ( s t ) v_\pi(s_t)vπ​(st​)的estimated state value,s ss是state space,α t ( s t ) \alpha_t(s_t)αt​(st​)是在t tt时刻s t s_tst​的学习率。在t tt时刻,只有visited states t s_tst​的值被更新,而unvisited statess ≠ s t s\neq s_ts=st​的 values 保持不变。在等式 (2) 中的更新过程在后面的内容中将被省略2、TD算法详细解析对TD算法进行一些标注:v t + 1 ( s t ) ⏟ newestimate = v t ( s t ) ⏟ currentestimate − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ⏟ υ ˉ t TDtarget v ˉ t ] ] ⏞ TDerror δ t \color{red}{ \underbrace{v_{t+1}(s_t)}_{\text{new estimate}} =\underbrace{v_t(s_t)}_{\text{current estimate}} - \alpha_t(s_t)[\overbrace{v_t(s_t)-[\underbrace{r_{t+1}+\gamma v_t(s_{t+1})}_{\bar{\upsilon}_t}^{\text{TD target }\bar{v}_t}]]}^{\text{TD error}\ \delta_t}}newestimatevt+1​(st​)​​=currentestimatevt​(st​)​​−αt​(st​)[vt​(st​)−[TDtargetvˉt​rt+1​+γvt​(st+1​)​​]]​TDerrorδt​​其中:v ˉ t ≐ r t + 1 + γ v ( s t + 1 ) \bar{v}_t\doteq r_{t+1}+\gamma v(s_{t+1})vˉt​≐rt+1​+γv(st+1​)被称为TD target。δ t ≐ v ( s t ) − [ r t + 1 + γ v ( s t + 1 ) ] = v ( s t ) − v ˉ t \begin{aligned}\delta_t\doteq v(s_t)-[r_{t+1}+\gamma v(s_{t+1})]=v(s_t)-\bar{v}_t\end{aligned}δt​≐v(s

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询