RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法01:基本概念【用参数化的函数来拟合π,来取代表格形式的π(表格中每个元素直接保存了某个s-a对的π概率值)】

发布时间:2026/9/27 6:57:03
RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法01:基本概念【用参数化的函数来拟合π,来取代表格形式的π(表格中每个元素直接保存了某个s-a对的π概率值)】 从本文开始,将从value-based methods转向到policy-based methods,从value function approximation到policy function approximation。一、Basic idea of policy gradient到目前,我们的policies都是用tables表示的。如下是所有state的action probabilities,存储在一个tableπ ( a ∣ s ) \pi(a|s)π(a∣s),表格中的每个实体由一个state和一个action表示【表格中每个元素直接保存了某个s-a对的π概率值】。我们可以直接访问或改变表格中的一个值。到目前为止 其实我们所有的策略全都是用表格来表示的比如说我有一些状态每一个状态就对应这个一行我有一些action 每一个action就对应一列 我想去里边找某一个状态下我take action a3它的概率是多少呢?我直接去这个表格当中就能找到 所以之前的策略全部是用表格的形式来表达的它表格的基本操作还是比较简单的 我想去里边访问一个量或者是我想改变一个量直接通过索引就可以实现现在,我们可以把表格改成函数。policies/策略用参数化的函数表示。π ( a ∣ s , θ ) \pi(a|s,\theta)π(a∣s,θ)其中θ ∈ R m \theta\in\mathbb{R}^mθ∈Rm是一个参数向量,可以用来表示π ππ这个函数里边的参数。例如,这个函数可以是一个神经网络(现在用的最广泛的这种函数的形式实际上就是神经网络),它的输入是s ss,输出是采取每个action的概率,参数是θ \thetaθ;Value Function Approximation函数中的参数我们用w ww来表示;Policy Gradient Methods 函数的参数我们用θ θθ来表示;优势:当state space比较大时(有非常多的state,甚至这个state是连续变化的那有无穷多个),表格化的表示是低效的,尤其是针对存储和泛化能力。泛化就是比如说我要去更新

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询