Skip to main content
QUICK REVIEW

[论文解读] Revisit Policy Optimization in Matrix Form

Sitao Luan, Xiao-Wen Chang|arXiv (Cornell University)|Sep 19, 2019
Optimization and Search Problems参考文献 4被引用 6
一句话总结

本文提出了一种策略优化的矩阵形式,将策略与环境动态解耦,从而实现更高效且可解释的优化。通过使用解耦的转移矩阵和策略向量重新表述价值函数与策略梯度,该方法为策略梯度与TRPO提供了统一框架,并在梯度准确性方面提供了理论保证,同时具备向基于模型的强化学习扩展的潜力。

ABSTRACT

In tabular case, when the reward and environment dynamics are known, policy evaluation can be written as $\bm{V}_{\bmπ} = (I - γP_{\bmπ})^{-1} \bm{r}_{\bmπ}$, where $P_{\bmπ}$ is the state transition matrix given policy ${\bmπ}$ and $\bm{r}_{\bmπ}$ is the reward signal given ${\bmπ}$. What annoys us is that $P_{\bmπ}$ and $\bm{r}_{\bmπ}$ are both mixed with ${\bmπ}$, which means every time when we update ${\bmπ}$, they will change together. In this paper, we leverage the notation from \cite{wang2007dual} to disentangle ${\bmπ}$ and environment dynamics which makes optimization over policy more straightforward. We show that policy gradient theorem \cite{sutton2018reinforcement} and TRPO \cite{schulman2015trust} can be put into a more general framework and such notation has good potential to be extended to model-based reinforcement learning.

研究动机与目标

  • 为解决在表格型MDP中,策略相关的转移与奖励矩阵使策略优化复杂化的问题。
  • 开发一种基于矩阵的表示方法,将策略与环境动态分离,从而显式体现价值函数对策略参数的依赖。
  • 在此框架内重新表述策略梯度与TRPO,以实现更清晰的优化与理论分析。
  • 通过独立估计环境动态,为向基于模型的强化学习扩展提供可能。

提出的方法

  • 引入一种矩阵形式,其中转移矩阵 $P$ 与策略 $\bm{\pi}$ 解耦,且 $P \in \mathbb{R}^{|S||A| \times |S|}$,$\bm{\pi} \in \mathbb{R}^{|S||A| \times 1}$。
  • 将状态-动作价值函数表示为 $\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$,其中 $\Pi$ 为编码策略的对角矩阵。
  • 通过价值函数的基于迹的微分推导策略梯度,得到 $\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$。
  • 提出近似函数 $L^2$、$L^3$ 和 $L^4$ 以分解真实策略梯度,其中 $L^2 + L^3$ 在一阶上与真实梯度一致。
  • 利用恒等式 $\nabla_\theta \eta(\bm{\pi}_\theta) = \nabla_\theta L^2 + \nabla_\theta L^3$ 实现稳定的策略更新。
  • 建立近似与真实目标之间的误差界,表明 $\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$。

实验结果

研究问题

  • RQ1能否以矩阵形式重新表述策略优化,以实现策略与环境动态的解耦?
  • RQ2该重构是否能实现对策略目标更直接、更高效的优化?
  • RQ3该新矩阵框架能否统一策略梯度定理与TRPO?
  • RQ4由此形式化推导出的梯度近似有多准确?
  • RQ5近似与真实策略目标之间的理论误差界是什么?

主要发现

  • 该矩阵形式成功地将策略 $\bm{\pi}$ 与环境动态 $P$ 解耦,使得 $\bm{V}_{\bm{\pi}}$ 对 $\bm{\pi}$ 的依赖显式体现,即 $\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$。
  • 策略梯度被精确推导为 $\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$,该表达式精确且可计算。
  • 梯度分解 $\nabla_\theta L^2 + \nabla_\theta L^3 = \nabla_\theta \eta(\bm{\pi}_\theta)$ 确保了近似的首阶准确性。
  • 近似 $L^3$ 具有有界误差:$\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$。
  • 近似 $L^4$ 具有二次误差界:$\|\eta(\tilde{\bm{\pi}}) - L^4(\tilde{\bm{\pi}})\| \leq \frac{2\gamma D_{KL}(\bm{\pi}, \tilde{\bm{\pi}}) \|\bm{A}_{\bm{\pi}}\|}{(1 - \gamma)^2}$。
  • 该框架支持基于模型的强化学习,允许独立估计 $P$,并基于估计的动态更新价值函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。