[论文解读] Revisit Policy Optimization in Matrix Form
本文提出了一种策略优化的矩阵形式,将策略与环境动态解耦,从而实现更高效且可解释的优化。通过使用解耦的转移矩阵和策略向量重新表述价值函数与策略梯度,该方法为策略梯度与TRPO提供了统一框架,并在梯度准确性方面提供了理论保证,同时具备向基于模型的强化学习扩展的潜力。
In tabular case, when the reward and environment dynamics are known, policy evaluation can be written as $\bm{V}_{\bmπ} = (I - γP_{\bmπ})^{-1} \bm{r}_{\bmπ}$, where $P_{\bmπ}$ is the state transition matrix given policy ${\bmπ}$ and $\bm{r}_{\bmπ}$ is the reward signal given ${\bmπ}$. What annoys us is that $P_{\bmπ}$ and $\bm{r}_{\bmπ}$ are both mixed with ${\bmπ}$, which means every time when we update ${\bmπ}$, they will change together. In this paper, we leverage the notation from \cite{wang2007dual} to disentangle ${\bmπ}$ and environment dynamics which makes optimization over policy more straightforward. We show that policy gradient theorem \cite{sutton2018reinforcement} and TRPO \cite{schulman2015trust} can be put into a more general framework and such notation has good potential to be extended to model-based reinforcement learning.
研究动机与目标
- 为解决在表格型MDP中,策略相关的转移与奖励矩阵使策略优化复杂化的问题。
- 开发一种基于矩阵的表示方法,将策略与环境动态分离,从而显式体现价值函数对策略参数的依赖。
- 在此框架内重新表述策略梯度与TRPO,以实现更清晰的优化与理论分析。
- 通过独立估计环境动态,为向基于模型的强化学习扩展提供可能。
提出的方法
- 引入一种矩阵形式,其中转移矩阵 $P$ 与策略 $\bm{\pi}$ 解耦,且 $P \in \mathbb{R}^{|S||A| \times |S|}$,$\bm{\pi} \in \mathbb{R}^{|S||A| \times 1}$。
- 将状态-动作价值函数表示为 $\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$,其中 $\Pi$ 为编码策略的对角矩阵。
- 通过价值函数的基于迹的微分推导策略梯度,得到 $\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$。
- 提出近似函数 $L^2$、$L^3$ 和 $L^4$ 以分解真实策略梯度,其中 $L^2 + L^3$ 在一阶上与真实梯度一致。
- 利用恒等式 $\nabla_\theta \eta(\bm{\pi}_\theta) = \nabla_\theta L^2 + \nabla_\theta L^3$ 实现稳定的策略更新。
- 建立近似与真实目标之间的误差界,表明 $\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$。
实验结果
研究问题
- RQ1能否以矩阵形式重新表述策略优化,以实现策略与环境动态的解耦?
- RQ2该重构是否能实现对策略目标更直接、更高效的优化?
- RQ3该新矩阵框架能否统一策略梯度定理与TRPO?
- RQ4由此形式化推导出的梯度近似有多准确?
- RQ5近似与真实策略目标之间的理论误差界是什么?
主要发现
- 该矩阵形式成功地将策略 $\bm{\pi}$ 与环境动态 $P$ 解耦,使得 $\bm{V}_{\bm{\pi}}$ 对 $\bm{\pi}$ 的依赖显式体现,即 $\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$。
- 策略梯度被精确推导为 $\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$,该表达式精确且可计算。
- 梯度分解 $\nabla_\theta L^2 + \nabla_\theta L^3 = \nabla_\theta \eta(\bm{\pi}_\theta)$ 确保了近似的首阶准确性。
- 近似 $L^3$ 具有有界误差:$\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$。
- 近似 $L^4$ 具有二次误差界:$\|\eta(\tilde{\bm{\pi}}) - L^4(\tilde{\bm{\pi}})\| \leq \frac{2\gamma D_{KL}(\bm{\pi}, \tilde{\bm{\pi}}) \|\bm{A}_{\bm{\pi}}\|}{(1 - \gamma)^2}$。
- 该框架支持基于模型的强化学习,允许独立估计 $P$,并基于估计的动态更新价值函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。