Skip to main content
QUICK REVIEW

[論文レビュー] Revisit Policy Optimization in Matrix Form

Sitao Luan, Xiao-Wen Chang|arXiv (Cornell University)|Sep 19, 2019
Optimization and Search Problems参考文献 4被引用数 6
ひとこと要約

本稿では、方策と環境ダイナミクスを分離する行列形式の政策最適化を提案し、より効率的で解釈可能な最適化を可能にする。遷移行列と方策ベクトルを独立して扱うことで、価値関数と方策勾配を再定式化し、方策勾配法とTRPOを統一するフレームワークを提供する。勾配の正確性に関する理論的保証に加え、モデルベース強化学習への応用可能性も示唆する。

ABSTRACT

In tabular case, when the reward and environment dynamics are known, policy evaluation can be written as $\bm{V}_{\bmπ} = (I - γP_{\bmπ})^{-1} \bm{r}_{\bmπ}$, where $P_{\bmπ}$ is the state transition matrix given policy ${\bmπ}$ and $\bm{r}_{\bmπ}$ is the reward signal given ${\bmπ}$. What annoys us is that $P_{\bmπ}$ and $\bm{r}_{\bmπ}$ are both mixed with ${\bmπ}$, which means every time when we update ${\bmπ}$, they will change together. In this paper, we leverage the notation from \cite{wang2007dual} to disentangle ${\bmπ}$ and environment dynamics which makes optimization over policy more straightforward. We show that policy gradient theorem \cite{sutton2018reinforcement} and TRPO \cite{schulman2015trust} can be put into a more general framework and such notation has good potential to be extended to model-based reinforcement learning.

研究の動機と目的

  • 表形式MDPにおける方策依存の遷移行列と報酬行列が政策最適化を複雑にするという課題に対処すること。
  • 方策と環境ダイナミクスを分離する行列ベースの表記法を構築し、価値関数が方策パラメータに明示的に依存することを可能にすること。
  • このフレームワーク内での方策勾配とTRPOの再定式化を通じて、最適化と理論的分析を明確にすること。
  • 環境ダイナミクスを方策とは独立に推定可能であるため、モデルベース強化学習への応用可能性を高めること。

提案手法

  • 遷移行列 $P$ を方策 $\bm{\pi}$ から分離する行列形式を導入し、$P \in \mathbb{R}^{|S||A| \times |S|}$ および $\bm{\pi} \in \mathbb{R}^{|S||A| \times 1}$ とする。
  • 状態行動価値関数を $\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$ として表現する。ここで $\Pi$ は方策を符号化する対角行列である。
  • 価値関数のトレースに基づく微分を用いて方策勾配を導出する。その結果、$\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$ が得られる。
  • 真の政策勾配を分解するための近似関数 $L^2$、$L^3$、$L^4$ を提案し、$L^2 + L^3$ が真の勾配を一次の精度で再現することを示す。
  • 恒等式 $\nabla_\theta \eta(\bm{\pi}_\theta) = \nabla_\theta L^2 + \nabla_\theta L^3$ を用いることで、安定な方策更新を可能にする。
  • 近似と真の目的関数の間の誤差バウンドを確立し、$\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$ を示す。

実験結果

リサーチクエスチョン

  • RQ1方策最適化を行列形式に再定式化することで、方策と環境ダイナミクスを分離できるか?
  • RQ2この再定式化により、方策目的関数のより直接的で効率的な最適化が可能になるか?
  • RQ3方策勾配定理とTRPOが、この新しい行列フレームワークで統一できるか?
  • RQ4この定式化から導かれる勾配近似の正確性はどの程度か?
  • RQ5近似された方策目的関数と真の目的関数との間の理論的誤差バウンドは何か?

主な発見

  • 行列形式により、方策 $\bm{\pi}$ と環境ダイナミクス $P$ が明示的に分離され、$\bm{V}_{\bm{\pi}} = (I - \gamma P\Pi)^{-1}\bm{r}_{\bm{\pi}}$ を通じて $\bm{V}_{\bm{\pi}}$ が $\bm{\pi}$ に明示的に依存することが実現された。
  • 方策勾配は $\nabla_\theta \eta(\bm{\pi}_\theta) = \text{trace}(\bm{A}_{\bm{\pi}} \bm{\rho}_0^T \frac{\partial \Pi_\theta}{\partial \theta})$ として正確かつ計算可能に導出された。
  • 勾配分解 $\nabla_\theta L^2 + \nabla_\theta L^3 = \nabla_\theta \eta(\bm{\pi}_\theta)$ により、近似の一次の精度が保証された。
  • $L^3$ の誤差は有界である:$\|\eta(\tilde{\bm{\pi}}) - L^3(\tilde{\bm{\pi}})\| \leq \frac{\gamma \sqrt{2D_{KL}(\bm{\pi}, \tilde{\bm{\pi}})} \|\bm{A}_{\bm{\pi}}\|}{1 - \gamma}$。
  • $L^4$ の誤差は二次的である:$\|\eta(\tilde{\bm{\pi}}) - L^4(\tilde{\bm{\pi}})\| \leq \frac{2\gamma D_{KL}(\bm{\pi}, \tilde{\bm{\pi}}) \|\bm{A}_{\bm{\pi}}\|}{(1 - \gamma)^2}$。
  • 環境ダイナミクス $P$ を方策とは独立に推定可能であるため、このフレームワークはモデルベース強化学習をサポートする。価値関数の更新は推定されたダイナミクスに基づく。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。