Skip to main content
QUICK REVIEW

[論文レビュー] A Dual Approach to Constrained Markov Decision Processes with Entropy Regularization

Donghao Ying, Yuhao Ding|arXiv (Cornell University)|Oct 17, 2021
Reinforcement Learning in Robotics参考文献 28被引用数 4
ひとこと要約

本稿は、softmaxパラメータ化の下でエントロピー正則化付き制約付きマルコフ決定過程(CMDP)に対して、滑らかなラグランジュ双対性を活用した二重アプローチを提案する。これにより収束が加速される。双対変数のための射影付き加速勾配降下法と、内側ループにおけるネイチャラル方策勾配法を用い、最適性ギャップおよび制約違反の両方について、$\widetilde{\mathcal{O}}(1/T)$ のグローバル収束レートを達成する。

ABSTRACT

We study entropy-regularized constrained Markov decision processes (CMDPs) under the soft-max parameterization, in which an agent aims to maximize the entropy-regularized value function while satisfying constraints on the expected total utility. By leveraging the entropy regularization, our theoretical analysis shows that its Lagrangian dual function is smooth and the Lagrangian duality gap can be decomposed into the primal optimality gap and the constraint violation. Furthermore, we propose an accelerated dual-descent method for entropy-regularized CMDPs. We prove that our method achieves the global convergence rate $\widetilde{\mathcal{O}}(1/T)$ for both the optimality gap and the constraint violation for entropy-regularized CMDPs. A discussion about a linear convergence rate for CMDPs with a single constraint is also provided.

研究の動機と目的

  • 最適化の観点から、制約付きMDPにおけるエントロピー正則化の理論的有効性を確立すること。
  • スレイター条件および探索的初期分布の下で、ラグランジュ双対関数の滑らかさを分析すること。
  • 証明可能な収束レートを有する、エントロピー正則化CMDPのグローバルに収束するアルゴリズムを開発すること。
  • 単一制約CMDPに分析を拡張し、二分探索に基づく双対法を用いて線形収束を示すこと。

提案手法

  • ソフトマックス方策パラメータ化の下で、ラグランジュ双対関数の滑らかさを誘導するため、エントロピー正則化を活用する。
  • 双対変数(ラグランジュ乗数)を更新するための射影付き加速勾配降下法を用いる。
  • 各双対反復に対して、プライマル方策を最適化するために内側ループでネイチャラル方策勾配法を採用する。
  • 割引エントロピー正則化項を用いて、双対ギャップをバネッジするための不等式を確立する。
  • 強い双対性およびパフォーマンス差分の補題を適用し、プライマル最適性ギャップおよび制約違反を双対ギャップに関連付ける。
  • 正則化問題を、正則化重み $\tau$ が小さい場合の標準CMDPを解くためのウォームスタートとして扱う。

実験結果

リサーチクエスチョン

  • RQ1ソフトマックスパラメータ化の下で、エントロピー正則化は、CMDPのラグランジュ双対関数の滑らかさを誘導できるか?
  • RQ2エントロピー正則化CMDPに対して、双対降下法が達成できる収束レートは何か?
  • RQ3エントロピー正則化の存在が、標準CMDP手法と比較してより高速な収束を可能にするか?
  • RQ4エントロピー正則化項を用いて双対ギャップを上界で抑えられ、標準CMDPの近似にどのように影響するか?
  • RQ5二分探索に基づく双対法を用いることで、単一制約CMDPに対して線形収束レートが達成可能か?

主な発見

  • スレイター条件および探索的初期分布の下で、ラグランジュ双対関数は滑らかであり、加速最適化が可能になる。
  • 双対最適性ギャップにおける $\mathcal{O}(\varepsilon)$ の誤差は、プライマル最適性ギャップおよび制約違反の両方で $\mathcal{O}(\sqrt{\varepsilon})$ の誤差をもたらす。
  • 提案された加速双対降下法は、最適性ギャップおよび制約違反の両方について、$\widetilde{\mathcal{O}}(1/T)$ のグローバル収束レートを達成する。
  • 単一制約CMDPに対しては、二分探索に基づく双対法が線形収束レートを達成する。
  • 双対ギャップは $\tau \log|\mathcal{A}| / (1 - \gamma)$ で上界が与えられ、$\tau$ が小さいほど双対ギャップが小さくなり、標準CMDPへの良好な近似が得られる。
  • エントロピー正則化解は、特に $\tau = \mathcal{O}(\epsilon)$ の場合に、元のCMDPを解くためのウォームスタートとして機能する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。