Skip to main content
QUICK REVIEW

[論文レビュー] Policy Learning of MDPs with Mixed Continuous/Discrete Variables: A Case Study on Model-Free Control of Markovian Jump Systems

Joao Paulo Jansch-Porto, Bin Hu|arXiv (Cornell University)|Jun 4, 2020
Reinforcement Learning in Robotics参考文献 40被引用数 5
ひとこと要約

本稿は、混合連続/離散状態を有するハイブリッドMDPであるマルコフ過程付き線形システム(MJLS)におけるモデルフリー強化学習のためのデータ駆動型自然方策勾配法を提案する。制御理論を用いた方策パラメータ化と、ベースラインを用いたREINFORCEを活用することで、システムの動的特性や遷移確率の同定を必要とせず、最適な状態フィードバック制御を学習し、シミュレーションでほぼ最適な性能を達成した。

ABSTRACT

Markovian jump linear systems (MJLS) are an important class of dynamical systems that arise in many control applications. In this paper, we introduce the problem of controlling unknown (discrete-time) MJLS as a new benchmark for policy-based reinforcement learning of Markov decision processes (MDPs) with mixed continuous/discrete state variables. Compared with the traditional linear quadratic regulator (LQR), our proposed problem leads to a special hybrid MDP (with mixed continuous and discrete variables) and poses significant new challenges due to the appearance of an underlying Markov jump parameter governing the mode of the system dynamics. Specifically, the state of a MJLS does not form a Markov chain and hence one cannot study the MJLS control problem as a MDP with solely continuous state variable. However, one can augment the state and the jump parameter to obtain a MDP with a mixed continuous/discrete state space. We discuss how control theory sheds light on the policy parameterization of such hybrid MDPs. Then we modify the widely used natural policy gradient method to directly learn the optimal state feedback control policy for MJLS without identifying either the system dynamics or the transition probability of the switching parameter. We implement the (data-driven) natural policy gradient method on different MJLS examples. Our simulation results suggest that the natural gradient method can efficiently learn the optimal controller for MJLS with unknown dynamics.

研究の動機と目的

  • 混合連続/離散状態変数を有するハイブリッドMDPにおける方策ベース強化学習の課題に対処すること。
  • 未知の離散時間マルコフ過程付き線形システム(MJLS)の最適制御を、RLアルゴリズムのベンチマークとして定式化すること。
  • システムの動的特性や遷移確率パラメータの同定を必要としない、データ駆動型方策最適化手法を開発すること。
  • 自然方策勾配とREINFORCE推定子およびベースラインを用いた手法が、MJLSにおける最適制御器の学習に有効であることを示すこと。
  • 勾配射影を用いた構造的制御器設計を検討し、非構造的最適ゲインの単純射影の限界を明らかにすること。

提案手法

  • ジャンプパラメータをMJLS状態に統合し、混合連続/離散状態空間を有するハイブリッドMDPを構築する。
  • MJLS制御理論の知見を活用して方策をパラメータ化し、最適制御解と構造的一致を確保する。
  • 自然方策勾配(NPG)法をハイブリッドMDPに適応させ、単純な平均ベースラインを用いたREINFORCE方策勾配推定子を用いる。
  • システム同定を必要とせず、オンポリシーのロールアウトから方策勾配を推定する確率的勾配更新則を実装する。
  • 勾配射影を適用して制御器に構造的制約(例:出力フィードバック)を課し、所望のスパarsityやアクセス制限を維持する。
  • 初期ノイズ分散によるステップサイズのチューニングを伴い、推定された自然勾配に基づく反復的方策更新(勾配降下法)を実行する。

実験結果

リサーチクエスチョン

  • RQ1システムの動的特性やスイッチングパラメータが未知であるMJLSに対して、モデルフリー方策勾配法が効果的に最適制御器を学習できるか。
  • RQ2混合連続/離散状態変数を有するハイブリッドMDPにおいて、自然方策勾配法が標準的なRLベースラインと比較してどのように性能を発揮するか。
  • RQ3制御理論に基づく方策パラメータ化が、MJLS制御におけるサンプル効率と収束性に与える影響は何か。
  • RQ4全状態フィードバックが利用できない状況でも、勾配ベース最適化により構造的制御器を効果的に学習できるか。
  • RQ5非構造的最適制御器を構造的空間に単純に射影することで良好な制御器が得られるか、それとも能動的学習が必要か。

主な発見

  • REINFORCEと平均ベースラインを用いた自然方策勾配法は、システムの動的特性やジャンプ遷移確率の同定を必要とせず、MJLSに対してほぼ最適な制御器を学習した。
  • 2モードの小規模な例では、フィードバックなしの期待コスト8.4861から、最適非構造的ゲインの2.5704へ低下し、100イテレーション後に構造的フィードバックで6.2226へ改善された。
  • 100モードの大型系では、25,000~50,000サンプルのバッチサイズを用いて、方策コスト推定の相対誤差が5%未満に抑えられた。
  • サンプル数の増加に伴い、方策コストの相対誤差が減少し、収束性とサンプル効率が示された。
  • 最適非構造的制御器を構造的空間(例:出力フィードバック)に単純に射影した場合、フィードバックなしのコスト(13.3227)よりも悪化したため、能動的方策学習の必要性が示された。
  • 計算複雑度がリカッチ方程式の連立解法に依存せず、モード訪問頻度にのみ依存するため、システムサイズに応じた良好なスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。