Skip to main content
QUICK REVIEW

[論文レビュー] Discounted Continuous-time Markov Decision Processes with Unbounded Rates: the Dynamic Programming Approach

Alexey Piunovskiy, Yi Zhang|arXiv (Cornell University)|Mar 1, 2011
Reinforcement Learning in Robotics参考文献 21被引用数 9
ひとこと要約

本稿は、ボレル状態および制御空間における非有界な遷移率およびコスト率を有する連続時間マルコフ決定過程(CTMDP)に対して、決定的かつ定常的な最適方策の存在を確立する。キタエフの構成と動的計画法を用いて、制御された過程が正則であること、最適値関数に対してベルマン方程式が成立することを証明し、コンパクト性・連続性の条件下で、非有界なレートと一般のコスト関数に対しても最適方策が存在することを示す。

ABSTRACT

This paper deals with unconstrained discounted continuous-time Markov decision processes in Borel state and action spaces. Under some conditions imposed on the primitives, allowing unbounded transition rates and unbounded (from both above and below) cost rates, we show the regularity of the controlled process, which ensures the underlying models to be well defined. Then we develop the dynamic programming approach by showing that the Bellman equation is satisfied (by the optimal value). Finally, under some compactness-continuity conditions, we obtain the existence of a deterministic stationary optimal policy out of the class of randomized history-dependent policies.

研究の動機と目的

  • 非有界な遷移率およびコスト率を有する確率的歴史に依存する方策における制御された過程の正則性を確立すること。
  • 非有界レートを有する割引連続時間MDPにおける動的計画法のアプローチを開発すること。
  • 一般の条件下で最適値関数がベルマン方程式を満たすことを証明すること。
  • 非有界なコストおよび遷移率に対しても、決定的かつ定常的な最適方策の存在を確立すること。
  • 先行研究を拡張し、ボレル状態および制御空間、および上界および下界に非有界なコスト率を許容すること。

提案手法

  • キタエフの構成を用いて、確率的歴史に依存する方策を有するCTMDPを形式化する。
  • 制御された過程の正則性を保証するため、基本的要素(遷移率、コスト率、制御集合)に条件を課す。
  • ドゥインキンの公式およびコルモゴロフの前向き方程式を適用し、過程がマルコフ的でない場合でも制御された過程を分析する。
  • 最適値関数がベルマン方程式を満たすことを示すことで、動的計画法のアプローチを構築する。
  • 変換された値関数上で収縮写像の議論を用いて、ベルマン方程式の解の存在を証明する。
  • 検証的議論を用いて、ベルマン方程式の解が最適方策に対応することを示す。

実験結果

リサーチクエスチョン

  • RQ1非有界な遷移レートおよび非有界なコストレートを有する連続時間MDPに対して、動的計画法のアプローチを厳密に適用可能か?
  • RQ2基本的要素に関する一般の条件下で、最適値関数はベルマン方程式を満たすか?
  • RQ3非有界レートおよびボレル状態/制御空間を有するCTMDPにおいて、決定的かつ定常的な最適方策が存在するか?
  • RQ4キタエフのフレームワークによるCTMDPの標準的構成を、非有界レートを有する確率的歴史に依存する方策に拡張可能か?
  • RQ5この一般設定において、ベルマン方程式の解の存在を保証する基本的要素に関する条件は何か?

主な発見

  • 任意の確率的歴史に依存する方策に対して、制御された過程は正則であり、モデルが適切に定義されることを保証する。
  • 最適値関数はベルマン方程式を満たし、動的計画法の有効性が裏付けられる。
  • 基本的要素にコンパクト性および連続性の条件が課されれば、決定的かつ定常的な最適方策が存在する。
  • ベルマン方程式の解は有界であり、重み付き空間 $\mathbf{B}_{w'}(S)$ に属し、積分可能性が保証される。
  • 変換された値関数上で収縮写像の議論を用いて解の存在が証明され、固定点に対する明示的な上限が得られる。
  • 最適方策はハミルトニアン・ジョルダン・ベルマン方程式の最小化子から導かれる。例では、行動選択の明示的形が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。