Skip to main content
QUICK REVIEW

[論文レビュー] Generalized discounted continuous-time Markov decision processes

Xianping Guo, Yi Zhang|arXiv (Cornell University)|Apr 11, 2013
Economic Policies and Impacts被引用数 3
ひとこと要約

本稿では、非有界な遷移率および状態依存またはゼロの割引率を伴うポーランド空間上の一般化割引付き連続時間マルコフ決定過程(CTMDP)を解くための変換手法を導入する。これにより、割引率なしの総合的基準の分析が可能になる。非履歴依存クラスの外で、決定的(非制約)および確率的(制約付き)の定常最適方策の存在を確立し、非制約ケースにおける最適性方程式を提示する。

ABSTRACT

This article investigates the generalized discounted criteria for possibly explosive continuous-time Markov decision processes (CTMDPs) in Polish spaces with unbounded transition and reward rates, which allow the discount factors to be state-dependent and zero-valued, and thus cover the otherwise underdeveloped total undiscounted criteria for non-absorbing CTMDPs. Nontrivially, we, under very mild conditions, develop the transformation method, which reduces our CTMDP problems to their discrete-time analogues, and then show the existence of a deterministic (resp., randomized) stationary optimal policy for the unconstrained (resp., constrained) CTMDPs, where the optimality is out of the class of history-dependent policies. Moreover, the optimality equation for the unconstrained case is also established. Quite differently from the case of standard discounted CTMDPs with a constant discount factor, we show that the transformation method could be inapplicable to the concerned CTMDPs with generalized discount factors when our conditions are violated.

研究の動機と目的

  • 非吸収的連続時間マルコフ決定過程における割引率なしの基準の理論的基盤の欠如に対処すること。
  • CTMDP理論を非有界な遷移率および報酬率を許容するように拡張すること。
  • 弱い条件下で連続時間問題を離散時間類似問題に還元する変換手法を開発すること。
  • 非制約および制約付きCTMDPに対して、それぞれ決定的および確率的定常最適方策の存在を確立すること。
  • 一般化割引付き非制約CTMDPケースにおける最適性方程式を導出すること。

提案手法

  • 状態依存またはゼロの割引率を伴う一般化割引付きCTMDPを、同等の離散時間MDPに写像する変換手法を提案する。
  • 還元が有効であり最適性が保たれるように、弱い条件下で変換を適用する。
  • 動的計画法の原則を用いて、非制約ケースにおける最適性方程式を導出する。
  • 履歴依存でないクラスに属する定常方策の中で最適方策の存在を確立する。
  • 仮定が満たされない場合に変換手法が失敗する構造的条件を分析する。
  • 非有界な率および一般状態空間を取り扱うために、ポーランド空間における測度論的道具を用いる。

実験結果

リサーチクエスチョン

  • RQ1どのような条件下で、状態依存またはゼロの割引率を伴う一般化割引付きCTMDPを、変換によって離散時間MDPに還元できるか?
  • RQ2非有界な遷移率および報酬率を伴う非制約CTMDPに対して、決定的定常最適方策が存在するか?
  • RQ3同じ条件下で、制約付きCTMDPに対して確率的定常最適方策を保証できるか?
  • RQ4非制約一般化割引付きCTMDPにおける最適性方程式の形は何か?
  • RQ5弱い条件が満たされない場合、なぜ変換手法が失敗するのか?

主な発見

  • 弱い条件下で、状態依存またはゼロの割引率を伴う一般化割引付きCTMDPを離散時間類似問題に還元する変換手法が開発された。
  • 非有界な率を伴う非制約CTMDPに対して、決定的定常最適方策の存在が証明された。
  • 同じ枠組み下で、制約付きCTMDPに対して確率的定常最適方策が確立された。
  • 非制約ケースに対して最適性方程式が導出され、古典的結果が一般化割引に拡張された。
  • 弱い条件が満たされない場合、変換手法が適用不能であることが示され、これらの仮定の必要性が強調された。
  • 定数割引率を伴う標準的CTMDPの結果が、これまで未発展であったより広範なケースに一般化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。