Skip to main content
QUICK REVIEW

[論文レビュー] A New Condition for the Existence of Optimal Stationary Policies in Denumerable State Average Cost Continuous Time Markov Decision Processes with Unbounded Cost and Transition Rates

Ping Cao, Jingui Xie|arXiv (Cornell University)|Apr 22, 2015
Fault Detection and Control Systems参考文献 7被引用数 3
ひとこと要約

本稿は、非有界コストおよび非有界遷移レートを伴う可算状態連続時間マーカフ決定過程(CTMDPs)における最適定常方策の存在条件を新たに導入する。最適方策の存在を、基準状態への期待到着時間および期待コストの有限性と結びつけることで、既存のキューイングシステムの安定性結果を活用し、複雑な関数構築を回避する。これにより、検証が著しく簡素化され、緩い条件下でも平均コスト最適性方程式が成立することが保証される。

ABSTRACT

This paper presents a new condition for the existence of optimal stationary policies in average-cost continuous-time Markov decision processes with unbounded cost and transition rates, arising from controlled queueing systems. This condition is closely related to the stability of queueing systems. It suggests that the proof of the stability can be exploited to verify the existence of an optimal stationary policy. This new condition is easier to verify than existing conditions. Moreover, several conditions are provided which suffice for the average-cost optimality equality to hold.

研究の動機と目的

  • 非有界コストおよび非有界遷移レートを伴う連続時間マーカフ決定過程における最適定常方策の検証の課題に対処すること。
  • 従来の関数ベースの手法よりも検証が容易な、平均コスト最適定常方策の存在条件を構築すること。
  • 最適方策の存在を、関連するキューイングシステムの安定性と結びつけることで、既存の安定性解析を再利用可能にする。
  • 平均コスト最適性方程式(ACOE)が成立する十分条件を確立すること。

提案手法

  • 任意の状態から基準状態への期待到着時間および期待コストの有限性に基づく、新たな存在条件を提案する。
  • 「標準方策」の概念を用いる——具体的には、状態 i₀ への期待到着時間および期待コストが有限である場合、その方策は i₀-標準と呼ばれる。
  • 指数重み付きのリャプノフ関数アプローチを用い、遷移レートおよびコスト関数を含む不等式を用いて期待コストの有限性を検証する。
  • 理論的にはユニフォーム化法を用いるが、特にその方法が失敗する非有界レートの状況を焦点とし、直接的なCTMDP解析を正当化する。
  • 方策が i₀-標準であり、特定のドリフト条件を満たす場合、平均コスト最適性不等式(ACOI)が成立することを確立する。
  • 各状態で有限個の遷移が可能な「有限活動」条件が成り立つ場合、ACOEが全状態で成立することを証明する。

実験結果

リサーチクエスチョン

  • RQ1複雑な検証関数の構築を伴わずに、非有界CTMDPsにおける最適定常方策の存在を確立できるか?
  • RQ2キューイング理論におけるシステム安定性結果を、CTMDPsにおける方策最適性の検証にどの程度活用できるか?
  • RQ3非有界レートおよび非有界コストを伴う可算状態CTMDPsにおいて、平均コスト最適性方程式(ACOE)がどの条件下で成立するか?
  • RQ4到着時間およびコストの有限性の確認に帰着させることで、最適方策の検証を簡素化する条件は存在するか?

主な発見

  • 本稿で提案する最適定常方策の存在条件は、基準状態への期待到着時間および期待コストの有限性に基づくものであり、従来の関数ベースの条件よりも検証が容易である。
  • 2キュー系における優先順位サービス(PS)方策が 0-標準方策であることが証明され、新条件のもとでその最適性が確認された。
  • PS方策下での原点への期待コストが、指数重み付きリャプノフ関数および不等式制約を用いて有限であることが示された。
  • 方策が i₀-標準であり、各状態で有限個の遷移が可能な場合、すべての状態で平均コスト最適性方程式(ACOE)が成立する。
  • 本手法により、既存のキューイング理論における安定性結果を再利用し、問題固有の関数を構築することなく方策最適性を確立できる。
  • コスト関数が状態ベクトルに関して単調増加かつ多項式的である場合にも結果が拡張可能であり、適用範囲が広がる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。