Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence of Optimal Actions for Markov Decision Processes and the Optimality of $(s,S)$ Policies for Inventory Control

Eugene A. Feinberg, Mark Edward Lewis|arXiv (Cornell University)|Jul 17, 2015
Supply Chain and Inventory Management被引用数 8
ひとこと要約

本稿は、弱連続な遷移、非有界コスト、非コンパクトな行動集合を伴う割引報酬および平均コストのマルコフ決定過程(MDP)において、最適行動の収束を確立する。有限ホライズンの最適行動が無限ホライズンのものに収束すること、割引報酬の最適行動が平均コストの最適行動に収束することを証明し、これらの結果を応用して、離散的・連続的需要の仮定や高額な欠品コストペナルティを仮定しない在庫管理における(s,S)ポリシーの最適性を示す。

ABSTRACT

This paper describes results on the existence of optimal policies and convergence properties of optimal actions for discounted and average-cost Markov Decision Processes (MDPs) with weakly continuous transition probabilities. It is possible that cost functions are unbounded and action sets are not compact. The following results are established for such MDPs: (i) convergence of value iterations to optimal values for discounted problems with possibly non-zero terminal costs, (ii) convergence of optimal finite-horizon actions to optimal infinite-horizon actions for total discounted costs, as the time horizon tends to infinity, and (iii) convergence of optimal discount-cost actions to optimal average-cost actions for infinite-horizon problems, as the discount factor tends to 1. The general results on MDPs are applied to the classic stochastic periodic-review inventory control problems with backorders, for which they imply the optimality of $(s,S)$ policies and convergence properties of optimal thresholds. In particular we analyze inventory control problems without two assumptions often used in the literature: (a) the demand is either discrete or continuous or (b) backordering is more expensive that the cost of backordered inventory if the backordered amount is large.

研究の動機と目的

  • 弱連続な遷移確率を有する割引報酬および平均コストMDPにおける最適行動の収束を確立すること。
  • 非有界コスト関数および非コンパクトな行動集合を有するMDPを分析し、文献における一般的な仮定を緩和すること。
  • 一般MDPの収束結果を、確率的定期レビュー在庫管理問題に応用すること。
  • 離散的または連続的需要分布の仮定をしない在庫管理モデルにおける(s,S)ポリシーの最適性を証明すること。
  • 大規模な欠品に対して欠品コストが在庫保有コストを上回ることを仮定しないこと。

提案手法

  • 割引報酬MDPに対して価値反復を用い、非ゼロの終端コストを伴う場合の最適値への収束を証明する。
  • 遷移確率の弱連続性を適用して、時間ホライズンが増加する際、最適有限ホライズン行動が無限ホライズン行動に収束することを保証する。
  • 割引因子が1に近づく際、最適割引報酬行動が最適平均コスト行動に収束することを確立する。
  • 動的計画法の技術と連続性の議論を用いて、非有界コスト関数および非コンパクトな行動集合を扱う。
  • 一般MDP収束結果を、欠品を許容する定期レビュー在庫モデルの特定構造に適用する。
  • 導出された条件下で(s,S)ポリシーが最適であることを示し、標準的な需要やコストの仮定がなくても成立することを示す。

実験結果

リサーチクエスチョン

  • RQ1時間ホライズンが無限大に近づく際、MDPにおける最適有限ホライズン行動が最適無限ホライズン行動に収束する条件は何か?
  • RQ2割引因子が1に近づく際、最適割引報酬MDPの行動が最適平均コスト行動にどのように収束するか?
  • RQ3離散的または連続的需要分布の仮定をしない在庫管理モデルにおいて(s,S)ポリシーを最適と証明できるか?
  • RQ4大規模な欠品に対して欠品コストが在庫保有コストを上回ることを仮定しない場合でも、(s,S)ポリシーの最適性は保たれるか?
  • RQ5弱連続性および非有界コストの下で、価値反復および最適行動の収束を保証するMDPの一般的な条件は何か?

主な発見

  • 非有界コストおよび非ゼロの終端コストを伴う割引報酬MDPにおいて、価値反復は最適値に収束する。
  • 時間ホライズンが無限大に近づく際、最適有限ホライズン行動は、合計割引報酬の最適無限ホライズン行動に収束する。
  • 割引因子が1に近づく際、最適割引報酬行動は最適平均コスト行動に収束する。
  • 欠品を許容する定期レビュー在庫管理において(s,S)ポリシーは最適であり、離散的または連続的需要の仮定がなくても成立する。
  • 大規模な欠品レベルにおいて欠品コストが在庫保有コストを上回ることを仮定しない場合でも、(s,S)ポリシーの最適性は保たれる。
  • 結果は、弱連続な遷移確率、非有界コスト関数、非コンパクトな行動集合を有するMDPに拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。