Skip to main content
QUICK REVIEW

[논문 리뷰] On the Convergence of Optimal Actions for Markov Decision Processes and the Optimality of $(s,S)$ Policies for Inventory Control

Eugene A. Feinberg, Mark Edward Lewis|arXiv (Cornell University)|2015. 07. 17.
Supply Chain and Inventory Management인용 수 8
한 줄 요약

이 논문은 약한 연속성 전이를 갖는 할인비용 및 평균비용 MDP에서 최적 행동의 수렴성을 확립한다. 비유계 비용과 비유계 행동 집합을 고려하며, 유한한 수평에서의 최적 행동이 무한 수평으로 수렴하고, 할인비용 행동이 평균비용 행동으로 수렴함을 증명한다. 이러한 결과를 적용하여 이론적으로 이질적 수요 또는 높은 후순행 비용 보상 없이도 재고 제어에서 (s,S) 정책의 최적성을 입증한다.

ABSTRACT

This paper describes results on the existence of optimal policies and convergence properties of optimal actions for discounted and average-cost Markov Decision Processes (MDPs) with weakly continuous transition probabilities. It is possible that cost functions are unbounded and action sets are not compact. The following results are established for such MDPs: (i) convergence of value iterations to optimal values for discounted problems with possibly non-zero terminal costs, (ii) convergence of optimal finite-horizon actions to optimal infinite-horizon actions for total discounted costs, as the time horizon tends to infinity, and (iii) convergence of optimal discount-cost actions to optimal average-cost actions for infinite-horizon problems, as the discount factor tends to 1. The general results on MDPs are applied to the classic stochastic periodic-review inventory control problems with backorders, for which they imply the optimality of $(s,S)$ policies and convergence properties of optimal thresholds. In particular we analyze inventory control problems without two assumptions often used in the literature: (a) the demand is either discrete or continuous or (b) backordering is more expensive that the cost of backordered inventory if the backordered amount is large.

연구 동기 및 목표

  • 약한 연속 전이 확률을 갖는 할인비용 및 평균비용 MDP에서 최적 행동의 수렴성을 확립한다.
  • 비유계 비용 함수와 비유계 행동 집합을 갖는 MDP를 분석하여 기존 문헌에서 일반적으로 가정되는 조건들을 완화한다.
  • 일반적인 MDP 수렴 결과를 확률적 주기적 리뷰 재고 제어 문제에 적용한다.
  • 이질적 수요 분포를 가정하지 않고도 재고 제어에서 (s,S) 정책의 최적성을 입증한다.
  • 대용량 후순행에 대해 후순행 비용이 보관 비용을 초과해야 한다는 가정을 제거한다.

제안 방법

  • 비유계 비용과 비영인 종료 비용이 가능한 할인 MDP에서 최적 값으로의 수렴을 증명하기 위해 값 반복 기법을 사용한다.
  • 전이 확률의 약한 연속성을 적용하여 시간 수평이 증가함에 따라 유한 수평 최적 행동이 무한 수평 최적 행동으로 수렴함을 보장한다.
  • 할인 인자가 1에 수렴함에 따라 최적 할인비용 행동이 최적 평균비용 행동으로 수렴함을 확립한다.
  • 비유계 비용 함수와 비유계 행동 집합을 다루기 위해 동적 프로그래밍 기법과 연속성 추론을 활용한다.
  • 일반적인 MDP 수렴 결과를 후순행이 있는 주기적 리뷰 재고 모델의 특수한 구조에 적용한다.
  • 유도된 조건 하에서 (s,S) 정책이 최적임을 입증하며, 표준 수요 또는 비용 가정 없이도 성립함을 보여준다.

실험 결과

연구 질문

  • RQ1시간 수평이 증가함에 따라 MDP의 최적 유한 수평 행동이 최적 무한 수평 행동으로 수렴하는 조건은 무엇인가?
  • RQ2할인 인자가 1에 수렴함에 따라 최적 할인비용 MDP 행동이 최적 평균비용 행동으로 수렴하는 방식은 어떻게 되는가?
  • RQ3이질적 수요 분포를 가정하지 않고도 재고 제어 모델에서 (s,S) 정책의 최적성을 입증할 수 있는가?
  • RQ4대용량 후순행에 대해 후순행 비용이 보관 비용을 초과해야 한다는 가정이 없이도 (s,S) 정책의 최적성은 유지되는가?
  • RQ5약한 연속성과 비유계 비용 하에서 값 반복과 최적 행동의 수렴을 보장하는 일반적인 MDP 조건은 무엇인가?

주요 결과

  • 값 반복은 비유계 비용과 비영인 종료 비용이 가능한 할인 MDP에서 최적 값으로 수렴한다.
  • 시간 수평이 무한으로 갈수록 유한 수평 최적 행동이 총 할인비용에 대해 무한 수평 최적 행동으로 수렴한다.
  • 할인 인자가 1에 수렴함에 따라 최적 할인비용 행동이 최적 평균비용 행동으로 수렴한다.
  • 후순행이 있는 주기적 리뷰 재고 제어에서 (s,S) 정책은 이질적 수요를 가정하지 않더라도 최적이다.
  • 대용량 후순행에 대해 후순행 비용이 보관 비용을 초과해야 한다는 가정 없이도 (s,S) 정책의 최적성이 유지된다.
  • 결과는 약한 연속 전이 확률, 비유계 비용 함수, 비유계 행동 집합을 갖는 MDP로 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.