Skip to main content
QUICK REVIEW

[논문 리뷰] On Markov Decision Processes with Borel Spaces and an Average Cost Criterion

Huizhen Yu|arXiv (Cornell University)|2019. 01. 10.
Economic theories and models참고 문헌 37인용 수 4
한 줄 요약

이 논문은 컴팩트성 또는 연속성 조건을 필요로 하지 않는 일반적인 조건 하에서 Borel 상태 및 행동 공간을 가진 마르코프 결정 과정(MDP)에 대해 평균 비용 최적성 부등식(ACOI)을 수립한다. 주로화 조건과 에고로프의 정리 및 루신의 정리를 활용하여, 유계가 아니고 비음수인 비용 모델에 대해 ACOI를 증명함으로써, 불연속적인 역동성과 비용 함수에서도 최적성 결과를 도출할 수 있게 한다.

ABSTRACT

We consider average-cost Markov decision processes (MDPs) with Borel state and action spaces and universally measurable policies. For the nonnegative cost model and an unbounded cost model, we introduce a set of conditions under which we prove the average cost optimality inequality (ACOI) via the vanishing discount factor approach. Unlike most existing results on the ACOI, which require compactness/continuity conditions on the MDP, our result does not and can be applied to problems with discontinuous dynamics and one-stage costs. The key idea here is to replace the compactness/continuity conditions used in the prior work by what we call majorization type conditions. In particular, among others, we require that for each state, on selected subsets of actions at that state, the state transition stochastic kernel is majorized by finite measures, and we use this majorization property together with Egoroff's theorem to prove the ACOI. We also consider the minimum pair approach for average-cost MDPs and apply the majorization idea. For the case of a discrete action space and strictly unbounded costs, we prove the existence of a minimum pair that consists of a stationary policy and an invariant probability measure induced by the policy. This result is derived by combining Lusin's theorem with another majorization condition we introduce, and it can be applied to a class of countable action space MDPs in which, with respect to the state variable, the dynamics and one-stage costs are discontinuous.

연구 동기 및 목표

  • 컴팩트성 또는 연속성 조건을 요구하지 않는 일반적인 Borel 공간 MDP에 대해 평균 비용 최적성 이론을 확장하는 것.
  • 불연속적인 역동성과 한 단계 비용을 가진 MDP에서의 가측성 및 수렴 문제를 해결하는 것.
  • 더 약한 구조적 가정 하에서 사라지는 할인 요율 접근법을 통해 평균 비용 최적성 부등식(ACOI)을 수립하는 것.
  • 유계가 아니며 비음수인 비용을 가진 이산 행동 공간에 대해 최소 쌍(정적 정책과 불변 측도)의 존재를 증명하는 것.
  • 전통적인 연속성 및 컴팩트성 요구 조건을 대체할 주로화 조건을 기반으로 한 프레임워크를 개발하는 것.

제안 방법

  • 행동 부분집합에서 유한 측도에 의해 상태 전이 커널이 지배되는 주로화 유형 조건을 도입한다.
  • 에고로프의 정리를 적용하여 함수들이 균일 수렴 성질을 보이는 대체로 큰 측도를 갖는 집합을 추출한다.
  • 최소 쌍 존재 증명에서 정책에 대한 가측 선택을 구성하기 위해 루신의 정리를 사용한다.
  • 할인 비용 최적성 방정식의 극한을 취하여 사라지는 할인 요율 접근법을 활용해 ACOI를 유도한다.
  • 주로화 조건과 리아푸노프 유형 조건을 조합하여 유계가 아니며 비용 모델에서의 적분 가능성과 안정성을 확보한다.
  • 가측 선택 정리(예: [2, Prop. 7.50])를 활용하여 하위최적 행동에서 보편적으로 가측 정책을 구성한다.

실험 결과

연구 질문

  • RQ1컴팩트성 또는 연속성 가정 없이 Borel 공간 MDP에서 평균 비용 최적성 부등식(ACOI)을 수립할 수 있는가?
  • RQ2연속성과 컴팩트성을 대체할 수 있는 조건는 무엇이며, 평균 비용 MDP에서 수렴성과 최적성 보장에 기여하는가?
  • RQ3유계가 아니며 비용을 가진 MDP에서 최소 쌍(정적 정책과 불변 측도)이 존재하는 조건는 무엇인가?
  • RQ4에고로프의 정리와 루신의 정리는 어떻게 역동성과 비용 함수의 불연속성을 다루는 데 활용될 수 있는가?
  • RQ5사라지는 할인 요율 접근법은 주로화 유형 조건 하에서 ACOI를 증명하는 데 적응 가능한가?

주요 결과

  • 연속성 또는 컴팩트성 조건 없이도, 비음수 비용 모델 및 리아푸노프 유형 조건을 만족하는 유계가 아니며 비용이 큰 모델에 대해 ACOI가 수립된다.
  • 증명은 행동 부분집합에서 전이 커널이 유한 측도에 의해 지배되는 주로화 조건에 기반하며, 이는 에고로프의 정리 적용을 가능하게 한다.
  • 엄격히 유계가 아니며 비용이 큰 이산 행동 공간에 대해, 루신의 정리와 새로운 주로화 조건을 활용하여 정적 정책과 불변 측도로 이루어진 최소 쌍이 존재함을 증명한다.
  • 구성된 비랜덤 마르코프 정책은 평균 비용 최적이며, ACOI 하에서 정적 정책이 ε-최적임을 보여준다.
  • 제안된 주로화 조건과 리아푸노프 조건 하에서 가치 함수 및 비용-미래 함수가 유한하고 가측임을 보여준다.
  • 가중치 노름에서 할인 비용 연산자의 수축 성질이 확립되어 가치 반복 과정의 수렴성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.