Skip to main content
QUICK REVIEW

[논문 리뷰] A distance for probability spaces, and long-term values in Markov Decision Processes and Repeated Games

Jérôme Renault, Xavier Venel|arXiv (Cornell University)|2012. 02. 28.
Markov Chains and Monte Carlo Methods참고 문헌 24인용 수 12
한 줄 요약

이 논문은 부분 관찰 가능한 마르코프 결정 과정(POMDP)과 반복 게임에서 믿음 공간 상의 유한 지지도를 가진 Borel 확률 측도의 공간에 대한 새로운 거리 $ d_* $ 를 도입한다. $ d_* $ 에서 전이가 1-Lipschitz임을 보장함으로써, 작은 인내심을 가진 임의의 평가 함수 하에서 일반화된 균일한 가치의 존재성과 특성화를 확립하며, Blackwell의 균일 최적성 이론을 POMDP와 인지된 제어자가 있는 반복 게임으로 확장한다.

ABSTRACT

Given a finite set $K$, we denote by $X=Δ(K)$ the set of probabilities on $K$ and by $Z=Δ_f(X)$ the set of Borel probabilities on $X$ with finite support. Studying a Markov Decision Process with partial information on $K$ naturally leads to a Markov Decision Process with full information on $X$. We introduce a new metric $d_*$ on $Z$ such that the transitions become 1-Lipschitz from $(X, \|.\|_1)$ to $(Z,d_*)$. In the first part of the article, we define and prove several properties of the metric $d_*$. Especially, $d_*$ satisfies a Kantorovich-Rubinstein type duality formula and can be characterized by using disintegrations. In the second part, we characterize the limit values in several classes of "compact non expansive" Markov Decision Processes. In particular we use the metric $d_*$ to characterize the limit value in Partial Observation MDP with finitely many states and in Repeated Games with an informed controller with finite sets of states and actions. Moreover in each case we can prove the existence of a generalized notion of uniform value where we consider not only the Cesàro mean when the number of stages is large enough but any evaluation function $θ\in Δ(\N^*)$ when the impatience $I(θ)=\sum_{t\geq 1} |θ_{t+1}-θ_t|$ is small enough.

연구 동기 및 목표

  • POMDP와 반복 게임의 믿음 공간 상의 유한 지지도를 가진 확률 측도 공간에 새로운 거리 $ d_* $ 를 정의한다.
  • 특성화된 거리 $ d_* $ 를 통해 전이가 1-Lipschitz가 되게 하여, 더 강한 수렴성과 컴actness 성질을 확보한다.
  • 특히 유한 상태를 가진 POMDP와 인지된 제어자가 있는 반복 게임에서, 압축 가능하고 비확장적인 마르코프 결정 과정에서의 극한 가치를 특성화한다.
  • 소규모 인내심을 가진 임의의 평가 함수 $ \theta \in \Delta(\mathbb{N}^*) $ 에 대해 일반화된 균일한 가치의 존재성을 증명한다.

제안 방법

  • 측도의 분해와 캄토로비치-루빈슈타인 이중성에 기반하여, 믿음 공간 $ \Delta(K) $ 상의 유한 지지도를 가진 Borel 측도의 공간인 $ Z = \Delta_f(\Delta(K)) $ 에서 $ d_* $ 를 정의한다.
  • 전이 동역학이 $ (X, \|\cdot\|_1) $ 에서 $ (Z, d_*) $ 로의 전이가 1-Lipschitz임을 증명함으로써 안정성과 전콤팩트성 보장한다.
  • $ d_* $ 를 사용하여 POMDP와 반복 게임의 장기적 가치를 분석함으로써, $ Z $ 상의 완전 정보 MDP로의 축소를 수행한다.
  • 전이가 $ d_* $-Lipschitz임을 활용하여, 블록 길이에 대한 Cesàro 평균의 하한을 통해 일반화된 균일한 가치를 특성화한다.
  • 원래 게임에서 $ \varepsilon $-최적성을 달성할 수 있도록, $ Z \times [0,1] $ 상의 보조 도박하우스 모델에서 전략을 구성한다.
  • 특성화 $ v^*(\pi) = \inf_n \sup_m v_{m,n}(\pi) $ 를 적용하여, 소규모 인내심 하에서 플레이어 2가 $ v^*(\pi) $ 를 보장할 수 있음을 증명한다.

실험 결과

연구 질문

  • RQ1유한 지지도를 가진 민감도 공간 상의 측도 공간에 대해, 전이가 1-Lipschitz가 되는 새로운 거리 $ d_* $ 를 정의할 수 있는가?
  • RQ2소규모 인내심을 가진 임의의 평가 함수 하에서 POMDP와 인지된 제어자가 있는 반복 게임에서 일반화된 균일한 가치가 존재하는가?
  • RQ3블록 단위 단계의 Cesàro 평균에 대한 하한을 통해 이러한 게임의 극한 가치를 특성화할 수 있는가?
  • RQ4특히 폐형 해가 알려져 있지 않은 경우, 한쪽 측면에서 정보가 불완전한 반복 게임의 가치가 $ d_* $ 기반 분석을 통해 특성화되는가?
  • RQ5보조 도박하우스 모델에서의 전략이 원래 게임에서 $ \varepsilon $-최적 전략을 구성하는 데 사용될 수 있는가?

주요 결과

  • 거리 $ d_* $ 는 캄토로비치-루빈슈타인 유형의 이중성과 일치하며, 측도의 분해를 통해 특성화될 수 있다.
  • $ d_* $ 를 통해 $ (X, \|\cdot\|_1) $ 에서 $ (Z, d_*) $ 로의 전이 맵이 1-Lipschitz임을 보장하여, $ Z $ 의 안정성과 전콤팩트성 보장한다.
  • 일반화된 균일한 가치가 존재하며, 소규모 인내심을 가진 일반 평가 함수 하에서도 블록 길이에 대한 Cesàro 평균의 하한으로 특성화된다.
  • 모든 $ \varepsilon > 0 $ 에 대해, $ I(\theta) \leq \alpha $ 를 만족하는 평가 $ \theta $ 에 대해 플레이어 1이 $ v^*(\pi) - \varepsilon $ 를 보장할 수 있는 $ \alpha > 0 $ 가 존재한다.
  • 동일한 조건 하에서 플레이어 2 역시 플레이어 1의 행동에 영향을 받지 않는 블록 단위 최적 전략을 통해 $ v^*(\pi) $ 를 보장할 수 있다.
  • 한쪽 측면에서 정보가 불완전한 반복 게임의 예시에서, $ p \in [1/2, 2/3) $ 에서 가치는 $ v_p = \frac{p}{4p-1} $ 이며, 방정정식 $ 9p^3 - 12p^2 + 6p - 1 = 0 $ 의 근 $ p^* $ 에서는 $ v_p = \frac{p^*}{1 - 3p^* + 6(p^*)^2} $ 로 주어지며, 이는 이론과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.