Skip to main content
QUICK REVIEW

[論文レビュー] A distance for probability spaces, and long-term values in Markov Decision Processes and Repeated Games

Jérôme Renault, Xavier Venel|arXiv (Cornell University)|Feb 28, 2012
Markov Chains and Monte Carlo Methods参考文献 24被引用数 12
ひとこと要約

本稿は、部分的に観測可能なマルコフ意思決定過程(POMDP)および繰り返しゲームにおける信念空間上の、有限にサポートされたボレル確率測度の空間に新しい距離 $ d_* $ を導入する。$ d_* $ における遷移が1リプシッツ的であることを保証することで、小さな無関心度を持つ任意の評価関数のもとで、一般化された一様値の存在と特徴付けを確立し、ブラックウェルの一様最適性をPOMDPおよび無作為に情報を持つコントローラーを有する繰り返しゲームに拡張する。

ABSTRACT

Given a finite set $K$, we denote by $X=Δ(K)$ the set of probabilities on $K$ and by $Z=Δ_f(X)$ the set of Borel probabilities on $X$ with finite support. Studying a Markov Decision Process with partial information on $K$ naturally leads to a Markov Decision Process with full information on $X$. We introduce a new metric $d_*$ on $Z$ such that the transitions become 1-Lipschitz from $(X, \|.\|_1)$ to $(Z,d_*)$. In the first part of the article, we define and prove several properties of the metric $d_*$. Especially, $d_*$ satisfies a Kantorovich-Rubinstein type duality formula and can be characterized by using disintegrations. In the second part, we characterize the limit values in several classes of "compact non expansive" Markov Decision Processes. In particular we use the metric $d_*$ to characterize the limit value in Partial Observation MDP with finitely many states and in Repeated Games with an informed controller with finite sets of states and actions. Moreover in each case we can prove the existence of a generalized notion of uniform value where we consider not only the Cesàro mean when the number of stages is large enough but any evaluation function $θ\in Δ(\N^*)$ when the impatience $I(θ)=\sum_{t\geq 1} |θ_{t+1}-θ_t|$ is small enough.

研究の動機と目的

  • POMDPおよび繰り返しゲームにおける信念空間上の、有限にサポートされた確率測度の空間に新しい距離 $ d_* $ を定義すること。
  • $ d_* $ において、遷移が1リプシッツ的であることを確立し、より強い収束性およびコンパクト性の性質を可能にすること。
  • 特に有限状態のPOMDPおよび無作為に情報を持つコントローラーを有する繰り返しゲームにおいて、コンパクトかつ非拡大なマルコフ意思決定過程における極限値を特徴付けること。
  • 任意の評価関数 $ \theta \in \Delta(\mathbb{N}^*) $ および小さな無関心度 $ I(\theta) \leq \alpha $ に対して、一般化された一様値の存在を証明すること。

提案手法

  • $ Z = \Delta_f(\Delta(K)) $、すなわち信念空間 $ \Delta(K) $ 上の有限にサポートされたボレル測度の空間に、分解およびカンタロヴィッチ=ルビンシュテイン双対性を用いて $ d_* $ を定義する。
  • $ (X, \|\cdot\|_1) $ から $ (Z, d_*) $ への遷移ダイナミクスが1リプシッツ的であることを証明し、$ Z $ の安定性および前コンパクト性を保証する。
  • $ d_* $ を用いて、POMDPおよび繰り返しゲームにおける長期的価値を、$ Z $ 上の完全情報MDPに還元することで分析する。
  • $ d_* $-リプシッツ的遷移の構造を活用し、Cesàro平均のブロック長に関する下限を用いて一般化された一様値を特徴付ける。
  • $ Z \times [0,1] $ 上の補助的ギャンブリングハウスモデルにおける戦略を構築し、それらを元のゲームで模倣することで $ \varepsilon $-最適戦略を達成する。
  • $ v^*(\pi) = \inf_n \sup_m v_{m,n}(\pi) $ の特徴付けを適用し、小さな無関心度のもとでプレイヤー2が $ v^*(\pi) $ を保証できることを証明する。

実験結果

リサーチクエスチョン

  • RQ1信念空間上の有限にサポートされた測度の空間に、遷移が1リプシッツ的となるような新しい距離 $ d_* $ を定義できるか?
  • RQ2任意の評価関数および小さな無関心度のもとで、POMDPおよび無作為に情報を持つコントローラーを有する繰り返しゲームにおいて、一般化された一様値が存在するか?
  • RQ3このようなゲームにおける極限値は、ステージのブロック長に関するCesàro平均の下限を用いて特徴付けられるか?
  • RQ4片側に不完全情報がある繰り返しゲーム(例:$ p \in [1/2, 1) $)において、閉形式解が不明な場合でも、$ d_* $-に基づく分析によって価値が特徴付けられるか?
  • RQ5 $ Z \times [0,1] $ 上の補助的ギャンブリングハウスモデルにおける戦略を、元のゲームで $ \varepsilon $-最適戦略を構築するために使用できるか?

主な発見

  • 距離 $ d_* $ はカンタロヴィッチ=ルビンシュテイン型の双対性を満たし、測度の分解を用いて特徴付けられる。
  • $ d_* $ において、$ (X, \|\cdot\|_1) $ から $ (Z, d_*) $ への遷移写像は1リプシッツ的であり、$ Z $ の安定性および前コンパクト性が保証される。
  • 一般化された一様値は存在し、小さな無関心度を持つ一般評価関数のもとでも、ブロック長に関するCesàro平均の下限として特徴付けられる。
  • 任意の $ \varepsilon > 0 $ に対して、$ \alpha > 0 $ が存在し、任意の評価関数 $ \theta $ に対して $ I(\theta) \leq \alpha $ ならば、プレイヤー1は $ v^*(\pi) - \varepsilon $ を保証できる。
  • 同様の条件下で、プレイヤー2も、プレイヤー1の行動に依存しないブロック単位の最適戦略を用いて $ v^*(\pi) $ を保証できる。
  • 片側に不完全情報がある繰り返しゲームの例では、$ p \in [1/2, 2/3) $ に対して価値は $ v_p = \frac{p}{4p-1} $ であり、方程式 $ 9p^3 - 12p^2 + 6p - 1 = 0 $ の根 $ p^* $ において $ v_p = \frac{p^*}{1 - 3p^* + 6(p^*)^2} $ となる。これは理論と整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。