Skip to main content
QUICK REVIEW

[論文レビュー] A tutorial on Zero-sum Stochastic Games

Jérôme Renault|arXiv (Cornell University)|May 16, 2019
Economic theories and models参考文献 20被引用数 5
ひとこと要約

このチュートリアルは、競争的2人ゼロ和確率的ゲーム、つまりマルコフ決定過程の動的拡張としてのゼロ和確率的ゲームについて、包括的な数学的導入を提供する。n段階ゲームおよびλ割引ゲームにおける価値の存在と収束、一様価値の存在を確立し、連続な報酬関数および遷移構造のもとで、n段階ゲームとλ割引ゲームの漸近的挙動の等価性を示している。

ABSTRACT

Zero-sum stochastic games generalize the notion of Markov Decision Processes (i.e. controlled Markov chains, or stochastic dynamic programming) to the 2-player competitive case : two players jointly control the evolution of a state variable, and have opposite interests. These notes constitute a short mathematical introduction to the theory of such games. Section 1 presents the basic model with finitely many states and actions. We give proofs of the standard results concerning : the existence and formulas for the values of the n-stage games, of the $λ$-discounted games, the convergence of these values when $λ$ goes to 0 (algebraic approach) and when n goes to +$\infty$, an important example called 'The Big Match' and the existence of the uniform value. Section 2 presents a short and subjective selection of related and more recent results : 1-player games (MDP) and the compact non expansive case, a simple compact continuous stochastic game with no asymptotic value, and the general equivalence between the uniform convergence of (v n) n and (v $λ$) $λ$. More references on the topic can be found for instance in the books by Mertens-Sorin

研究の動機と目的

  • ゼロ和確率的ゲームの厳密な数学的基盤を提供し、マルコフ決定過程を競争的2人ゲームに一般化すること。
  • 有限状態および行動空間のもとで、n段階ゲームおよびλ割引ゲームの価値の存在と公式を確立すること。
  • n → ∞およびλ → 0における価値の収束を分析し、一般の場合における一様価値の存在を証明すること。
  • 連続的確率的ゲームにおいて、n段階ゲームとλ割引ゲームの価値列の漸近的挙動の等価性を探索すること。
  • 理論的概念および未解決問題を説明するための代表的例(例:The Big Matchや吸収ゲーム)を提示すること。

提案手法

  • 状態集合K、行動集合IおよびJ、報酬関数g: K×I×J → ℝ、遷移確率q: K×I×J → Δ(K)を用いて、ゼロ和確率的ゲームの基本的モデルを形式化する。
  • 戦略(行動戦略、マルコフ戦略、定常戦略)を定義し、無限の対局の確率測度を積分のσ代数を用いて定義する。
  • 混合行動における上界・下界最適化を再帰的に特徴付けるShapley方程式を用いて、価値関数v_n(k)およびv_λ(k)を特徴付ける。
  • 代数的および漸近的解析を用いて、n → ∞およびλ → 0におけるv_n(k)およびv_λ(k)の極限挙動を研究する。
  • コンパクト性および連続性の議論を用いて、連続的確率的ゲームにおける(v_n)および(v_λ)の一様収束の等価性を証明する。
  • The Big Matchや1人ゲームなどの具体的な例を分析し、非自明な収束挙動および一部のケースにおける漸近的価値の不在を示す。

実験結果

リサーチクエスチョン

  • RQ1n → ∞およびλ → 0におけるn段階ゲームおよびλ割引ゲームの価値が収束する条件は何か?
  • RQ2連続な報酬関数および遷移構造のもとで、v_nおよびv_λの収束から、ゼロ和確率的ゲームにおける一様価値の存在が導かれるか?
  • RQ3価値が収束しない場合でも、一般の確率的ゲームにおいてv_nおよびv_λの漸近的挙動が等価であるか?
  • RQ4特定の連続的確率的ゲームにおける漸近的価値の不在が示す意味は何か?
  • RQ5吸収状態の性質およびThe Big Matchのような特定のゲーム構造が、長期的価値収束に与える影響は何か?

主な発見

  • すべてのnおよびλ ∈ (0,1)に対して、n段階ゲームの価値v_n(k)およびλ割引ゲームの価値v_λ(k)が存在し、Shapley方程式を満たす。
  • n → ∞のとき、v_n(k)は一様価値に収束する。与えられた仮定のもとで、その一様価値は存在し、明確に定義される。
  • λ → 0のとき、v_λ(k)はn → ∞のときのv_n(k)と同じ極限に収束する。これにより、2つの漸近的挙動の等価性が証明される。
  • コンパクトな距離空間としての状態および行動空間、および連続な報酬関数および遷移関数を備えた連続的ケースでは、(v_n)および(v_λ)の一様収束が等価である。
  • The Big Matchでは、λ → 0のときv_λ(k)は収束しない。これは、一部のケースにおいて漸近的価値が存在しない可能性を示している。
  • v_λ(k)の極限は1/2より大きくはならない。特定のλ_nの列に対して、y_λおよびx_λの極限下界および上界がそれぞれ4/9および1/2であることが示され、この場合におけるv_λ(k)の非収束が証明される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。