Skip to main content
QUICK REVIEW

[論文レビュー] Constant payoff in zero-sum stochastic games

Miquel Oliu Barton, Bruno Ziliotto|arXiv (Cornell University)|Nov 12, 2018
Markov Chains and Monte Carlo Methods参考文献 13被引用数 3
ひとこと要約

この論文は、利己的でないプレイヤーを有するゼロサム確率ゲームにおいて、期待される総報酬がゲームの状態にかかわらず一定のままであることを証明している。これは、Sorin, Venel, and Vigeral (2010) が提起した予想を確認するものである。この結果は、半代数的技法、レア遷移マルコフ連鎖、および価値関数の変分不等式を用いて確立された。

ABSTRACT

In a zero-sum stochastic game, at each stage, two adversary players take decisions and receive a stage payoff determined by them and by a random variable representing the state of nature. The total payoff is the discounted sum of the stage payoffs. Assume that the players are very patient and use optimal strategies. We then prove that, at any point in the game, players get essentially the same expected payoff: the payoff is constant. This solves a conjecture by Sorin, Venel and Vigeral (2010). The proof relies on the semi-algebraic approach for discounted stochastic games introduced by Bewley and Kohlberg (1976), on the theory of Markov chains with rare transitions, initiated by Friedlin and Wentzell (1984), and on some variational inequalities for value functions inspired by the recent work of Davini, Fathi, Iturriaga and Zavidovique (2016)

研究の動機と目的

  • プレイヤーが非常に利己的である場合に、ゼロサム確率ゲームにおける期待報酬が常に一定であるという予想を解明すること。
  • 最適戦略下での割引付き確率ゲームの長期的挙動を分析すること。
  • 利己的行動の極限において、価値関数が状態に依存しない不変性を示すこと。
  • 半代数的ゲーム理論、まれな遷移を持つマルコフ連鎖、および価値関数の変分解析の手法を統合すること。

提案手法

  • Bewley と Kohlberg (1976) が提唱した半代数的アプローチを、割引付き確率ゲームにおける価値関数の漸近的構造を分析するために適応する。
  • Friedlin と Wentzell (1984) が提唱した、まれな遷移を持つマルコフ連鎖の理論を、利己的戦略下でのゆっくりとした状態変化をモデル化するために適用する。
  • Davini ら (2016) が提唱したインスピレーションに基づく変分不等式を用いて、価値関数の極限的挙動を特徴付ける。
  • 割引率がゼロに近づく極限において、価値関数がすべての状態で定数に収束することを確立する。
  • これらのツールを統合し、最適戦略が現在の状態にかかわらず同一の期待報酬をもたらすことを示す。
  • 長期的な極限において、最適戦略下でゲームの価値が初期状態に依存しないことを示す。

実験結果

リサーチクエスチョン

  • RQ1プレイヤーが非常に利己的である場合に、ゼロサム確率ゲームのすべての状態において期待される総報酬が一定に保たれるか?
  • RQ2利己的行動下での一定報酬という予想を、既存の解析的ツールを用いて形式的に証明できるか?
  • RQ3状態過程におけるまれな遷移が、確率ゲームの長期的価値構造にどのように影響するか?
  • RQ4価値関数の変分不等式は、割引付き確率ゲームの極限的挙動をどの程度正確に記述できるか?
  • RQ5割引率がゼロに近づく極限において、価値関数は状態に依存しない不変性を示すか?

主な発見

  • プレイヤーが非常に利己的で、最適戦略を採用する場合、すべての状態において期待される総報酬が一定である。
  • 割引率がゼロに近づく極限において、価値関数は初期状態にかかわらず定数に収束する。
  • この結果は、Sorin, Venel, および Vigeral (2010) が提起したゼロサム確率ゲームにおける一定報酬の予想を確認する。
  • 半代数的フレームワークにより、極限的価値構造の正確な特徴付けが可能になる。
  • まれな遷移理論と変分不等式の統合により、長期的ゲーム行動のための新たな解析的アプローチが提供される。
  • 報酬の一定性は、最適戦略と状態過程の漸近的安定性の相互作用に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。