Skip to main content
QUICK REVIEW

[論文レビュー] Existence of the uniform value in repeated games with a more informed controller

Fabien Gensbittel, Miquel Oliu‐Barton|arXiv (Cornell University)|Jan 9, 2013
Game Theory and Applications参考文献 8被引用数 8
ひとこと要約

本稿は、状態についてより情報を持つプレイヤー1が、プレイヤー2の信念の進化を制御する零和繰り返しゲームにおいて、一様価値の存在を確立する。第二順位の信念(プレイヤー2がプレイヤー1の真の状態に関する信念をどう考えているか)を状態空間とする補助的確率ゲームを構築し、レオンヌの動的計画法に関する存在結果を活用することで、著者らは、プレイヤー1がこの補助ゲームの最適戦略を元のゲームに実装できることを証明する。これにより、観測が不完全な場合を含む一般な条件下で、一様価値の存在が保証される。

ABSTRACT

We prove that in a general zero-sum repeated game where the first player is more informed than the second player and controls the evolution of information on the state, the uniform value exists. This result extends previous results on Markov decision processes with partial observation (Rosenberg, Solan, Vieille 2002), and repeated games with an informed controller (Renault 2012). Our formal definition of a more informed player is more general than the inclusion of signals, allowing therefore for imperfect monitoring of actions. We construct an auxiliary stochastic game whose state space is the set of second order beliefs of player 2 (beliefs about beliefs of player 1 on the true state variable of the initial game) with perfect monitoring and we prove it has a value by using a result of Renault 2012. A key element in this work is to prove that player 1 can use strategies of the auxiliary game in the initial game in our general framework, which allows to deduce that the value of the auxiliary game is also the value of our initial repeated game by using classical arguments.

研究の動機と目的

  • プレイヤー1がより情報を持っており、プレイヤー2の信念の進化を制御する零和繰り返しゲームにおける一様価値の存在を確立すること。
  • 部分的に観測可能なマルコフ意思決定過程および情報を持つコントローラーを伴う繰り返しゲームに関する先行結果を一般化すること。
  • 行動の観測が不完全である場合を含めても適用可能な「より情報を持つ」という概念のより広い定式化を提示すること。
  • 第二順位の信念に関する補助ゲームからの戦略が、元のゲームに移行可能であることを証明すること。
  • 両プレイヤーが同じ価値を保証できることを示し、これにより一様価値の存在が示されること。

提案手法

  • 状態空間が第二順位の信念(プレイヤー2がプレイヤー1の真の状態に関する信念)である補助的確率ゲームを構築する。
  • レオンヌの動的計画法に関する結果を用いて、補助ゲームに一様価値が存在することを証明する。
  • 信念の一貫性と戦略の移行を介して、プレイヤー1が補助ゲームの最適戦略を元のゲームに実装できることを示す。
  • 段階報酬に関する再帰的議論を用いて、プレイヤー2がブロックごとの戦略を用いることで同じ価値を保証できることを証明する。
  • 古典的なゲーム理論的議論を活用して、補助ゲームの価値が元のゲームの一様価値に等しいことを示す。
  • 仮定(A1)–(A3)を適用し、プレイヤー1がプレイヤー2の戦略を知らなくても信念を計算でき、信念の進化が一貫的であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1プレイヤー1がより情報を持っており、プレイヤー2の信念の進化を制御する繰り返しゲームにおいて、一様価値は存在するか?
  • RQ2不完全情報付き繰り返しゲームの価値は、第二順位の信念に関する補助ゲームから導けるか?
  • RQ3完全な行動観測が保証される補助ゲームからの戦略が、観測が不完全なゲームに適用可能となる条件は何か?
  • RQ4行動の観測が不完全な場合を含めても、一様価値の存在をこれまでのモデルを超えて拡張できるか?
  • RQ5このようなゲームにおいて、プレイヤー2はブロックプレイ戦略を用いて、一様価値を同じく保証できるか?

主な発見

  • プレイヤー1がより情報を持っており、プレイヤー2の信念の進化を制御する零和繰り返しゲームにおいて、観測が不完全であっても一様価値が存在する。
  • 元のゲームの価値は、プレイヤー2の第二順位の信念の集合を状態空間とする補助的確率ゲームの価値に等しい。
  • プレイヤー1は補助ゲームからの最適戦略を元のゲームに実装でき、これにより価値が達成可能であることが保証される。
  • プレイヤー2は、現在の段階と信念状態にのみ依存する再帰的戦略を用いたブロックプレーにより、一様価値を保証できる。
  • 一様価値の存在は、以前に予想されたよりも弱い仮定のもとでも成立し、行動の観測が不完全な場合も含む。
  • 本結果は、部分的に観測可能なマルコフ意思決定過程および完全に情報を持つコントローラーを伴う繰り返しゲームに関する先行結果を一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。