Skip to main content
QUICK REVIEW

[論文レビュー] Learning in anonymous nonatomic games with applications to first-order mean field games

Saeed Hadikhanloo|arXiv (Cornell University)|Apr 2, 2017
Game Theory and Applications被引用数 12
ひとこと要約

本稿は、プレイヤー固有の行動集合を有する匿名で非原子的ゲームに対して、Fictitious Play および Online Mirror Descent という学習手続きを導入し、単調性条件の下でナッシュ均衡への収束を証明する。この枠組みは、1階の平均場ゲームに適用され、連続的行動、非原子的ゲームのクラスにおける両学習ダイナミクスの収束を確立する。

ABSTRACT

We introduce a model of anonymous games with the player dependent action sets. We propose several learning procedures based on the well-known Fictitious Play and Online Mirror Descent and prove their convergence to equilibrium under the classical monotonicity condition. Typical examples are first-order mean field games.

研究の動機と目的

  • 古典的な学習ダイナミクス(Fictitious Play および Online Mirror Descent)を、プレイヤー固有の行動集合を有する匿名で非原子的ゲームへと拡張すること。
  • 標準的な単調性条件の下で、これらの学習手続きがナッシュ均衡へ収束することを確立すること。
  • 結果を、初期位置が固定で、同一のコスト関数を有する連続的経路を選択するプレイヤーを有する1階の平均場ゲームに適用すること。
  • ポテンシャルゲームにとどまらず、より広いクラスの単調コストゲームへと、先行の収束結果を一般化すること。
  • 大規模集団、非原子的ゲームにおける連続的行動の下での均衡形成のための理論的基盤を提供すること。

提案手法

  • 各プレイヤーが異なる行動集合を有するが、他者の行動の経験的分布に依存する同一のコスト関数を有する匿名で非原子的ゲームのモデルを提示する。
  • Fictitious Play を適応し、プレイヤーが他者の行動の経験的頻度に基づいて信念を更新し、それらの信念に対して最適反応を取ることを規定する。
  • 連続的行動集合を扱い、レグレット最小化を保証するために、Bregman 散発に基づく更新を用いた Online Mirror Descent を適用する。
  • シュマイデラーとマス・コレルのフレームワークに基づく不動点議論を用いて、連続性およびコンパクト性の下でナッシュ均衡の存在を確立する。
  • 分解定理および弱収束技術を用いて、学習系列の極限測度が行動集合制約と一貫して分解されることを証明する。
  • 一意性および学習ダイナミクスの収束を保証するため、単調性条件(ローゼンの条件)に依存する。

実験結果

リサーチクエスチョン

  • RQ1Fictitious Play は、プレイヤー依存の行動集合を有する匿名で非原子的ゲームにおいてナッシュ均衡に収束するか?
  • RQ2単調性の下で、Online Mirror Descent は同様のゲームにおいて均衡に収束するか?
  • RQ3コスト関数の単調性が、連続的行動を有する匿名ゲームにおける学習ダイナミクスの収束を保証する条件は何か?
  • RQ4連続的経路と分布的結合性を有する1階の平均場ゲームにおいて、学習手続きをどのように適応可能にするか?
  • RQ5非原子的ゲームにおける経験的分布の収束を保証するために、どのような位相的および測度論的道具が必要か?

主な発見

  • Fictitious Play は、プレイヤー固有の行動集合を有する匿名で非原子的ゲームにおいて、単調性条件の下でナッシュ均衡に収束する。
  • Online Mirror Descent は、同一の単調性条件下でナッシュ均衡に収束し、収束速度は Bregman 散発の構造に依存する。
  • 1階の平均場ゲームにおいて、一意なナッシュ均衡は、ハミルトン・ヤコビ方程式とフォッカー・プランク方程式の結合系の解として特徴づけられる。
  • 弱収束の下で、極限測度の行動集合対応に関する分解が保存され、均衡戦略の一貫性が保証される。
  • 収束結果は、ポテンシャルゲームにとどまらず、より広いクラスの匿名ゲームに対しても成り立つ。これにより、安定ゲームやプレイヤー集団ゲームに関する先行研究が拡張される。
  • この枠組みは、初期位置が固定で、他のプレイヤーの分布に依存する同一のコスト関数を有する1階の平均場ゲームに適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。