Skip to main content
QUICK REVIEW

[論文レビュー] Empirical Analysis of Fictitious Play for Nash Equilibrium Computation in Multiplayer Games

Sam Ganzfried|arXiv (Cornell University)|Jan 30, 2020
Artificial Intelligence in Games参考文献 26被引用数 5
ひとこと要約

本稿は、マルチプレイヤーおよび非ゼロサムゲームにおいて、理論的収束保証が欠如しているにもかかわらず、反復的仮想戦略(FP)が反事後的後悔最小化(CFR)を上回ることを示している。複数のランダム初期化を用いることで、FPはシャープレーのゲームやフォスターとヤングのドctrinesゲームといった、古典的な収束しないケースにおいても、ナッシュ均衡に収束し、それぞれ33.4%および0.18%の実行でε < 10⁻⁴を達成した。

ABSTRACT

While fictitious play is guaranteed to converge to Nash equilibrium in certain game classes, such as two-player zero-sum games, it is not guaranteed to converge in non-zero-sum and multiplayer games. We show that fictitious play in fact leads to improved Nash equilibrium approximation over a variety of game classes and sizes than (counterfactual) regret minimization, which has recently produced superhuman play for multiplayer poker. We also show that when fictitious play is run several times using random initializations it is able to solve several known challenge problems in which the standard version is known to not converge, including Shapley's classic counterexample. These provide some of the first positive results for fictitious play in these settings, despite the fact that worst-case theoretical results are negative.

研究の動機と目的

  • マルチプレイヤーや非ゼロサムゲームにおいて、仮想戦略(FP)と反事後的後悔最小化(CFR)がナッシュ均衡を近似する際の実験的性能を評価すること。
  • 複数のランダム初期化が、有名な収束しないゲーム(例:シャープレーのゲーム)において仮想戦略がナッシュ均衡に収束可能かどうかを調査すること。
  • 理論的収束保証のない状況においても、FPが実務的にCFRに劣るとの一般的な認識に疑問を呈すること。
  • シャープレーのゲームやフォスターとヤングのゲームといった、長年のゲーム理論の挑戦的問題が、仮想戦略に複数のランダム初期化を組み合わせることで解けるという実証的証拠を提供すること。

提案手法

  • 反復的最適応答更新を用いた標準的な仮想戦略を適用:各プレイヤーは、相手プレイヤーの過去戦略の平均に対して最適応答を行う。
  • 非収束ゲームにおけるナッシュ均衡への吸引域を調査するため、複数のランダム初期化(実験では100,000回)を用いた。
  • 初期混合戦略を一様ランダムサンプリングにより生成し、有効な確率分布を保証するために正規化を行った。
  • 収束をε-ナッシュ均衡(最適応答からの期待効用の最大偏差)によって測定した。
  • 全初期化のうち、最も良い性能(最小のε)を示した実行結果を最終戦略プロファイルとして選択した。
  • 収束パターンを戦略空間上で分析するため、成功した初期化をヒートマップで可視化した。

実験結果

リサーチクエスチョン

  • RQ1マルチプレイヤーや非ゼロサムゲームにおいて、仮想戦略は反事後的後悔最小化よりも優れたナッシュ均衡近似を生み出すか?
  • RQ2標準的なFPが失敗するとされるゲーム(例:シャープレーのゲーム)において、仮想戦略はナッシュ均衡に収束可能か?
  • RQ3ドクトリンズゲームのような非収束ゲームにおいて、ランダム初期化の何パーセントが収束に至るか?
  • RQ4複数のランダム初期化が、仮想戦略による解けるゲームの集合を顕著に拡大することが、実証的に示唆されるか?

主な発見

  • テストされたすべてのマルチプレイヤーおよび非ゼロサムゲームクラスにおいて、仮想戦略は反事後的後悔最小化を上回ってナッシュ均衡を近似した。
  • シャープレーのゲームでは、100,000回のランダム初期化のうち33,403回(33.4%)がε < 10⁻⁴を達成し、ナッシュ均衡への収束を示した。
  • フォスターとヤングのドクトリンズゲームでは、100,000回の初期化のうち182回(0.18%)がε < 10⁻⁴を達成し、初期戦略の正の測度集合に対して収束が生じることを示した。
  • これらの結果は、複数のランダム初期化を組み合わせることで、仮想戦略が長年の収束しない挑戦的問題を解けることを示している。
  • 成功確率から、一部のゲームでは平均してFPを550回実行すればε-均衡が得られることを示唆しており、実用的な可能性を示している。
  • これらの発見は、FPが理論的および実務的にCFRに劣るとの一般的な見解に疑問を呈しており、特にマルチプレイヤー設定において顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。