Skip to main content
QUICK REVIEW

[論文レビュー] Scaling up Mean Field Games with Online Mirror Descent

Julien Pérolat, Sarah Perrin|arXiv (Cornell University)|Feb 28, 2021
Artificial Intelligence in Games参考文献 40被引用数 10
ひとこと要約

本稿では、連続時間ダイナミクスとQ関数の統合を活用して明示的な最良応答計算を回避することで、スケーラブルなアルゴリズムとしてオンラインミラー降下(OMD)を提示し、平均場ゲーム(MFGs)におけるナッシュ均衡の計算に用いる。単調性の仮定の下で収束を証明し、実験的に10^11状態にまでスケーリング可能なMFGsにおいて、Fictitious Play(FP)よりも速度とスケーラビリティに優れていることを示した。

ABSTRACT

We address scaling up equilibrium computation in Mean Field Games (MFGs) using Online Mirror Descent (OMD). We show that continuous-time OMD provably converges to a Nash equilibrium under a natural and well-motivated set of monotonicity assumptions. This theoretical result nicely extends to multi-population games and to settings involving common noise. A thorough experimental investigation on various single and multi-population MFGs shows that OMD outperforms traditional algorithms such as Fictitious Play (FP). We empirically show that OMD scales up and converges significantly faster than FP by solving, for the first time to our knowledge, examples of MFGs with hundreds of billions states. This study establishes the state-of-the-art for learning in large-scale multi-agent and multi-population games.

研究の動機と目的

  • 大規模な状態空間および大規模な集団に対する平均場ゲーム(MFGs)における均衡計算のスケーリングの課題に対処する。
  • Fictitious Play(FP)の限界、例えば高いメモリ使用量、収束の遅さ、最良応答計算への依存を克服する。
  • 単一および複数集団のMFGs、共通ノイズを含む設定を含め、スケーラブルでメモリ効率の良いアルゴリズムを開発する。
  • MFGsにおける標準的な単調性仮定の下で、連続時間OMDの理論的収束保証を確立する。
  • 大規模なMFGsにおいて、OMDがFPよりも収束速度とスケーラビリティに優れていることを実証する。

提案手法

  • 時間経過にわたる統合Q関数のソフトマックスを用いて、反復的にポリシーを更新することで、MFGsにオンラインミラー降下(OMD)を適用する。
  • 時間統合Q関数を用いて連続時間OMDアルゴリズムを定義する:$ y^{i}_{n,t}(x^{i},a^{i}| au) = \int_0^t Q^{i,\pi^{i}_s,\mu^{\pi_s}}_n(x^{i},a^{i}|\tau)ds $。
  • ミラー写像$ \Gamma $を用いてポリシーを更新する:$ \pi^{i}_{n,t}(\cdot|x^{i},\tau) = \Gamma(y^{i}_{n,t}(x^{i},\cdot|\tau)) $。
  • 共通ノイズ下での各集団の前向きおよび後ろ向きダイナミクスをモデル化することで、多集団MFGsへの手法の拡張を図る。
  • 報酬関数の単調性と報酬構造の分離可能性の下で、ナッシュ均衡への収束を証明する。
  • 高次元状態空間におけるQ関数の推定に深層強化学習を用いることで、1兆個以上の状態行動ペアへのスケーリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1オンラインミラー降下(OMD)は、連続時間平均場ゲーム(MFGs)において、理論的にナッシュ均衡に収束するか?
  • RQ2大規模なMFGsにおいて、OMDは収束速度とスケーラビリティの点でFictitious Play(FP)を上回るか?
  • RQ3共通ノイズを含む多集団MFGsにOMDを拡張しても、収束性と効率性を維持できるか?
  • RQ4OMDがMFGsにおける均衡計算に成功する最大のスケール(状態空間サイズの観点から)はどの程度か?
  • RQ5大規模なMFGsにおいて、OMDのメモリ使用量はFPと比べてどの程度か?

主な発見

  • 標準的な単調性および分離可能性仮定の下で、OMDは連続時間MFGsにおいてナッシュ均衡に理論的に収束する。
  • OMDは最大10^11状態のMFGsおよび1兆個以上の状態行動ペアにまでスケーリング可能であり、これにより従来手法と比較して4〜5桁の改善が達成された。
  • OMDはFictitious Play(FP)よりも著しく高速に収束し、トーラス、スクエア、ドーナツなどのさまざまなトポロジーおよびコーナー、ランダムな初期化の下で、実験的に優れた性能を示した。
  • OMDは現在のポリシーと統合Q関数のみを格納すればよく、FPが平均化されたポリシーと誘導される分布を格納するのと比べて、メモリ使用量が大幅に削減された。
  • 本手法は多集団MFGsおよび共通ノイズを含む設定に一般化でき、理論的収束性と実証的効率性を維持した。
  • 研究対象のMFGsにおける報酬関数は単調性を満たしており、これが理論的収束証明を可能にし、アルゴリズムの安定性を支える基盤となっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。