Skip to main content
QUICK REVIEW

[論文レビュー] No-regret learning and mixed Nash equilibria: They do not mix

Lampros Flokas, Emmanouil-Vasileios Vlatakis-Gkaragkounis|arXiv (Cornell University)|Oct 19, 2020
Advanced Bandit Algorithms Research参考文献 59被引用数 13
ひとこと要約

この論文は、Follow the Regularized Leader (FTRL) に基づくレギュレータ付き学習ダイナミクスが、混合ナッシュ均衡を漸近的に安定化できないことを示している。唯一安定な極限点となるのは、厳密(純粋)ナッシュ均衡である。主な結果は、少なくとも1人のプレイヤーが複数の最良応答を持つ(つまり、厳密でない)ナッシュ均衡は、FTRLの報酬空間における体積保存性の性質により、FTRLでは漸近的に安定になり得ないということである。この性質により、非一意な最良応答を持つ混合戦略均衡への収束が不可能になる。

ABSTRACT

Understanding the behavior of no-regret dynamics in general $N$-player games is a fundamental question in online learning and game theory. A folk result in the field states that, in finite games, the empirical frequency of play under no-regret learning converges to the game's set of coarse correlated equilibria. By contrast, our understanding of how the day-to-day behavior of the dynamics correlates to the game's Nash equilibria is much more limited, and only partial results are known for certain classes of games (such as zero-sum or congestion games). In this paper, we study the dynamics of "follow-the-regularized-leader" (FTRL), arguably the most well-studied class of no-regret dynamics, and we establish a sweeping negative result showing that the notion of mixed Nash equilibrium is antithetical to no-regret learning. Specifically, we show that any Nash equilibrium which is not strict (in that every player has a unique best response) cannot be stable and attracting under the dynamics of FTRL. This result has significant implications for predicting the outcome of a learning process as it shows unequivocally that only strict (and hence, pure) Nash equilibria can emerge as stable limit points thereof.

研究の動機と目的

  • 一般のN人プレイヤーのゲームにおいて、FTRLのようなno-regret学習ダイナミクスがナッシュ均衡に収束するかどうかを調査すること。
  • folkな信念(no-regret学習は均衡に収束する)と、実際のFTRLダイナミクス下でのナッシュ均衡の安定性特性との間にある矛盾を解消すること。
  • no-regret学習が保証する粗い協調的均衡が、特に混合ナッシュ均衡に収束することを示さない理由を明確にすること。
  • FTRLダイナミクス下での純粋ナッシュ均衡と混合ナッシュ均衡の安定性の根本的違いを確立すること。
  • 幾何学的および力学系の議論を用いて、FTRL下で漸近的に安定なのは、厳密(純粋)ナッシュ均衡に限ることを証明すること。

提案手法

  • 報酬空間におけるFTRLダイナミクスを分析し、その空間で任意のゲームに関係なくLebesgue測度(体積)を保存すること。
  • FTRLダイナミクスが報酬空間で体積保存的であるという事実を用いて、非厳密な混合ナッシュ均衡の漸近的安定性を仮定した場合に矛盾を導くこと。
  • 鋭い正則化子を用いたFTRLにおいて、戦略単体の面が前向き不変であるという事実を応用し、安定集合の可能な位置を制限すること。
  • 任意の漸近的に安定な集合は最小次元の面と交わらねばならず、そのような面はシングルトン(つまり、純粋戦略)でなければならないことを背理法で証明すること。
  • ゲーム単体の構造と面の相対的内部の性質を用いて、安定集合が非シングルトン面の内部に存在することはできないことを示すこと。
  • 面における制限されたゲームでのリャプノフ安定性および吸引性の議論を用いて、非シングルトン面の内部に安定集合が存在すると、体積保存性の性質と矛盾することを示すこと。

実験結果

リサーチクエスチョン

  • RQ1一般のN人プレイヤーのゲームにおいて、FTRLダイナミクス下で混合ナッシュ均衡が漸近的に安定化可能か?
  • RQ2no-regret学習が粗い協調的均衡に収束する一方で、なぜ混合ナッシュ均衡に収束しないのか?
  • RQ3FTRLが非厳密な混合ナッシュ均衡を安定化できない幾何学的・力学的性質は何か?
  • RQ4no-regret学習下で、純粋ナッシュ均衡と混合ナッシュ均衡の安定性に根本的な違いがあるか?
  • RQ5報酬空間におけるFTRLの体積保存性を用いて、非厳密均衡の漸近的安定性を排除できるか?

主な発見

  • 少なくとも1人のプレイヤーが複数の最良応答を持つ(つまり、厳密でない)ナッシュ均衡は、FTRLダイナミクス下で漸近的に安定になり得ない。
  • FTRLダイナミクスの下で、漸近的に安定な極限点として現れるのは、純粋ナッシュ均衡に限られる。混合均衡で非一意な最良応答がある場合、FTRLの報酬空間における体積保存性に反するためである。
  • FTRLダイナミクスは、報酬空間における集合のLebesgue測度(体積)を保存するという、非一意な最良応答を持つ混合均衡の安定化が不可能である根拠となる重要な性質を持つ。
  • FTRL下での漸近的に安定な集合は最小次元の面と交わらねばならず、そのような面はシングルトン(すなわち、純粋戦略)でなければならない。これは、安定点が純粋戦略のみから成ることを示唆する。
  • この結果は、鋭い正則化子を備えたすべてのゲームに適用可能であり、乗法的ウェイトやオンライン勾配降下法を含むFTRLダイナミクスの全クラスに適用可能である。
  • 本論文は、包括的な否定的結果を確立した。混合ナッシュ均衡は、FTRL下で漸近的に安定であるという点で根本的に不適合であり、no-regret学習の長期的結果として到達不可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。