Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence of Gradient-Based Learning in Continuous Games

Eric Mazumdar, Lillian J. Ratliff|arXiv (Cornell University)|Apr 16, 2018
Mathematical and Theoretical Epidemiology and Ecology Models被引用数 21
ひとこと要約

本稿は、力学系理論を用いて連続ゲームにおける勾配ベースの学習を分析し、このようなアルゴリズムが非負値の部分集合の局所的ナッシュ均衡でさえもほとんど確実に回避することを示している。特に、一部の状況ではグローバルなナッシュ均衡ですらそうである。本稿では、勾配動的法がナッシュ均衡、極限円周、非ナッシュ固定点にほとんど確実に収束する「モース=スマールゲーム」を導入し、GAN学習やその他のゼロサム設定における不安定性を説明する。

ABSTRACT

We study the limiting behavior of competitive agents employing gradient-based learning algorithms through the lens of dynamical systems theory. Specifically, we introduce a general framework for competitive gradient-based learning that allows us to analyze a wide breadth of learning algorithms including policy gradient reinforcement learning, gradient based bandits, and certain online convex optimization algorithms. We show that for both potential games and general-sum games, when agents employ gradient-based learning algorithms, they will avoid a non-negligible subset of the local Nash equilibria. This is a strongly negative result for gradient-based learning in games. Our framework also sheds light on the issue of convergence to non-Nash strategies in general-sum and zero-sum games which have no relevance to the underlying game, and arise solely due to the choice of algorithm. The existence and frequency of strategies may explain some of the difficulties encountered when using gradient descent in zero-sum games (e.g. to train generative adversarial networks). Finally, we introduce a new class of games, Morse-Smale games, for which the gradient dynamics correspond to gradient-like flows. This class encompasses a large set of commonly encountered games. For Morse-Smale games, we show that competitive gradient-based learning converges to either limit cycles, Nash equilibria, or non-Nash fixed points almost surely. To reinforce our theoretical contributions, we provide empirical results that highlight the frequency of Nash equilibria that are almost surely avoided by policy gradient in linear quadratic games. Indeed, we present empirical results that show that policy gradient almost surely avoids the unique global Nash equilibrium in one out of five randomly sampled linear quadratic games.

研究の動機と目的

  • 力学系理論を用いて、競合的な連続ゲームにおける勾配ベースの学習の極限的挙動を理解すること。
  • 一般和ゲームおよびゼロサムゲームにおいて、勾配ベースのアルゴリズムがナッシュ均衡に収束しない理由を特定すること。
  • ゲーム理論的解ではなくアルゴリズム的生成物である非ナッシュ固定点がどのように出現するかを説明すること。
  • 勾配動的法が勾配的流れに似た振る舞いを示すクラスとして、収束保証が強いモース=スマールゲームを導入すること。
  • 線形二次ゲームにおける方策勾配法が、顕著な頻度でグローバルナッシュ均衡をほとんど確実に回避することを実証的に検証すること。

提案手法

  • 連続時間のODEを用いて、エージェントの更新を力学系として形式化し、競合的勾配ベースの学習を定式化する。
  • 勾配動的法が勾配的流れに対応するクラスとして、モース=スマールゲームを定義し、良好な動的挙動を保証する。
  • 安定性解析やモース理論などの力学系理論的手法を適用し、学習アルゴリズムの長期的挙動を特徴付ける。
  • ポテンシャルゲームおよび一般和ゲームにおける勾配ベースの学習が、ナッシュ均衡、極限円周、非ナッシュ固定点に収束するかどうかを分析する。
  • 線形二次ゲームにおける実証的評価を用いて、方策勾配法がグローバルナッシュ均衡をどの程度の頻度で回避するかを示す。
  • 位相的議論を用いて、特定の均衡が不安定多様体のため、ほとんど確実に回避されることを示す。

実験結果

リサーチクエスチョン

  • RQ1競合ゲームにおける勾配ベースの学習アルゴリズムがなぜナッシュ均衡に収束しないことが多いのか。
  • RQ2勾配ベースの学習で出現するが、ゲームの均衡構造とは無関係な固定点の種類は何か。
  • RQ3どのクラスのゲームにおいて、意味のある均衡や周期にほとんど確実に収束できるか。
  • RQ4線形二次ゲームにおける方策勾配法が、グローバルナッシュ均衡をどの程度の頻度で回避するか。
  • RQ5GAN学習やその他のゼロサムゲームで観察される不安定性を説明する力学系の性質は何か。

主な発見

  • ポテンシャルゲームおよび一般和ゲームの両方において、勾配ベースの学習は非負値の部分集合の局所的ナッシュ均衡をほとんど確実に回避する。
  • 非ナッシュ固定点は、ゲーム構造ではなくアルゴリズム設計に起因して一般和およびゼロサムゲームに出現し、誤った収束の説明となる。
  • モース=スマールゲームでは、勾配ベースの学習がナッシュ均衡、極限円周、または非ナッシュ固定点にほとんど確実に収束する。
  • 実証的結果から、線形二次ゲームにおける方策勾配法が、ランダムに抽出されたケースの5回に1回の頻度で、唯一のグローバルナッシュ均衡をほとんど確実に回避することが示された。
  • 本結果は、GAN学習やその他の競合的ディープラーニング設定で観察される不安定性やモード崩壊の理論的説明を提供する。
  • フレームワークは、均衡の不安定多様体が、均衡がグローバルに最適であっても収束を妨げることを特定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。