Skip to main content
QUICK REVIEW

[論文レビュー] Policy-Gradient Algorithms Have No Guarantees of Convergence in Linear Quadratic Games

Eric Mazumdar, Lillian J. Ratliff|arXiv (Cornell University)|Jul 8, 2019
Reinforcement Learning in Robotics参考文献 27被引用数 9
ひとこと要約

この論文は、一般和線形二次(LQ)ゲームにおける方策勾配アルゴリズムが、一般にナッシュ均衡への局所収束保証を欠いていることを示している。反例により、プレイヤーが安定な極小周期に収束する場合があることが示された。ゲームは非凸であり、勾配ダイナミクスの唯一の臨界点はグローバルナッシュ均衡であるが、鞍点不安定性のため方策勾配ダイナミクスは均衡を避けることができ、マルチエージェント強化学習のスケーラビリティにおける根本的な制限を露呈している。

ABSTRACT

We show by counterexample that policy-gradient algorithms have no guarantees of even local convergence to Nash equilibria in continuous action and state space multi-agent settings. To do so, we analyze gradient-play in N-player general-sum linear quadratic games, a classic game setting which is recently emerging as a benchmark in the field of multi-agent learning. In such games the state and action spaces are continuous and global Nash equilibria can be found be solving coupled Ricatti equations. Further, gradient-play in LQ games is equivalent to multi agent policy-gradient. We first show that these games are surprisingly not convex games. Despite this, we are still able to show that the only critical points of the gradient dynamics are global Nash equilibria. We then give sufficient conditions under which policy-gradient will avoid the Nash equilibria, and generate a large number of general-sum linear quadratic games that satisfy these conditions. In such games we empirically observe the players converging to limit cycles for which the time average does not coincide with a Nash equilibrium. The existence of such games indicates that one of the most popular approaches to solving reinforcement learning problems in the classic reinforcement learning setting has no local guarantee of convergence in multi-agent settings. Further, the ease with which we can generate these counterexamples suggests that such situations are not mere edge cases and are in fact quite common.

研究の動機と目的

  • マルチエージェント連続制御設定における方策勾配アルゴリズムに理論的収束保証があるかどうかを調査すること。
  • マルチエージェント強化学習の定番ベンチマークであるNプレイヤー一般和線形二次(LQ)ゲームにおける勾配プレーのダイナミクスを分析すること。
  • ナッシュ均衡が唯一の臨界点であるにもかかわらず、方策勾配ダイナミクス下で安定な吸引子としてのナッシュ均衡であるかどうかを同定すること。
  • ナッシュ均衡を避けて極小周期に収束する明示的な反例を構築すること。
  • 実用的なマルチエージェント強化学習設定において、このような収束しない振る舞いの頻度と影響を評価すること。

提案手法

  • 著者らはNプレイヤー一般和LQゲームを分析し、各エージェントが線形力学系を制御し、二次コスト関数を持つものとする。グローバルナッシュ均衡は結合されたリッカチ方程式を解くことで得られる。
  • 彼らはLQゲームにおける方策勾配の勾配ダイナミクスが勾配プレーに等価であり、このダイナミクスの唯一の臨界点がグローバルナッシュ均衡であることを示した。
  • 安定多様体定理を用いて、ナッシュ均衡が勾配ダイナミクスの鞍点であることを証明し、方策勾配更新下では不安定な吸引子であることを示した。
  • 鞍点の不安定多様体構造に基づき、方策勾配軌道がナッシュ均衡を避けるための十分条件を導出した。
  • これらの条件を満たす明示的なLQゲームの例を構築し、極小周期への収束を実験的に示した。
  • ベクトル化と陰関数定理を用いて、主要なシステム行列(Σ_K および P_i)が方策パラメータに関してC¹であることを証明し、勾配ダイナミクスの滑らかさを保証した。

実験結果

リサーチクエスチョン

  • RQ1一般和LQゲームにおける方策勾配アルゴリズムはナッシュ均衡への局所収束保証を有するか?
  • RQ2LQゲームにおける方策勾配ダイナミクス下でナッシュ均衡は安定な吸引子か?
  • RQ3連続的行動・連続的状態のマルチエージェント設定において、方策勾配ダイナミクスはナッシュ均衡を避けて極小周期に収束しうるか?
  • RQ4このような収束しない振るまいはLQゲームでどれほど一般的であり、どのような条件下で生じるか?
  • RQ5極小周期戦略の時間平均がナッシュ均衡と一致しない理論的説明はあるか?

主な発見

  • 一般和LQゲームにおける方策勾配ダイナミクスは、勾配ダイナミクスの唯一の臨界点であるナッシュ均衡を完全に回避する可能性がある。
  • 著者らは、鞍点不安定性のため、ナッシュ均衡への収束が確実に失敗するLQゲームの明示的反例を構築した。
  • その反例において、プレイヤーは実験的に安定な極小周期に収束し、戦略の時間平均はナッシュ均衡と一致しなかった。
  • ナッシュ均衡は勾配ダイナミクスの鞍点であり、安定な吸引子ではないため、方策勾配がそれを逸脱する理由が説明できる。
  • 不安定多様体が正の測度を持つため、初期化が確率的であっても均衡への収束は不確実である。
  • 結果として、マルチエージェント設定における方策勾配法は均衡への収束に頻繁に失敗する可能性があり、実用的成功にもかかわらず理論的信頼性に疑問を呈する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。