Skip to main content
QUICK REVIEW

[論文レビュー] Global Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time

Wei-Chen Wang, Jiequn Han|arXiv (Cornell University)|Aug 16, 2020
Reinforcement Learning in Robotics参考文献 51被引用数 6
ひとこと要約

本稿は、連続時間の線形・二次型平均場制御およびゲーム問題における方策勾配法のグローバル収束を確立し、緩い条件下でも線形収束率を示している。リカッチ方程式および線形系に対する新しい安定性・感度バウンドを用いて、離散時間の方策勾配解析を連続時間の確率的ダイナミクスへ拡張した。

ABSTRACT

Reinforcement learning is a powerful tool to learn the optimal policy of possibly multiple agents by interacting with the environment. As the number of agents grow to be very large, the system can be approximated by a mean-field problem. Therefore, it has motivated new research directions for mean-field control (MFC) and mean-field game (MFG). In this paper, we study the policy gradient method for the linear-quadratic mean-field control and game, where we assume each agent has identical linear state transitions and quadratic cost functions. While most of the recent works on policy gradient for MFC and MFG are based on discrete-time models, we focus on the continuous-time models where some analyzing techniques can be interesting to the readers. For both MFC and MFG, we provide policy gradient update and show that it converges to the optimal solution at a linear rate, which is verified by a synthetic simulation. For MFG, we also provide sufficient conditions for the existence and uniqueness of the Nash equilibrium.

研究の動機と目的

  • 連続時間平均場制御およびゲーム(MFC/MFG)設定における方策勾配法の理論的収束解析のギャップを埋める。
  • 既存の離散時間方策勾配収束結果を、線形・二次型構造を有する連続時間の確率的ダイナミクスへ拡張する。
  • 平均場制御(MFC)および平均場ゲーム(MFG)の両設定において、線形レートを伴う証明可能なグローバル収束を提供する。
  • MFG設定におけるナッシュ均衡の存在および一意性の十分条件を確立する。
  • 平均場状態と結合されたダイナミクスを持つMFG設定において、線形収束を保証する2段階のアルゴリズムフレームワークを構築する。

提案手法

  • 再パrametrizationを用いて、平均場制御(MFC)問題を標準的な線形・二次型レギュレータ(LQR)問題に再定式化する。
  • より複雑なMFG設定を解析するための途中ステップとして、ドリフト付きLQR問題を導入する。
  • 最良応答問題(ドリフト付きLQRを解く)と平均場状態の更新を交互に実行する方策勾配アルゴリズムを設計する。
  • システムパラメータのリプシッツ連続性と逆行列の感度を用いて、リカッチ方程式および線形系の安定性バウンドを導出する。
  • 再帰的誤差分解を用いて、反復値と最適方策との距離をバウンドし、特異値ノルムと条件数を活用する。
  • 収束を保証するため、問題固有の定数に基づいて適応的ステップサイズ(ε_s)を設定する。

実験結果

リサーチクエスチョン

  • RQ1方策勾配法は、連続時間線形・二次型平均場制御問題においてグローバル収束を達成できるか?
  • RQ2連続時間MFCおよびMFG設定における方策勾配の収束レートは何か?
  • RQ3離散時間方策勾配の理論的解析を、連続時間の確率的ダイナミクスへどのように拡張できるか?
  • RQ4連続時間平均場ゲームにおいて、ナッシュ均衡が存在し、一意性を保つための条件は何か?
  • RQ5平均場状態と結合されたダイナミクスを持つMFG設定において、線形収束を保証するアルゴリズム的構造は何か?

主な発見

  • 連続時間線形・二次型平均場制御における方策勾配法は、最適解へ線形レートでグローバルに収束する。
  • 平均場ゲームにおいて、提案された2段階アルゴリズムは、存在および一意性の十分条件のもとでナッシュ均衡へ線形収束を達成する。
  • 収束レートは幾何的減衰係数L₀ < 1で定量的に評価され、S反復後には誤差がεでバウンドされる。
  • S = O(log(1/ε))反復で、方策パラメータ(Kおよびb)のε-精度に到達し、Sは初期誤差およびL₀に依存する。
  • パラメータ誤差のバウンドは、システム行列(R, D, Dᵀ)の固有値特性に依存し、σ_min(R)およびσ_min(DDᵀ)に明示的な依存関係を示す。
  • 誤差バウンドにC_b(μ_s)およびC_K(μ_s)が含まれており、システムおよび方策の感度に比例するため、摂動に対して収束がロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。