Skip to main content
QUICK REVIEW

[論文レビュー] Provable Fictitious Play for General Mean-Field Games

Qiaomin Xie, Zhuoran Yang|arXiv (Cornell University)|Oct 8, 2020
Reinforcement Learning in Robotics参考文献 71被引用数 8
ひとこと要約

本稿では、代表的エージェントのポリシーと平均場状態の間の擬似協力的プレーとして問題を定式化することにより、一般の平均場ゲームにおける証明可能に収束する1ループ強化学習アルゴリズムを提案する。交互勾配降下法とプロキシマルポリシー最適化(PPO)を用いて、ナッシュ均衡への非線形収束を達成し、この設定における1ループ手法で初めてのこのような証明可能な収束を達成する。

ABSTRACT

We propose a reinforcement learning algorithm for stationary mean-field games, where the goal is to learn a pair of mean-field state and stationary policy that constitutes the Nash equilibrium. When viewing the mean-field state and the policy as two players, we propose a fictitious play algorithm which alternatively updates the mean-field state and the policy via gradient-descent and proximal policy optimization, respectively. Our algorithm is in stark contrast with previous literature which solves each single-agent reinforcement learning problem induced by the iterates mean-field states to the optimum. Furthermore, we prove that our fictitious play algorithm converges to the Nash equilibrium at a sublinear rate. To the best of our knowledge, this seems the first provably convergent single-loop reinforcement learning algorithm for mean-field games based on iterative updates of both mean-field state and policy.

研究の動機と目的

  • 多数エージェントによる多エージェント強化学習におけるスケーラビリティの課題に対処すること。
  • 定常平均場ゲームにおける計算的に効率的な1ループ強化学習アルゴリズムの開発。
  • 各イテレーションで内部のMDPを最適に解く必要がある二重ループ手法の置き換え。
  • 提案されたアルゴリズムがナッシュ均衡に非線形レートで収束することの証明。
  • ポリシーと平均場状態の反復的更新に基づく、平均場ゲームにおける最初の証明可能に収束する1ループアルゴリズムの確立。

提案手法

  • 代表的エージェントのポリシーと平均場状態の間の2人ゲームとして平均場ゲームを定式化する。
  • 平均場状態を勾配降下法で、ポリシーをプロキシマルポリシー最適化(PPO)で交互に更新する。
  • 各プレイヤーが相手の現在の戦略に対して最適応答する擬似協力的プレーのダイナミクスを採用する。
  • 高次元の状態空間と行動空間を扱うために、関数近似として深層ニューラルネットワークを用いる。
  • 収束バウンドを確立するために、収縮写像、ピンスカーの不等式、コーシー・シュワルツの不等式などの理論的道具を適用する。
  • ポリシーと平均場状態の平均的偏差をバウンドすることで、非線形収束レートを導出する。

実験結果

リサーチクエスチョン

  • RQ1一般の平均場ゲームにおいて、1ループ強化学習アルゴリズムが証明可能にナッシュ均衡に収束できるか?
  • RQ2提案された擬似協力的プレーのアルゴリズムの収束レートは、既存の二重ループ手法と比較してどうなるか?
  • RQ3平均場ゲーム設定において、ポリシーと平均場状態の交互更新に対してどのような理論的保証を確立できるか?
  • RQ4関数近似と確率的更新を用いても、アルゴリズムが収束を維持できるか?
  • RQ5収束レートは、時間ホライズンや近似誤差などの問題パラメータにどのように依存するか?

主な発見

  • 提案されたアルゴリズムは、ポリシーの偏差に対して $ \mathcal{O}\left(\frac{\log T}{T^{4/9}}\right) $、平均場状態の偏差に対して $ \mathcal{O}\left(\frac{\log T}{T^{1/9}}\right) $ の非線形収束レートでナッシュ均衡に収束する。
  • 密度比の有界性と価値関数のリプシッツ連続性というやや弱い仮定のもとで収束レートが確立される。
  • 各イテレーションで内部MDPを最適に解く必要がなくなるため、計算効率を向上させる1ループ構造を実現する。
  • 理論的分析では、ジェンセンの不等式、コーシー・シュワルツの不等式、ピンスカーの不等式を用いてポリシーと状態の偏差をバウンドする。
  • 近似誤差 $ \varepsilon $ に対してもアルゴリズムはロバストであり、収束レートは $ \mathcal{O}(\varepsilon^{1/4}) $ のスケーリングを示す。
  • 本研究は、ポリシーと平均場状態の共同更新に基づく、平均場ゲームにおける最初の証明可能に収束する1ループRLアルゴリズムを提示する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。