Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Mean Field Game.

Nilay Tiwari, Arnob Ghosh|arXiv (Cornell University)|May 30, 2019
Reinforcement Learning in Robotics参考文献 16被引用数 11
ひとこと要約

本稿では、行動結合を伴う平均場ゲームに対する、事後サンプリングに基づく強化学習アルゴリズムを提案する。エージェントは、過去の行動の経験的分布を用いて集団の行動を近似する。本手法は、方策と行動分布が最適な無関心戦略およびその極限分布に収束することを保証し、平均場均衡(MFE)への収束を確立する。

ABSTRACT

Stochastic games provide a framework for interactions among multiple agents and enable a myriad of applications. In these games, agents decide on actions simultaneously, the state of every agent moves to the next state, and each agent receives a reward. However, finding an equilibrium (if exists) in this game is often difficult when the number of agents becomes large. This paper focuses on finding a mean-field equilibrium (MFE) in an action coupled stochastic game setting in an episodic framework. It is assumed that the impact of the other agents' can be assumed by the empirical distribution of the mean of the actions. All agents know the action distribution and employ lower-myopic best response dynamics to choose the optimal oblivious strategy. This paper proposes a posterior sampling based approach for reinforcement learning in the mean-field game, where each agent samples a transition probability from the previous transitions. We show that the policy and action distributions converge to the optimal oblivious strategy and the limiting distribution, respectively, which constitute an MFE.

研究の動機と目的

  • 大規模集団の確率的ゲームにおいて行動結合を伴う平均場均衡を計算する課題に対処すること。
  • 集団の動的挙動の全貌を十分に把握できない状況下でも、エージェントが最適な無関心戦略に収束できる強化学習アルゴリズムを設計すること。
  • エピソード的学習において、方策と行動分布の理論的収束を平均場均衡に確立すること。

提案手法

  • エージェントは、過去の行動の経験的分布を用いて集団の平均場効果を近似する。
  • 各エージェントは、履歴遷移から遷移確率を事後サンプリングに基づいてサンプリングする。
  • サンプリングされた遷移モデルに基づく、低予測的最良応答ダイナミクスを用いる。
  • エージェントは、サンプリングされたモデルを繰り返し更新することで、最適な無関心戦略に収束する。
  • 本手法は、行動分布が平均場均衡と整合的な極限分布に収束することを保証する。
  • 理論的分析により、提案された学習ダイナミクスのもとで、方策と行動分布の両方がMFEに収束することを証明する。

実験結果

リサーチクエスチョン

  • RQ1事後サンプリングに基づくRLアルゴリズムは、行動結合を伴う確率的ゲームにおいて平均場均衡への収束を達成できるか?
  • RQ2エピソード的フレームワークにおいて、経験的平均場近似のもとでエージェントの方策と行動分布はどのように変化するか?
  • RQ3サンプリングされた遷移モデルの使用は、大規模集団設定において安定的かつ最適な行動をもたらすか?
  • RQ4方策と行動分布が最適な無関心戦略およびその極限分布に収束するための条件は何か?

主な発見

  • 提案されたアルゴリズムにより、各エージェントの方策が最適な無関心戦略に収束することが保証される。
  • エージェント間の経験的行動分布は、平均場均衡と整合的な極限分布に収束する。
  • エージェントが履歴遷移からの遷移ダイナミクスを事後サンプリングでモデル化するという仮定のもとで収束が確立される。
  • 本手法は、サンプリングされたモデルに基づく低予測的最良応答ダイナミクスを活用し、均衡への収束を実現する。
  • 行動結合を伴うエピソード的平均場ゲームにおける収束について、理論的保証が提供される。
  • 経験的行動分布による集団効果の効果的近似により、大規模エージェント環境におけるスケーラブルな学習が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。