Skip to main content
QUICK REVIEW

[論文レビュー] Learning in Nonzero-Sum Stochastic Games with Potentials

David Mguni, Yutong Wu|Research Portal (King's College London)|Mar 16, 2021
Reinforcement Learning in Robotics参考文献 60被引用数 10
ひとこと要約

本稿では、確率的ポテンシャルゲーム(SPG)を活用することで、連続的状態・行動空間を有する非ゼロ和の確率的ゲームに適した、新しいマルチエージェント強化学習アルゴリズムであるSPot-ACを提案する。理論的にSPot-ACが多項式時間でナッシュ均衡に収束することを証明し、協調ナビゲーションや大規模な自己利益ルーティングといった複雑なタスクにおいて、MADDPG や COMIX といった最先端手法を上回ることを示した。

ABSTRACT

Multi-agent reinforcement learning (MARL) has become effective in tackling discrete cooperative game scenarios. However, MARL has yet to penetrate settings beyond those modelled by team and zero-sum games, confining it to a small subset of multi-agent systems. In this paper, we introduce a new generation of MARL learners that can handle nonzero-sum payoff structures and continuous settings. In particular, we study the MARL problem in a class of games known as stochastic potential games (SPGs) with continuous state-action spaces. Unlike cooperative games, in which all agents share a common reward, SPGs are capable of modelling real-world scenarios where agents seek to fulfil their individual goals. We prove theoretically our learning method, SPot-AC, enables independent agents to learn Nash equilibrium strategies in polynomial time. We demonstrate our framework tackles previously unsolvable tasks such as Coordination Navigation and large selfish routing games and that it outperforms the state of the art MARL baselines such as MADDPG and COMIX in such scenarios.

研究の動機と目的

  • チーム学習やゼロ和設定を超えた非ゼロ和の確率的ゲームにおける有効なマルチエージェント強化学習(MARL)手法の不足に対処する。
  • 自動運転やネットワークルーティングなど、実世界の応用で一般的な連続的状態・行動空間における学習を可能にする。
  • エージェント数に伴う組み合わせ的複雑性を回避するスケーラブルなMARLアルゴリズムの開発。
  • 連続的確率的ポテンシャルゲーム(c-SPG)におけるナッシュ均衡への収束に関する理論的保証の提供。
  • 未知の環境に一般化可能で、スケーラビリティを維持する分散型、エージェント・クリティックベースの学習フレームワークの設計。

提案手法

  • 段階的エージェント相互作用がポテンシャルゲームの性質を示す連続的確率的ポテンシャルゲーム(c-SPG)を形式化する。
  • c-SPG をマーカフ決定過程(MDP)としての二重表現として確立し、ナッシュ均衡をMDPの解法により計算可能にする。
  • 未知のc-SPG環境においてナッシュ均衡戦略を学習する分散型エージェント・クリティックアルゴリズムであるSPot-ACを提案する。
  • 既知の環境モデルを用いる場合にナッシュ均衡を効率的に計算するための、適合Q学習の変種であるSPot-Qを導入する。
  • ポテンシャル関数の構築によりエージェント相互作用を分離し、集中型クリティックに類似したメカニズムを介して均衡への収束を保証する。
  • ポテンシャル関数の推定誤差が小さい場合の手法のロバストネスを証明し、真のナッシュ均衡に近い近似が得られることを示す。

実験結果

リサーチクエスチョン

  • RQ1チーム学習やゼロ和設定を超えた連続的かつ非ゼロ和の確率的ゲームにおいて、ナッシュ均衡に収束するMARLアルゴリズムを設計可能か?
  • RQ2確率的ゲームにおけるポテンシャルゲーム構造が、MDP双対性を介してナッシュ均衡の tractable(容易に計算可能な)な計算を可能にするか?
  • RQ3分散型、エージェント・クリティックベースのMARLアルゴリズムは、エージェント数の増加に伴って効率的にスケーリング可能であり、収束保証を維持できるか?
  • RQ4本手法は、協調ナビゲーションや大規模な自己利益ルーティングといった実世界にインspiredされたタスクで、どのように性能を発揮するか?
  • RQ5ポテンシャル関数の推定誤差は、計算されたナッシュ均衡の精度にどの程度影響を及えるか?

主な発見

  • SPot-AC は連続的確率的ポテンシャルゲームにおいて、多項式時間でナッシュ均衡に収束することが理論的に保証されている。
  • 本手法は、協調ナビゲーションや大規模な自己利益ルーティングゲームなど、従来では解決不能とされていたタスクにおいて優れた性能を発揮した。
  • SPot-AC は、MADDPG や COMIX といった最先端のMARLベースラインと比較して、収束速度および複雑な連続的タスクにおける最終的性能の両面で優れている。
  • 理論的分析により、ポテンシャル関数の推定誤差が小さい場合、SPot-AC が真のナッシュ均衡に非常に近い近似を得られることを示した。
  • 二重MDP表現により、固定点問題を解けるMDPに変換することで、ナッシュ均衡の効率的計算が可能になった。
  • SPot-AC の分散型バージョンは、集中型クリティックに見られるようなエージェント数に伴う組み合わせ的爆発を回避し、エージェント数の増加に伴って効果的にスケーリングした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。