Skip to main content
QUICK REVIEW

[論文レビュー] Independent and Decentralized Learning in Markov Potential Games

Chinmay Maheshwari, Manxi Wu|arXiv (Cornell University)|May 29, 2022
Game Theory and Applications被引用数 6
ひとこと要約

本稿では、無限時間割引付きマーカフポテンシャルゲームにおける独立的で分散型のマルチエージェント強化学習アルゴリズムを提案する。エージェントは非同期的かつ二時刻スケールの更新を用いて学習する:高速なQ関数推定と、最適な1ステップ逸脱に基づく遅い方策改善である。この手法は、協調的制御や完全なゲーム知識がなくても、確率1で定常ナッシュ均衡の集合に収束することが保証される。

ABSTRACT

We study a multi-agent reinforcement learning dynamics, and analyze its asymptotic behavior in infinite-horizon discounted Markov potential games. We focus on the independent and decentralized setting, where players do not know the game parameters, and cannot communicate or coordinate. In each stage, players update their estimate of Q-function that evaluates their total contingent payoff based on the realized one-stage reward in an asynchronous manner. Then, players independently update their policies by incorporating an optimal one-stage deviation strategy based on the estimated Q-function. Inspired by the actor-critic algorithm in single-agent reinforcement learning, a key feature of our learning dynamics is that agents update their Q-function estimates at a faster timescale than the policies. Leveraging tools from two-timescale asynchronous stochastic approximation theory, we characterize the convergent set of learning dynamics.

研究の動機と目的

  • 協調的制御やゲームモデルの知識が全くないマルチエージェントシステムにおけるナッシュ均衡の学習という課題に取り組む。
  • マーカフポテンシャルゲームにおいて、定常ナッシュ均衡に収束する分散型で独立した学習ダイナミクスを設計する。
  • エージェントが相手の報酬や遷移ダイナミクスを知らなくても、自身の報酬と状態の観測のみで学習可能な最小限の情報条件下で収束を実現する。
  • 標準的な仮定の下で、連続時系列の動的システムに帰着される離散時系列のダイナミクスと等価である二時刻スケールの確率的近似フレームワークを用いて、確率1収束を証明する。

提案手法

  • エージェントは、観測された報酬と状態遷移に基づき、より速い時刻スケールで、自身の条件付き報酬のQ関数推定値を維持・更新する。
  • 方策は、現在のQ推定値から導かれる最適な1ステップ逸脱戦略に基づき、より遅い時刻スケールで更新される。
  • 学習は非同期的である:各段階で、実現した状態-行動ペアのQ値と対応する方策のみが更新され、訪問回数に基づく非均一なステップサイズが用いられる。
  • 各ステップで一様なランダム行動と方策を混合することで、探索が保証される。
  • アルゴリズムは、連続時系列の動的システムによる方策の進化をモデル化する二時刻スケールの確率的近似フレームワークを活用する。
  • 収束は、連続時系列極限の分析と、標準的な仮定の下での離散時系列ダイナミクスとの等価性を用いて確立される。

実験結果

リサーチクエスチョン

  • RQ1協調的制御やゲームモデルの知識が全くない状況下で、独立的かつ分散型のエージェントは、マーカフポテンシャルゲームにおいて定常ナッシュ均衡に収束できるか?
  • RQ2非同期的かつ自己中心的な方策更新を伴う二時刻スケールの学習ダイナミクスは、MPGにおいてナッシュ均衡に収束するか?
  • RQ3推定されたQ値に基づく最適な1ステップ逸脱戦略は、分散型環境でも収束をもたらすか?
  • RQ4この分散型MARL設定において、方策更新の確率1収束を保証する条件は何か?

主な発見

  • 提案された学習ダイナミクスは、無限時間割引付きマーカフポテンシャルゲームにおいて、確率1で定常ナッシュ均衡の集合に収束する。
  • 収束は、離散時系列の更新と連続時系列の力学的システムを結びつける二時刻スケールの確率的近似フレームワークを用いて確立される。
  • 方策更新ルールによって定義される連続時系列のダイナミクスは、ナッシュ均衡の集合に収束するため、離散時系列のアルゴリズムについても確率1収束が保証される。
  • この手法は、協調的制御や相手の報酬の知識、シミュレータへのアクセスを必要とせず、自身の報酬と状態の局所的観測のみに依存する。
  • 解析により、極限におけるいかなる方策プロファイルもナッシュ均衡でなければならないことが証明される。なぜなら、そのような均衡でない場合、逸脱によりより高い値が得られることになり、均衡条件に反するからである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。