[論文レビュー] When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?
本稿では、大人数の一般和マルコフゲームにおける均衡の学習のためのサンプル効率の良いアルゴリズムを提示する。粗い相関均衡(CCE)と相関均衡(CE)では、各プレイヤーの行動数に対して多項式的依存を達成し、マルコフポテンシャルゲームにおけるナッシュ均衡では、全行動数に対して線形的依存を達成する。これは、指数的ベースラインと比べて顕著に改善されたものである。
Multi-agent reinforcement learning has made substantial empirical progresses in solving games with a large number of players. However, theoretically, the best known sample complexity for finding a Nash equilibrium in general-sum games scales exponentially in the number of players due to the size of the joint action space, and there is a matching exponential lower bound. This paper investigates what learning goals admit better sample complexities in the setting of $m$-player general-sum Markov games with $H$ steps, $S$ states, and $A_i$ actions per player. First, we design algorithms for learning an $ε$-Coarse Correlated Equilibrium (CCE) in $\widetilde{\mathcal{O}}(H^5S\max_{i\le m} A_i / ε^2)$ episodes, and an $ε$-Correlated Equilibrium (CE) in $\widetilde{\mathcal{O}}(H^6S\max_{i\le m} A_i^2 / ε^2)$ episodes. This is the first line of results for learning CCE and CE with sample complexities polynomial in $\max_{i\le m} A_i$. Our algorithm for learning CE integrates an adversarial bandit subroutine which minimizes a weighted swap regret, along with several novel designs in the outer loop. Second, we consider the important special case of Markov Potential Games, and design an algorithm that learns an $ε$-approximate Nash equilibrium within $\widetilde{\mathcal{O}}(S\sum_{i\le m} A_i / ε^3)$ episodes (when only highlighting the dependence on $S$, $A_i$, and $ε$), which only depends linearly in $\sum_{i\le m} A_i$ and significantly improves over existing efficient algorithm in the $ε$ dependence. Overall, our results shed light on what equilibria or structural assumptions on the game may enable sample-efficient learning with many players.
研究の動機と目的
- マルチプレイヤー一般和マルコフゲームにおける、どの均衡概念やゲーム構造がサンプル効率の学習を可能にするかを特定すること。
- ナッシュ均衡学習における、連合行動空間サイズに起因する指数的サンプル複雑性のボトルネックを克服すること。
- 個々の行動数に多項式的依存するアルゴリズムを設計すること、指数的積依存ではなく。
- 構造的ゲームにおけるナッシュ均衡学習のサンプル複雑性におけるε依存を改善すること。
提案手法
- CCE-V-Learningのための多プレイヤー設定への適応として、価値関数推定と方策更新を用いたナッシュV学習の変種を採用。
- 混合エキスパートのフォローザレギュライズドリーダー(FTRL)サブルーチンを用いて、敵対的バンディット枠組み内での重み付きスワップリグレットを最小化するCE-V-Learningを設計。
- 予測可能な重みを持つ敵対的バンディットと重み付きスワップリグレットに関する新しい分析を導入し、低リグレット学習を可能に。
- マルコフポテンシャルゲームにおけるナッシュ均衡学習を、ポテンシャル関数の分解を用いて単一エージェント強化学習に還元。
- 時間変動する重みと正則化を用いた重み付きリグレット最小化フレームワークを採用し、CEへの収束を保証。
- 和集合不等式とマルティングルの濃度を用いて、方策勾配と価値関数更新における推定誤差を制御。
実験結果
リサーチクエスチョン
- RQ1一般和マルコフゲームにおける粗い相関均衡(CCE)は、各プレイヤーの行動数に対して多項式的サンプル複雑性で学習可能か?
- RQ2大人数ゲームにおいて、相関均衡(CE)のサンプル複雑性はナッシュ均衡のそれよりも改善可能か?
- RQ3ゲームの構造的仮定(例:マルコフポテンシャルゲーム)により、ナッシュ均衡学習のサンプル複雑性が顕著に改善可能か?
- RQ4既存の1/ε⁶の境界を超えて、ナッシュ均衡学習のε依存を改善可能か?
主な発見
- CCE-V-Learningアルゴリズムは、ε-近似CCEに対して Õ(H⁵S maxᵢAᵢ / ε²) のサンプル複雑性を達成し、maxᵢAᵢに対して多項式的依存である。
- CE-V-Learningアルゴリズムは、ε-近似CEを Õ(H⁶S maxᵢAᵢ² / ε²) エピソードで学習可能であり、行動数に多項式的依存する初めての結果である。
- マルコフポテンシャルゲームでは、Nash-CAアルゴリズムが、ε-近似ナッシュ均衡を Õ(S ∑ᵢAᵢ / ε³) エピソードで学習可能であり、先行研究の1/ε⁶依存を改善している。
- CE用のアルゴリズムは、予測可能な重みを持つ重み付きスワップリグレットを最小化する新しい敵対的バンディットサブルーチンを統合している。
- 分析は、予測可能な重みを持つ敵対的バンディットにおける重み付きリグレットおよび重み付きスワップリグレットに関する新しい結果を導出し、独立した関心をもつ。
- 本稿は、ポテンシャルゲームのような構造的仮定が、多数のプレイヤーが存在する状況でも、サンプル複雑性を劇的に低減可能であることを確立している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。