Skip to main content
QUICK REVIEW

[論文レビュー] V-Learning -- A Simple, Efficient, Decentralized Algorithm for Multiagent RL

Chi Jin, Qinghua Liu|arXiv (Cornell University)|Oct 27, 2021
Advanced Bandit Algorithms Research参考文献 52被引用数 11
ひとこと要約

本稿では、Q値の維持を避け、V値のみを保持することで、証明可能な効率性を達成する、マルチエージェントシステム向けの新規分散型強化学習アルゴリズムであるV-learningを提案する。エピソード的マルコフゲームにおいて、$\tilde{\mathcal{O}}(H^5 S A / \epsilon^2)$ のサンプル複雑性で、ナッシュ均衡、相関均衡、粗い相関均衡を独立に学習可能であり、エージェント数の増加に伴う連携行動空間の指数的増大というマルチエージェントの Curse of Multiagents を克服する。

ABSTRACT

A major challenge of multiagent reinforcement learning (MARL) is the curse of multiagents, where the size of the joint action space scales exponentially with the number of agents. This remains to be a bottleneck for designing efficient MARL algorithms even in a basic scenario with finitely many states and actions. This paper resolves this challenge for the model of episodic Markov games. We design a new class of fully decentralized algorithms -- V-learning, which provably learns Nash equilibria (in the two-player zero-sum setting), correlated equilibria and coarse correlated equilibria (in the multiplayer general-sum setting) in a number of samples that only scales with $\max_{i\in[m]} A_i$, where $A_i$ is the number of actions for the $i^{ m th}$ player. This is in sharp contrast to the size of the joint action space which is $\prod_{i=1}^m A_i$. V-learning (in its basic form) is a new class of single-agent RL algorithms that convert any adversarial bandit algorithm with suitable regret guarantees into a RL algorithm. Similar to the classical Q-learning algorithm, it performs incremental updates to the value functions. Different from Q-learning, it only maintains the estimates of V-values instead of Q-values. This key difference allows V-learning to achieve the claimed guarantees in the MARL setting by simply letting all agents run V-learning independently.

研究の動機と目的

  • マルチエージェント強化学習における、エージェント数の増加に伴い指数関数的に増大する連携行動空間の問題であるマルチエージェントの Curse を解消すること。
  • 中央集権的調整や通信を一切行わない完全な分散型MARLアルゴリズムの設計。
  • 一般和およびゼロ和マルコフゲームにおいて、均衡を学習するための証明可能な効率的サンプル複雑性の達成。
  • 連携行動空間のサイズに悪影響を受ける既存の中央集権型MARLアルゴリズムの限界を克服すること。
  • 敵対的バンディットアルゴリズムをV値更新を用いて効率的RLアルゴリズムに変換する統一的フレームワークの提供。

提案手法

  • Q値を維持しないが、Q学習に類似した値ベースの更新ルールを用いてV値を段階的に更新する単一エージェントRLアルゴリズムとしてV-learningを提案。
  • サブルーチンとして、サブ線形レジストを有する任意の敵対的バンディットアルゴリズムを活用し、V-learningにおける方策更新を誘導。
  • 学習プロセスをV値推定と、行動分布上の重み付きレジスト最小化による方策更新に分解。
  • 重み付きレジスト分解を用いて各エージェントのスワップレジストをバインドし、相関均衡および粗い相関均衡への収束を可能に。
  • 各エージェントが行動と報酬の局所的観測のみを用いてV-learningを独立して実行できるようにすることで、分散性を確保。
  • アズマ=ホイーディングの不等式や集中不等式などの理論的道具を用いて、レジストおよび収束に関する高確率バインドを導出。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェントシステムにおける連携行動空間の指数的増大を回避できる分散型MARLアルゴリズムを設計できるか?
  • RQ2Q値ではなくV値のみを維持することで、一般和およびゼロ和マルコフゲームにおいて証明可能な効率的学習が可能になるか?
  • RQ3V-learningは、個々の行動空間の積に依存しないサンプル複雑性で、ナッシュ均衡、相関均衡、粗い相関均衡への収束を達成できるか?
  • RQ4サブ線形レジストを有する任意の敵対的バンディットアルゴリズムを、V-learningを介して効率的RLアルゴリズムに変換可能か?
  • RQ5V-learningは完全に分散型であり、大規模マルチエージェントシステムへスケーラブルである一方で、近似的に最適なサンプル複雑性を達成できるか?

主な発見

  • 2人ゼロ和マルコフゲームにおいて、V-learningはナッシュ均衡の学習に $\tilde{\mathcal{O}}(H^5 S A / \epsilon^2)$ のサンプル複雑性を達成する。ここで $A = \max_i A_i$ である。
  • マルチプレーヤー一般和マルコフゲームでは、V-learningは $\tilde{\mathcal{O}}(H^5 S A / \epsilon^2)$ エピソード以内に粗い相関均衡を発見する。
  • マルチプレーヤー一般和ゲームでは、V-learningはサンプル複雑性 $\tilde{\mathcal{O}}(H^5 S A^2 / \epsilon^2)$ で相関均衡を計算する。
  • アルゴリズムは完全に分散型である。各エージェントが、通信や協調を一切行わず、局所的観測のみを用いてV-learningを独立して実行可能。
  • 理論的分析により、V-learningのサンプル複雑性が個々の行動空間サイズの最大値 $A$ のみに依存し、積 $\prod_i A_i$ には依存しないことが示され、マルチエージェントの Curse を克服している。
  • この手法は証明可能な効率性を有し、情報理論的下界に対して対数因子を除き一致するため、近似的に最適性が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。