Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Cooperative Multi-Agent Reinforcement Learning with Function Approximation

Abhimanyu Dubey, Alex Pentland|arXiv (Cornell University)|Mar 8, 2021
Advanced Bandit Algorithms Research被引用数 5
ひとこと要約

本稿では、線形関数近似と限られた通信を伴う協調的マルチエージェント強化学習(MARL)において、近似的に最適なレギュレートなし学習を達成する、証明可能に効率的なアルゴリズムCoopLSVIを提案する。偏り補正推定器と戦略的通信スケジューリングを導入することで、通信量を抑えた分散型で異種のマルチエージェント学習が可能となり、同種の設定では集中型の性能と同等のレギュレート境界を達成し、異種のMDPではパレート最適な方策を達成する。

ABSTRACT

Reinforcement learning in cooperative multi-agent settings has recently advanced significantly in its scope, with applications in cooperative estimation for advertising, dynamic treatment regimes, distributed control, and federated learning. In this paper, we discuss the problem of cooperative multi-agent RL with function approximation, where a group of agents communicates with each other to jointly solve an episodic MDP. We demonstrate that via careful message-passing and cooperative value iteration, it is possible to achieve near-optimal no-regret learning even with a fixed constant communication budget. Next, we demonstrate that even in heterogeneous cooperative settings, it is possible to achieve Pareto-optimal no-regret learning with limited communication. Our work generalizes several ideas from the multi-agent contextual and multi-armed bandit literature to MDPs and reinforcement learning.

研究の動機と目的

  • 限られた通信下で関数近似を用いた分散型で証明可能に効率的なマルチエージェント強化学習アルゴリズムの開発。
  • 線形関数近似を用いた協調的マルチエージェント設定に、単一エージェントから得られるレギュレートなし学習の保証を拡張すること。
  • 通信量を制限しつつ、異種のMDPを扱うために、境界付きの通信でパレート最適な方策学習を可能にすること。
  • マルチアームドバンディットおよびコンテキストバンドイット手法を、協調的マルチエージェントシステムにおけるエピソード的MDPに一般化すること。
  • 同種の設定では集中型の性能と一致するレギュレート境界を達成しつつ、異種の設定でも効率性を維持すること。

提案手法

  • 線形関数近似を用いた協調的マルチエージェント強化学習の分散型最小二乗価値反復アルゴリズムCoopLSVIを提案する。
  • エージェントのMDP間の不均一性を補正するためのバイアス補正推定器を設計し、価値関数推定を改善する。
  • 特定のエピソードでのみ統計を同期化する戦略的通信プロトコルを導入し、通信回数をTに依存しないO(HM³)に制限する。
  • 多目的最最適化からのランダムスカラー化を用いて、マルチエージェントMDPにおけるパレート最適な方策を回復する。
  • 探索と活用のバランスを図るために、信頼区間を用いた楽観的最小二乗価値反復を採用する。
  • 楕円型ポテンシャル理論と被覆議論を用いて、一般化境界を導出し、推定誤差を制御する。

実験結果

リサーチクエスチョン

  • RQ1限られた通信下で関数近似を用いた協調的マルチエージェント強化学習において、レギュレートなし学習を達成できるか?
  • RQ2エージェントのMDP間の不均一性は、分散学習においてどのように効果的にモデル化され、補正されるか?
  • RQ3関数近似を用いた協調的マルチエージェントMDPにおいて、パレート最適な方策を効率的に学習できるか?
  • RQ4どのような通信スケジュールが最小限の通信オーバーヘッドで近似的に最適なレギュレートを実現できるか?
  • RQ5提案されたアルゴリズムは、同種の設定において集中型学習のレギュレート境界を達成するか?

主な発見

  • CoopLSVIアルゴリズムは、並列MDP設定において、グループレギュレートが Õ((d+k)H²√((d+χ)MT)) を達成する。ここでχはMDPの不均一性を測る指標であり、kは不均一性の次元である。
  • 同種の設定では、集中型単一エージェントの境界 Õ(H²√(d³MT)) と一致するため、最適性が示される。
  • 通信回数はTに依存しないO(HM³)に限定されるため、効率的な分散型学習が可能である。
  • 異種のマルチエージェントMDPにおいて、CoopLSVIは累積ベイズレギュレート Õ(H²√(d³T)) を達成する。これは、パレート最適な方策学習における最初のこのようなレギュレートなし境界である。
  • 解析により、推定器がMDPの不均一性に起因するバイアスを効果的に制御し、エージェント間での安定した学習を可能にすることが示された。
  • 被覆議論と行列集中不等式により一般化が保証され、モデルパラメータに依存する対数的被覆数境界が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。