Skip to main content
QUICK REVIEW

[論文レビュー] On the Approximation of Cooperative Heterogeneous Multi-Agent Reinforcement Learning (MARL) using Mean Field Control (MFC)

Washim Uddin Mondal, Mridul Agarwal|arXiv (Cornell University)|Sep 8, 2021
Reinforcement Learning in Robotics被引用数 11
ひとこと要約

本稿は、K種の異なるエージェントクラスを有する協調的で非一様なマルチエージェント強化学習(MARL)を近似するための平均場制御(MFC)フレームワークを提案する。クラスサイズの逆平方根に比例する近似誤差の境界を証明する。3つの異なる相互作用シナリオにおいて、O(e_j)の誤差内で近似的に最適なMARL方策に収束する自然勾配法ベースのアルゴリズムを導入し、サンプル複雑度はO(e_j^{-3})である。

ABSTRACT

Mean field control (MFC) is an effective way to mitigate the curse of dimensionality of cooperative multi-agent reinforcement learning (MARL) problems. This work considers a collection of $N_{\\mathrm{pop}}$ heterogeneous agents that can be segregated into $K$ classes such that the $k$-th class contains $N_k$ homogeneous agents. We aim to prove approximation guarantees of the MARL problem for this heterogeneous system by its corresponding MFC problem. We consider three scenarios where the reward and transition dynamics of all agents are respectively taken to be functions of $(1)$ joint state and action distributions across all classes, $(2)$ individual distributions of each class, and $(3)$ marginal distributions of the entire population. We show that, in these cases, the $K$-class MARL problem can be approximated by MFC with errors given as $e_1=\\mathcal{O}(\\frac{\\sqrt{|\\mathcal{X}|}+\\sqrt{|\\mathcal{U}|}}{N_{\\mathrm{pop}}}\\sum_{k}\\sqrt{N_k})$, $e_2=\\mathcal{O}(\\left[\\sqrt{|\\mathcal{X}|}+\\sqrt{|\\mathcal{U}|}\ ight]\\sum_{k}\\frac{1}{\\sqrt{N_k}})$ and $e_3=\\mathcal{O}\\left(\\left[\\sqrt{|\\mathcal{X}|}+\\sqrt{|\\mathcal{U}|}\ ight]\\left[\\frac{A}{N_{\\mathrm{pop}}}\\sum_{k\\in[K]}\\sqrt{N_k}+\\frac{B}{\\sqrt{N_{\\mathrm{pop}}}}\ ight]\ ight)$, respectively, where $A, B$ are some constants and $|\\mathcal{X}|,|\\mathcal{U}|$ are the sizes of state and action spaces of each agent. Finally, we design a Natural Policy Gradient (NPG) based algorithm that, in the three cases stated above, can converge to an optimal MARL policy within $\\mathcal{O}(e_j)$ error with a sample complexity of $\\mathcal{O}(e_j^{-3})$, $j\\in\\{1,2,3\\}$, respectively.

研究の動機と目的

  • 異なるエージェントタイプを有する協調的で非一様なマルチエージェント強化学習(MARL)に対するスケーラブルで、グローバルに収束する手法の不足に対処すること。
  • K種の非一様なエージェントクラスを有する有限集団MARLと平均場制御(MFC)との間の厳密な近似保証を確立すること。
  • 提案されたMFC近似に基づき、近似的に最適なMARL方策に収束する、サンプル効率の良いポリシー勾配アルゴリズムを開発すること。
  • 3つの異なる相互作用レジームの分析:連合分布依存、個別クラス分布依存、および周辺集団分布依存。
  • 従来のMFC(同質のエージェントを仮定)を、クラス間相互作用とクラス固有のダイナミクスを許容する非一様系に一般化すること。

提案手法

  • N_pop体の非一様エージェントから成る集団を、各クラスにN_k体の同質的エージェントが含まれるKクラスに分割し、クラスレベルの対称性とクラス間相互作用のモデリングを可能にする。
  • 報酬関数および遷移関数が集団分布にどのように依存するかに基づき、3つの異なるMFC近似シナリオ(連合分布、個別クラス分布、周辺分布)を導出する。
  • MFC極限における報酬、遷移、方策関数のリプシッツ連続性を確立し、全変動距離を用いた誤差伝播解析を可能にする。
  • 正規化されたクラス分布μ̄およびν̄を用いて、KクラスMARL問題を等価なMFC問題に変換し、エージェントクラス間の一貫性を保証する。
  • 安定性および収縮の議論を用いて、|X|、|U|、および1/√N_kの項に明示的な依存関係を持つ近似誤差の境界を証明する。
  • MFC問題用に自然勾配法(NPG)アルゴリズムを設計し、3つのシナリオそれぞれについて、O(e_j)の誤差内で収束し、サンプル複雑度がO(e_j^{-3})であることを示す。

実験結果

リサーチクエスチョン

  • RQ1K種の非一様なエージェントクラスを有する協調的MARLは、Kクラス平均場制御(MFC)フレームワークによって効果的に近似可能か?
  • RQ2報酬および遷移関数の依存構造が異なる場合、有限集団MARLとその対応するMFC極限との間の近似誤差は何か?
  • RQ3非一様なMARLシステムにおいて、個別エージェントクラスのサイズおよび全体集団サイズに伴い、誤差はどのようにスケーリングされるか?
  • RQ4MFC近似を介して、近似的に最適なMARL方策に収束する、サンプル効率の良いポリシー勾配アルゴリズムを設計可能か?
  • RQ5提案されたNPGベースのアルゴリズムの理論的サンプル複雑度および収束速度は、異なる相互作用レジームにおいてどのように異なるか?

主な発見

  • 連合分布シナリオにおける近似誤差は、e₁ = O((√|X| + √|U|)/N_pop × ∑ₖ √Nₖ)で有界であり、クラスサイズに逆比例する。
  • 個別クラス分布ケースでは、誤差はe₂ = O((√|X| + √|U|) × ∑ₖ 1/√Nₖ)であり、小さなクラスに強く依存する。
  • 周辺分布シナリオでは、誤差はe₃ = O((√|X| + √|U|) × (A/N_pop × ∑ₖ √Nₖ + B/√N_pop))であり、追加の定数AおよびBを含む。
  • 提案されたNPGベースのアルゴリズムは、各シナリオj ∈ {1,2,3}においてO(e_j)の誤差内で収束し、サンプル複雑度はO(e_j^{-3})である。
  • 報酬、遷移、方策関数のリプシッツ連続性の仮定の下で理論的境界が導出され、MFC極限における安定性が保証される。
  • 本フレームワークは、クラス間相互作用とクラス固有のダイナミクスを許容するため、従来のMFCを一般化しており、ライドシェアリングやスマートグリッドなどの現実世界の非一様システムへの応用を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。