Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Multi-Agent Reinforcement Learning through Intelligent Information Aggregation

Siddharth Nayak, Kenneth Choi|arXiv (Cornell University)|Nov 3, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、局所的近隣情報の知的に統合することでスケーラブルで分散型のマルチエージェント強化学習を可能にする、グラフニューラルネットワークベースのアーキテクチャであるInforMARLを提案する。本手法は、グローバル情報ベースラインを上回る優れたサンプル効率と一般化性能を達成しており、グローバル状態に依存せずに、局所的観測のみで高水準のナビゲーションおよび協調タスクの成功率を維持する。

ABSTRACT

We consider the problem of multi-agent navigation and collision avoidance when observations are limited to the local neighborhood of each agent. We propose InforMARL, a novel architecture for multi-agent reinforcement learning (MARL) which uses local information intelligently to compute paths for all the agents in a decentralized manner. Specifically, InforMARL aggregates information about the local neighborhood of agents for both the actor and the critic using a graph neural network and can be used in conjunction with any standard MARL algorithm. We show that (1) in training, InforMARL has better sample efficiency and performance than baseline approaches, despite using less information, and (2) in testing, it scales well to environments with arbitrary numbers of agents and obstacles. We illustrate these results using four task environments, including one with predetermined goals for each agent, and one in which the agents collectively try to cover all goals. Code available at https://github.com/nsidn98/InforMARL.

研究の動機と目的

  • 限局的観測と分散実行の下でのスケーラブルなマルチエージェントナビゲーションの課題に対処すること。
  • グローバル状態情報に依存せずに、マルチエージェント強化学習におけるサンプル効率とポリシーの転移可能性を向上させること。
  • ナビゲーションと協調タスクにおいて、ナーブなグローバル状態の連結よりも、局所情報の知的な統合が優れていることを示すこと。
  • グローバル状態に依存せず、局所的観測のみを用いても、密で動的な環境における効果的な協調と衝突回避を実現できること。
  • グラフベースの情報統合が、多様なマルチエージェントナビゲーションタスクにおけるスケーラビリティとパフォーマンスを向上させられることを示すこと。

提案手法

  • マルチエージェント強化学習(MARL)フレームワークにおいて、エージェントとクライアントネットワークの両方の局所的近隣情報の符号化と統合に、グラフニューラルネットワーク(GNN)を組み込む。
  • エージェントと障害物をノードとし、距離に基づく関係をエッジで表現することで、環境をグラフとして表現する。
  • GNNのメッセージパッシングを用いて、各エージェントの局所的観測の文脈に即した統合表現を計算する。
  • GNN処理済みの情報を、標準的なMARLアルゴリズム(例:RMAPPO)に統合し、コアな学習パラダイムを変更しない。
  • 各エージェントが自らの局所的観測と近隣の統合ベクトルのみに基づいて動作することで、分散型実行を実現する。
  • 固定されたエージェント数で学習し、異なるエージェント数でテストすることで、転移可能性をサポートする。

実験結果

リサーチクエスチョン

  • RQ1グローバル状態ベースラインと比較して、局所情報の知的な統合はマルチエージェント強化学習におけるサンプル効率を向上させ得るか?
  • RQ2GNNベースの情報統合モジュールは、標準的なMARLアルゴリズムと比較して、未学習のエージェント数に一般化する能力を向上させ得るか?
  • RQ3グローバル状態に依存せず、局所的観測のみで学習した分散型MARLポリシーは、カバレッジやフォーメーションなどの複雑な協調タスクで高いパフォーマンスを発揮できるか?
  • RQ4グローバル状態を使用するのと比較して、情報量を減らす(局所的のみ)ことで、スケーラビリティとサンプル複雑性が向上するか?
  • RQ5グラフベースの表現は、ナビゲーションと衝突回避に最も関連する環境情報を効果的に特定・利用できるか?

主な発見

  • InforMARLは、3人および7人のエージェントを用いた全テスト環境(Target, Coverage, Formation, Line)で100%の成功率を達成した。これは、3人エージェントのシナリオでのみ学習した場合でも同様であった。
  • Target環境では、InforMARLがエピソード長の約39%(T ≈ 0.39)で目標に到達した。これは、効率的なナビゲーションを示している。
  • CoverageおよびFormationタスクでは、InforMARLはエピソード長の0.30~0.43の間でタスクを完了し、グローバル観測を使用しないにもかかわらず、RMAPPOと同等またはわずかに優れたパフォーマンスを示した。
  • InforMARLは、グローバル状態モデルよりも情報量が少ないにもかかわらず、トレーニング段階でより優れたサンプル効率を示した。
  • InforMARLは、異なるエージェント数に一般化する能力が高く、3人で学習した後、7人でテストしてもパフォーマンスに低下がなかった。
  • InforMARLは、目標の合意形成を要するタスク(例:Formation, Line)を含め、すべてのタスクで高いパフォーマンスを維持した。これは、最小限の情報で複雑な協調を実現できる能力を証明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。