Skip to main content
QUICK REVIEW

[論文レビュー] FCMNet: Full Communication Memory Net for Team-Level Cooperation in Multi-Agent Systems

Yutong Wang, Guillaume Sartoretti|arXiv (Cornell University)|Jan 28, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

FCMNet は、方向性再帰ニューラルネットワークを用いてエージェント間でマルチホップメッセージを交換し、共有で分散型のポリシーを学習できる微分可能通信学習フレームワークである。StarCraft II のミクロマネジメントタスクにおいて、最先端の通信ベースの手法を上回り、メッセージ損失や通信の乱れに対しても頑健であるため、実世界のロボットアプリケーションへの応用が期待される。

ABSTRACT

Decentralized cooperation in partially-observable multi-agent systems requires effective communications among agents. To support this effort, this work focuses on the class of problems where global communications are available but may be unreliable, thus precluding differentiable communication learning methods. We introduce FCMNet, a reinforcement learning based approach that allows agents to simultaneously learn a) an effective multi-hop communications protocol and b) a common, decentralized policy that enables team-level decision-making. Specifically, our proposed method utilizes the hidden states of multiple directional recurrent neural networks as communication messages among agents. Using a simple multi-hop topology, we endow each agent with the ability to receive information sequentially encoded by every other agent at each time step, leading to improved global cooperation. We demonstrate FCMNet on a challenging set of StarCraft II micromanagement tasks with shared rewards, as well as a collaborative multi-agent pathfinding task with individual rewards. There, our comparison results show that FCMNet outperforms state-of-the-art communication-based reinforcement learning methods in all StarCraft II micromanagement tasks, and value decomposition methods in certain tasks. We further investigate the robustness of FCMNet under realistic communication disturbances, such as random message loss or binarized messages (i.e., non-differentiable communication channels), to showcase FMCNet's potential applicability to robotic tasks under a variety of real-world conditions.

研究の動機と目的

  • グローバルでは利用可能だが信頼性に欠ける通信チャネルを有する部分観測マルチエージェントシステムにおけるチームレベルの協調を解決すること。
  • エージェントがマルチホップ通信プロトコルと共有で分散型のポリシーを同時に学習できる通信学習フレームワークを開発すること。
  • メッセージ損失、バイナリ化、ランダムな送信順序といった現実的な通信障害に対して耐性を持つこと。
  • 各タイムステップでエージェントが他の全エージェントからの情報を逐次受信・処理できるようにすることで、グローバルな協調を向上させること。
  • 共有報酬および個別報酬の両方のマルチエージェント環境において、本手法の有効性を実証すること。

提案手法

  • FCMNet は、エージェント間のメッセージの符号化と送信に複数の方向性再帰ニューラルネットワーク(RNN)を用い、隠れ状態とセル状態を通信信号として使用する。
  • 各エージェントは自身の観測を自己メモリとして保持し、各タイムステップで固定されたマルチホップ順序に従って、他の全エージェントからのメッセージを受信する。
  • エージェント間で重み共有を採用することで、共同学習を可能にするとともに、ポリシーの対称性を保証し、分散実行を可能にする。
  • 通信は微分可能であり、中央集権的学習と分散実行(CTDE)のポリシー勾配法によりエンドツーエンドの学習が可能である。
  • フレームワークはマルチホップメッセージ伝達をサポートしており、エージェントが時間経過とともに全チームメイトからの情報を蓄積・推論できる。
  • 耐性評価は、訓練および推論時にメッセージのバイナリ化、ランダムなメッセージ損失、ランダム化された送信順序を導入することで実施される。

実験結果

リサーチクエスチョン

  • RQ1微分可能な通信学習フレームワークは、グローバルでは利用可能だが信頼性に欠ける通信チャネルを有する部分観測マルチエージェント環境において、優れたチームレベルの協調を達成できるか?
  • RQ2複雑なミクロマネジメントタスクにおいて、FCMNet は最先端の通信ベースおよび価値分解手法と比較してどのように性能を発揮するか?
  • RQ3メッセージ損失やバイナリ化されたメッセージといった現実的な通信障害に対して、FCMNet はどの程度の性能を維持できるか?
  • RQ4メッセージ送信順序をランダム化することは、FCMNet の学習安定性や最終的な性能に影響を与えるか?
  • RQ5通信がノイズが多くたり不完全であったりする状況でも、FCMNet は安定的で高性能な協調ポリシーを学習できるか?

主な発見

  • FCMNet は、評価されたすべての StarCraft II ミクロマネジメントタスクで、すべての最先端の通信ベースの強化学習手法を上回った。
  • 特定のタスクでは、協調マルチエージェント強化学習で優れた性能を発揮することが知られる価値分解手法と同等の性能を達成した。
  • メッセージ損失確率が 3% 未満の場合、安定した学習と高い性能を維持でき、収束速度や最終エピソード長に劣化は認められなかった。
  • メッセージ損失率が 3.5% を超えると、学習が不安定化し、エージェントとクライアントの損失が収束しなくなり、性能の崩壊閾値に達した。
  • メッセージ送信順序をランダム化しても性能に悪影響がなく、メッセージの多様性が増加することで収束が早まる可能性がある。
  • 最大 3% のメッセージ損失を伴って訓練されたエージェントは、動くターゲットを正確に追跡・到達可能であるが、損失率が高いと正確なターゲット追跡が困難になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。