Skip to main content
QUICK REVIEW

[論文レビュー] Learning Structured Communication for Multi-agent Reinforcement Learning

Junjie Sheng, Xiangfeng Wang|arXiv (Cornell University)|Feb 11, 2020
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

本稿では、階層的通信フレームワーク「LSC(Learning Structured Communication)」を提案する。LSCは、クラスタベースのルーティングプロトコルにより動的にエージェントグループを形成し、階層的グラフニューラルネットワーク(GNN)を用いてグループ内およびグループ間の効率的なメッセージ伝達を実現する。LSCは、大規模なマルチエージェント強化学習(MARL)環境において、通信効率性、スケーラビリティ、協調性の面で優れた性能を発揮し、競争的および協調的タスクの両方で既存手法を上回り、戦闘シナリオでは最大1.60のグローバル成功率を達成した。

ABSTRACT

This work explores the large-scale multi-agent communication mechanism under a multi-agent reinforcement learning (MARL) setting. We summarize the general categories of topology for communication structures in MARL literature, which are often manually specified. Then we propose a novel framework termed as Learning Structured Communication (LSC) by using a more flexible and efficient communication topology. Our framework allows for adaptive agent grouping to form different hierarchical formations over episodes, which is generated by an auxiliary task combined with a hierarchical routing protocol. Given each formed topology, a hierarchical graph neural network is learned to enable effective message information generation and propagation among inter- and intra-group communications. In contrast to existing communication mechanisms, our method has an explicit while learnable design for hierarchical communication. Experiments on challenging tasks show the proposed LSC enjoys high communication efficiency, scalability, and global cooperation capability.

研究の動機と目的

  • 完全接続型、スターベース、ツリー型、近隣構造などの固定で手動で設計された通信トポロジーに起因するマルチエージェント強化学習(MARL)における制限を克服すること。
  • 動的で学習可能な階層的通信構造を導入することで、大規模MARLにおける通信効率性とメッセージ理解度を向上させること。
  • 適応的エージェントグループ形成と階層的メッセージ伝達を用いて、複雑なMARL環境におけるグローバル協調性とスケーラビリティを強化すること。
  • 通信トポロジー学習とポリシー学習をエンドツーエンド微分可能に統合する統一フレームワークの構築すること。

提案手法

  • クラスタベースのルーティングプロトコル(CBRP)は、通信重みを学習することで、階層的エージェントグループを動的に形成し、適応的かつ高レベルのエージェント選択を可能にする。
  • 階層的グラフニューラルネットワーク(GNN)を用いて、グループ内およびグループ間のメッセージ伝達をモデル化し、効果的な情報集約を実現する。
  • 補助的な強化学習タスクにより、通信重みポリシーをエンドツーエンドで訓練することで、システムが最適な通信トポロジーを自己組織化できるようにする。
  • 通信構造は明示的に学習されるため、事前に定義されたものではなく、エピソード全体にわたって柔軟でスケーラブルかつ効率的なトポロジー適合が可能になる。
  • フレームワークはグループ間(グローバル)およびグループ内(ローカル)通信をサポートしており、グローバルな認識と細粒度の調整の両立を図る。
  • 方法はエンドツーエンドで実装されており、通信トポロジーとポリシーがポリシー勾配法を用いて同時に訓練される。

実験結果

リサーチクエスチョン

  • RQ1学習可能な階層的通信トポロジーは、大規模マルチエージェント強化学習における通信効率性とスケーラビリティを向上させることができるか?
  • RQ2ルーティングプロトコルによる動的エージェントグループ形成は、MARLにおけるグローバル協調性とポリシー性能にどのように影響を与えるか?
  • RQ3GNNを用いた階層的メッセージ伝達は、固定トポロジーと比較して、メッセージ理解度と情報へのアクセス性をどの程度向上させるか?
  • RQ4提案フレームワークは、競争的および協調的MARL環境の両方で、既存の通信メカニズムを上回る性能を発揮できるか?

主な発見

  • 64×64の戦闘シナリオでは、LSCは平均報酬1.13を達成し、LSC-star(1.04)、LSC-nbor(0.94)、IDQN(0.89)を上回った。
  • LSCは62.9回の成功キル数を記録し、グローバル成功率1.60を達成し、ベースラインを著しく上回った。
  • 協調的スプレッドタスクでは、LSCは平均報酬-54.6を達成し、156回のランドマーク到達に成功し、過負荷はたった13回にとどまり、すべてのベースラインを上回った。
  • CBRPサブモジュールにより、高レベルエージェントの密度が密集したクラスタからわずか3エージェントにまで低減され、通信効率が向上し、冗長性が低減された。
  • LSCは、より良いグローバル情報共有と調整により、スターや近隣構造、IDQNベースラインと比較して、より速く収束し、より高い性能を達成した。
  • LSCが実現する階層的構造により、効果的なグローバル通信と細粒度のローカル調整の両立が可能となり、優れたスケーラビリティと耐障害性が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。