Skip to main content
QUICK REVIEW

[論文レビュー] Learning Individually Inferred Communication for Multi-Agent Cooperation

Ziluo Ding, Tiejun Huang|arXiv (Cornell University)|Jun 11, 2020
Reinforcement Learning in Robotics参考文献 26被引用数 19
ひとこと要約

本稿では、複数エージェント強化学習における通信の非効率性と冗長性を解消することを目的として、個別に推論される通信(I2C)を提案する。I2Cは、共同行動価値関数から因果的影響を用いて一対一通信の因果的事前分布を学習し、通信のオーバーヘッドを低減するとともに協調的パフォーマンスを向上させる。I2Cは、協調的ナビゲーション、捕食者・獲物、交通交差点の環境において、因果的影響に基づき誰と通信すべきかを学習することで、既存手法を上回り、複雑な交通状況では最大37%の通信削減を達成している。

ABSTRACT

Communication lays the foundation for human cooperation. It is also crucial for multi-agent cooperation. However, existing work focuses on broadcast communication, which is not only impractical but also leads to information redundancy that could even impair the learning process. To tackle these difficulties, we propose Individually Inferred Communication (I2C), a simple yet effective model to enable agents to learn a prior for agent-agent communication. The prior knowledge is learned via causal inference and realized by a feed-forward neural network that maps the agent's local observation to a belief about who to communicate with. The influence of one agent on another is inferred via the joint action-value function in multi-agent reinforcement learning and quantified to label the necessity of agent-agent communication. Furthermore, the agent policy is regularized to better exploit communicated messages. Empirically, we show that I2C can not only reduce communication overhead but also improve the performance in a variety of multi-agent cooperative scenarios, comparing to existing methods. The code is available at https://github.com/PKU-AI-Edge/I2C.

研究の動機と目的

  • 複数エージェント強化学習(MARL)におけるブロードキャスト通信の非効率性と冗長性を是正すること。
  • すべてのエージェントにブロードキャストするのではなく、因果的影響に基づいて誰と通信すべきかを学習できるようにすること。
  • 部分的に観測可能で非定常な環境において、通信のオーバーヘッドを低減しながら協調的パフォーマンスを向上させること。
  • 既存のCTDEフレームワークと互換性を持つ通信制御メカニズムの開発。

提案手法

  • I2Cは、エージェントの局所的観測を、どの他のエージェントと通信すべきかという信念にマッピングする全結合ニューラルネットワークを用いる。
  • 通信の事前分布は、共同行動価値関数からの因果的推論によって学習され、あるエージェントの行動が別のエージェントの方策に与える影響の大きさを定量化する。
  • 因果的効果が通信の必要性をラベルづけ、通信事前分布の教師あり学習を可能にする。
  • 通信されたメッセージを受け取った状況での方策学習を改善するために、相関正則化項を導入する。
  • I2Cは視野内にあるエージェントに限定して通信を制限し、すべてのエージェントへのブロードキャストとは異なり、一対一通信をサポートする。
  • I2Cは、通信量を削減する目的で、TarMACのような完全通信手法と組み合わせて通信制御モジュールとして統合可能である。

実験結果

リサーチクエスチョン

  • RQ1エージェント間の因果的影響を用いて、MARLにおける意味のある選択的・一対一通信の事前分布を学習できるか?
  • RQ2因果的推論によって誰と通信すべきかを学習することで、パフォーマンスを損なわせることなく通信のオーバーヘッドを低減できるか?
  • RQ3I2Cは、完全通信および通信なしのベースラインと比較して、協調的マルチエージェントタスクでどのように性能を発揮するか?
  • RQ4I2Cは、既存の完全通信手法の効果的な通信制御メカニズムとして機能できるか?
  • RQ5相関正則化は、エージェントが通信されたメッセージを受け取った際の方策学習を改善するか?

主な発見

  • 交通交差点のミディアムモードでは、I2C+TarMACは97.92%の成功率を達成し、TarMAC(97.60%)を上回り、通信なしベースライン(79.19%)を著しく上回った。
  • 交通交差点のハードモードでは、I2C+TarMACは92.17%の成功率を達成し、TarMAC(89.24%)を3%以上上回った。一方、IC3Netと通信なしベースラインはそれぞれ40.47%および48.10%にとどまり、低い性能を示した。
  • I2Cは、ミディアムモードでTarMAC比約34%、ハードモードで37%の通信オーバーヘッド削減を達成し、効果的な通信制御を実証した。
  • アブレーションスタディの結果、因果的効果推論が通信の必要性を正確に捉えており、相関正則化が方策パフォーマンスの向上に寄与していることが確認された。
  • I2Cは、協調的ナビゲーションおよび捕食者・獲物環境において、通信あり・なしの両方のベースラインを上回り、タスク間での汎用性を示した。
  • 本手法はさまざまなCTDEフレームワークと互換性があり、既存の完全通信手法にプラグインとして組み込むことで、通信オーバーヘッドを低減可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。