Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Communicate Using Counterfactual Reasoning

Simon Vanneste, Astrid Vanneste|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 34被引用数 6
ひとこと要約

本稿では、通信学習における報酬割り当て問題を解決するために、集中型のコーチが反事後的推論を用いるMACC(Multi-Agent Counterfactual Communication)という、新しいマルチエージェント強化学習手法を提案する。反事後的推論を用いて行動とメッセージの影響をモデル化し、社会的損失関数を導入することで、MACCはエージェントが効果的で影響を受けやすい通信プロトコルを学習可能であり、4つのパーティクル環境シナリオにおいてCOMAやMADDPGを上回り、最大6エージェントの行列環境でもスケーラビリティを示した。

ABSTRACT

Learning to communicate in order to share state information is an active problem in the area of multi-agent reinforcement learning (MARL). The credit assignment problem, the non-stationarity of the communication environment and the creation of influenceable agents are major challenges within this research field which need to be overcome in order to learn a valid communication protocol. This paper introduces the novel multi-agent counterfactual communication learning (MACC) method which adapts counterfactual reasoning in order to overcome the credit assignment problem for communicating agents. Secondly, the non-stationarity of the communication environment while learning the communication Q-function is overcome by creating the communication Q-function using the action policy of the other agents and the Q-function of the action environment. Additionally, a social loss function is introduced in order to create influenceable agents which is required to learn a valid communication protocol. Our experiments show that MACC is able to outperform the state-of-the-art baselines in four different scenarios in the Particle environment.

研究の動機と目的

  • 通信学習における報酬割り当て問題に対処すること。これは、エージェントが個々の行動やメッセージに報酬を帰属づけるのを困難にしている。
  • 通信Q関数学習中に環境の非定常性を克服すること。これには、他のエージェントの方策と環境のQ関数を用いる。
  • 受信エージェントが受信メッセージに影響を受けるように保証すること。これには、社会的行動を促進する社会的損失関数を導入する。
  • 大規模なマルチエージェントシステムにおけるスケーラビリティを実現するため、正確な反事後的計算の計算効率の良い近似を構築すること。
  • 多様な通信トポロジー、特に多数対多数の設定を含む、さまざまな通信設定において、手法の性能とスケーラビリティを検証すること。

提案手法

  • MACCは集中型コーチを用いて、行動とメッセージの反事後的価値を計算し、協調的MARLにおける正確な報酬割り当てを可能にする。
  • 通信Q関数は、他のエージェントの方策と環境のQ関数を用いて構築され、トレーニング中の非定常性を低減する。
  • 計算コストを削減しながら性能を維持するための2つの近似手法—MACC Sampling MeanとMACC Agent-Based Sampling—を提案する。
  • 受信エージェントがメッセージに影響を受けるように促進するため、社会的損失関数を導入する。これにより、有効な通信プロトコルの学習が可能になる。
  • CTDE(集中型トレーニング、分散型実行)の枠組みで動作する。トレーニング中は集中計算が可能だが、推論時には分散型のまま保たれる。
  • 対称的環境では、共有パラメータを持つ独立方策を用いたMACCバージョンを評価し、スケーラビリティを向上させる。

実験結果

リサーチクエスチョン

  • RQ1集中型コーチにおける反事後的推論は、マルチエージェントシステムにおける行動方策と通信方策の両方の報酬割り当てを改善できるか?
  • RQ2反事後的計算の近似手法は、大規模なマルチエージェント設定における学習性能とスケーラビリティにどのように影響するか?
  • RQ3社会的損失関数は、受信エージェントの影響を受けやすさを効果的に促進するか?これにより、有効な通信プロトコルの出現が可能になるか?
  • RQ4COMA や MADDPG といった最先端手法と比較して、MACC は多様な通信シナリオでどの程度の性能を示すか?
  • RQ5MACC は、特に複雑な多数対多数通信トポロジーにおいて、どの程度大規模なマルチエージェントシステムにスケーリングできるか?

主な発見

  • MACCバージョンは、4つのパーティクル環境シナリオすべてでCOMA や MADDPG を上回り、平均報酬が高く、収束が速い。
  • マトリクス環境(2、4、6エージェント)では、MACC Exact と MACC Agent-Based Sampling が最高の報酬を達成し、優れたスケーラビリティを示した。
  • MACC Sampling Mean は、確率的サンプリングのため、エージェント数が増えると分散が大きくなり、収束が遅くなる傾向を示した。
  • 社会的損失関数は不可欠である:社会的損失なしのMACC Exact では報酬が0.5をわずかに上回るにとどまり、基本的なプロトコルしか学習できていないが、完全版MACCでは近似的最適性能に達した。
  • 大規模な設定では、MACC Agent-Based Sampling が MACC Sampling Mean よりわずかに優れており、高次元のエージェント空間における分散制御が優れていることが示唆された。
  • 正確なMACC手法は6エージェントでも高い性能を維持しており、複雑でスケーラブルなマルチエージェント通信システムへの実用性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。