Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Share in Multi-Agent Reinforcement Learning

Yuxuan Yi, Ge Li|arXiv (Cornell University)|Dec 16, 2021
Evolutionary Game Theory and Cooperation被引用数 6
ひとこと要約

本稿では、ネットワーキングされたマルチエージェント強化学習(MARL)における協調性を向上させるために、エージェントが周囲のエージェントと動的報酬共有を学習できる階層的で分散型のマルチエージェント強化学習フレームワーク、LToSを提案する。グローバルな目的関数の分解(ハイレベルポリシー)とローカルポリシー最適化(ローレベルポリシー)を分離することで、LToSは社会的ジレンマと大規模な交通制御の両シナリオにおいて、QMIX、DGN、NeurCommを凌駕する性能を達成し、収束性とグローバルリターンの両面で優れた結果を示した。

ABSTRACT

In this paper, we study the problem of networked multi-agent reinforcement learning (MARL), where a number of agents are deployed as a partially connected network and each interacts only with nearby agents. Networked MARL requires all agents to make decisions in a decentralized manner to optimize a global objective with restricted communication between neighbors over the network. Inspired by the fact that sharing plays a key role in human's learning of cooperation, we propose LToS, a hierarchically decentralized MARL framework that enables agents to learn to dynamically share reward with neighbors so as to encourage agents to cooperate on the global objective through collectives. For each agent, the high-level policy learns how to share reward with neighbors to decompose the global objective, while the low-level policy learns to optimize the local objective induced by the high-level policies in the neighborhood. The two policies form a bi-level optimization and learn alternately. We empirically demonstrate that LToS outperforms existing methods in both social dilemma and networked MARL scenarios across scales.

研究の動機と目的

  • エージェントが隣接エージェントとのみ通信する部分的に接続された大規模マルチエージェントネットワークにおいて、分散型の協調を実現する課題に対処すること。
  • 既存の集中学習・分散実行(CTDE)手法が過剰一般化とスケーラビリティの欠如に苦しむという限界を克服すること。
  • エージェントがグローバルな目的関数の集団最適化を促進するために、報酬をどのように共有するかを動的に学習するメカニズムを開発すること。
  • 従来の研究で一般的な手作業による報酬関数やグローバル状態へのアクセスに依存しないこと。
  • 大規模で分散型の学習を可能にする二段階ポリシー構造を採用し、動的な環境における動的調整を可能にすること。

提案手法

  • 二段階の階層的フレームワークを提案:ハイレベルポリシーが、グローバル目的関数を分解するために周囲のエージェントと報酬をどのように共有するかを学習する。
  • ローレベルポリシーが、ハイレベルポリシーによる報酬共有意思決定によって誘発されるローカル目的関数を最適化する。
  • ハイレベルとローレベルのポリシーは、二段階最適化プロセスを通じて交互に学習される。
  • ハイレベルポリシーは、連合ハイレベルポリシーの平均場近似として理論的に正当化されており、安定性を保証する。
  • ハイレベルポリシーにはDDPGを、ローレベルポリシーにはDGNを実装したが、他の強化学習アルゴリズムにも一般化可能である。
  • ネットワーク上のメッセージパッシングを用いてローカルな情報交換を可能にし、グローバル状態へのアクセスなしに分散実行を実現する。

実験結果

リサーチクエスチョン

  • RQ1分散型マルチエージェント強化学習フレームワークは、ネットワーキング環境におけるグローバルな協調性を向上させるために、動的報酬共有を学習できるか?
  • RQ2ハイレベルポリシーを用いて報酬共有を学習することは、社会的ジレンマにおいて固定または手作業による報酬形状付けよりも優れたパフォーマンスをもたらすか?
  • RQ3提案された二段階フレームワークは、交通信号制御システムのような大規模で部分的に接続されたネットワークにおいても効果的にスケーリング可能か?
  • RQ4動的報酬共有メカニズムは、集中型または固定構造の信用配分および報酬形状付け手法と比較して、どのように差を示すか?
  • RQ5ハイレベルポリシーが共有重みを適応的に調整できる能力が、ピーク時間帯のような動的環境変化の間、協調性をどのように向上させるか?

主な発見

  • CityFlow交通シミュレーションにおいて、LToSはDGN、QMIX、NeurComm、ConseNetを上回り、6×6グリッドネットワークにおける1台あたりの赤信号通過回数をQMIXの5.94からLToSの0.58にまで削減した。
  • 33つの交差点を有する実際の深セン交通ネットワークにおいて、LToSは1台あたりの平均待機時間を1.71回の赤信号にまで低減した。これはDQNの13.99およびDGNの2.02を下回った。
  • アブレーションスタディの結果、固定された共有重み(固定LToS)は動的環境では著しく性能が低く、ハイレベルポリシーによる適応的協調の必要性を裏付けた。
  • IPおよびLIOに比べ、LToSは収束が早く、より安定しており、ハイパーパrameterへの感受性が低かった。
  • 自己中心的行動パターンの可視化結果から、ピーク時間帯にはエージェントが自己中心的行動を減少させていることが示され、ハイレベルポリシーが環境の要請に応じて協調レベルを動的に調整していることを示した。
  • 自己中心的行動の空間的・時間的パターンから、ピーク時間帯には内部エージェントがより協調的で十字型の協調パターンを示しており、文脈に応じた複雑な協調行動の出現を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。