Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Actor-Critic with Hierarchical Graph Attention Network

Heechang Ryu, Hayong Shin|arXiv (Cornell University)|Sep 27, 2019
Reinforcement Learning in Robotics参考文献 31被引用数 9
ひとこと要約

本稿では、協調的・競争的環境におけるエージェント間およびグループ間の関係をモデル化するため、階層的グラフアテンションネットワーク(HGAT)とマルチエージェントアクタクリティック学習を組み合わせたマルチエージェント強化学習フレームワークHAMAを提案する。エージェント間およびグループ間のアテンションメカニズムを活用することで、HAMAはより戦略的で解釈可能かつ転送可能な方策を実現し、混合協調的・競争的タスクにおいて既存手法を上回り、新しいエージェント構成へのゼロショット転送においても優れた性能を示す。

ABSTRACT

Most previous studies on multi-agent reinforcement learning focus on deriving decentralized and cooperative policies to maximize a common reward and rarely consider the transferability of trained policies to new tasks. This prevents such policies from being applied to more complex multi-agent tasks. To resolve these limitations, we propose a model that conducts both representation learning for multiple agents using hierarchical graph attention network and policy learning using multi-agent actor-critic. The hierarchical graph attention network is specially designed to model the hierarchical relationships among multiple agents that either cooperate or compete with each other to derive more advanced strategic policies. Two attention networks, the inter-agent and inter-group attention layers, are used to effectively model individual and group level interactions, respectively. The two attention networks have been proven to facilitate the transfer of learned policies to new tasks with different agent compositions and allow one to interpret the learned strategies. Empirically, we demonstrate that the proposed model outperforms existing methods in several mixed cooperative and competitive tasks.

研究の動機と目的

  • 複雑で多様な環境における既存のマルチエージェント強化学習(MARL)手法の転送性とスケーラビリティの限界を解消すること。
  • 構造化されたグラフアテンションメカニズムを用いて、エージェント間の階層的関係(グループ内およびグループ間)をモデル化すること。
  • 動的な状態依存的関係に基づき、協調と競争の間を適応的に切り替える分散型方策を可能にすること。
  • グループ内およびグループ間の相互作用におけるアテンション重みの分析を通じて、方策の解釈可能性を向上させること。
  • 訓練済み方策を、エージェント数や構成が異なる新しいタスクにゼロショットで転送できることを実証すること。

提案手法

  • HAMAは、個々のエージェントとグループレベルの両方を別々のエージェント間およびグループ間アテンション層を用いてモデル化する階層的グラフアテンションネットワーク(HGAT)を採用する。
  • エージェント間アテンション層は、同じグループ内の個々のエージェント間のアテンション重みを計算し、協調的ダイナミクスを捉える。
  • グループ間アテンション層は、グループ間のアテンションを計算し、グループ間の競争的または戦略的協調をモデル化する。
  • HGATは各エージェントの局所的観測を、文脈に即した情報圧縮された埋め込みベクトルに変換し、方策学習に用いる。
  • モデルは、個々のクリティックとアクターを、埋め込み表現を用いて学習する集中型訓練・分散型実行(CTDE)フレームワークを採用する。
  • このアーキテクチャにより、表現と方策のエンドツーエンド学習が可能となり、アテンション重みが戦略的意思決定の解釈可能性を提供する。

実験結果

リサーチクエスチョン

  • RQ1階層的グラフアテンション機構は、混合協調的・競争的マルチエージェント環境における方策性能を向上させ得るか?
  • RQ2エージェント間およびグループ間アテンションの組み合わせは、戦略的適応性と方策の転送性を向上させるか?
  • RQ3小規模なマルチエージェントタスクで訓練された方策が、エージェント構成が異なる大規模なタスクにどの程度転送可能か?
  • RQ4HGATモデル内のアテンション重みを用いて、エージェントの意思決定プロセスを解釈的・説明可能にできるか?
  • RQ5マルチエージェント相互作用をモデル化する際、階層的グラフ構造は平坦または単一レベルのグラフ構造よりも優れているか?

主な発見

  • HAMAは、MADDPG、COMA、MAACなどの既存MARL手法を、4種類の異なる協調的・競争的ゲームシナリオにおいてすべて上回る性能を達成した。
  • アブレーションスタディの結果、階層的グラフと二重アテンション機構を備えた完全なHAMAモデル(HG-IAGA)が最良の性能を示し、SG-IAA や HG-NA などの変種を上回った。
  • 3対3の捕食者・獲物ゲームで訓練された方策をm対nの構成にゼロショットで転送したところ、m > n の場合に捕食者の成功確率が1.0に近づき、優れたゼロショット転送性を示した。
  • エージェント間アテンション重みは、獲物をコーナーに追い込むために協調する際、捕食者同士で相互に注目する傾向が高まっていることを示しており、協調的行動を捉えている。一方、グループ間アテンションは、敵対的グループに対する競争的意図を示している。
  • 「More-the-Stronger」ゲームでは、グループサイズが捕獲能力を決定するが、HAMAは大きな捕食者グループが集中的な獲物を効果的に捕獲する戦略を学習し、ベースラインモデルを上回った。
  • アテンション可視化の結果、動的なアテンションパターンに基づき、協調的追跡や競争的標的指定といった意味のある、解釈可能な戦略がモデルが学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。