Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent MDP Homomorphic Networks

Elise van der Pol, Herke van Hoof|arXiv (Cornell University)|Oct 9, 2021
Reinforcement Learning in Robotics参考文献 36被引用数 4
ひとこと要約

本稿では、共同マルチエージェントシステムにおける回転対称性や置換対称性といったグローバルな対称性を、グローバル対称性の局所的変換への分解を用いて強制する分散型ディープ強化学習フレームワーク「マルチエージェントMDPホモモーフィックネットワーク」を提案する。この手法により、対称な状態-行動構成間で重みを共有することでデータ効率の高い方策学習が可能となり、同時に完全に分散型の実行を維持する。予備的実験および交通信号制御タスクにおいて、非等変性ベースラインを上回る性能を示した。

ABSTRACT

This paper introduces Multi-Agent MDP Homomorphic Networks, a class of networks that allows distributed execution using only local information, yet is able to share experience between global symmetries in the joint state-action space of cooperative multi-agent systems. In cooperative multi-agent systems, complex symmetries arise between different configurations of the agents and their local observations. For example, consider a group of agents navigating: rotating the state globally results in a permutation of the optimal joint policy. Existing work on symmetries in single agent reinforcement learning can only be generalized to the fully centralized setting, because such approaches rely on the global symmetry in the full state-action spaces, and these can result in correspondences across agents. To encode such symmetries while still allowing distributed execution we propose a factorization that decomposes global symmetries into local transformations. Our proposed factorization allows for distributing the computation that enforces global symmetries over local agents and local interactions. We introduce a multi-agent equivariant policy network based on this factorization. We show empirically on symmetric multi-agent problems that globally symmetric distributable policies improve data efficiency compared to non-equivariant baselines.

研究の動機と目的

  • 分散実行を維持しつつ、共同マルチエージェント強化学習におけるグローバル対称性を強制する課題に対処すること。
  • 中央集権的な計算を必要とせず、連合状態-行動空間における対称性を活用することで、データ効率の高い学習を可能にすること。
  • 回転などの複雑な非置換対称性を含む、マルチエージェントシステムへの単一エージェント等変性学習技術の拡張すること。
  • 各エージェントが独立に計算・強制できるように、グローバル対称性を局所的変換に分解する手法を開発すること。
  • グローバル等変性が対称なマルチエージェント環境におけるサンプル効率を向上させることを実証すること。

提案手法

  • 連合状態-行動空間におけるグローバル対称性を、個々のエージェントの観測および行動に作用する局所的変換に分解する。
  • エージェント間で対称性不変特徴を符号化するために、正則群表現(群チャネル)を用いたマルチエージェント等変性方策ネットワークを設計する。
  • 群畳み込みに類似した演算を用いて、対称な状態-行動ペア間で対称性を保つ重み共有を実行することで、等変性を強制する。
  • 中央集権的調整を回避するため、局所的通信と局所的計算を用いてグローバル対称性制約を強制する。
  • メッセージパッシングまたはグラフベースのアーキテクチャを用いて局所的情報を集約しつつ、グローバル対称性群における等変性を維持する。
  • 既知の対称性群(例:回転のためのディディラント群)を有する離散的行動、共同マルチエージェント環境にこのフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1分散実行を維持しつつ、共同マルチエージェントシステムにおけるグローバル対称性をデータ効率の高い学習に活用できるか?
  • RQ2単純な置換を超えたグローバル対称性は、分散型方策学習のためのエージェントレベルの局所的変換にどのように分解できるか?
  • RQ3グローバル等変性を強制することで、非等変性ベースラインと比較して、対称なマルチエージェント環境におけるサンプル効率が向上するか?
  • RQ4本手法は、非自明な対称性を有する交通信号制御のような複雑な協調問題に一般化可能か?
  • RQ5分散環境における収束速度および最終方策性能に、対称性強制が及ぼす影響は何か?

主な発見

  • 捕食者・獲物の変種において、本手法は非等変性ベースラインと比較して、はるかに少ない環境相互作用回数で効果的な連合方策を達成した。
  • 本手法は、対称なマルチエージェント協調タスクにおいてデータ効率が向上し、非等変性手法と比較してより速く効果的な方策を学習した。
  • 交通信号制御タスクでは、グローバル対称性の強制により、標準のMPNおよびデータ拡張ベースラインと比較して収束が速く、平均車両待機時間が短くなった。
  • 等変性方策ネットワークは、より少ない環境相互作用回数で優れた性能を達成しており、サンプル効率の向上が示された。
  • 高次元状態空間を有する複雑な協調問題でさえ、グローバル対称性の強制が学習ダイナミクスおよび最終方策品質を向上させた。
  • 本手法は、トロイおよび現実世界を模倣した対称的環境の両方において、非等変性分散ネットワークを上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。