Skip to main content
QUICK REVIEW

[論文レビュー] Heterogeneous Multi-agent Zero-Shot Coordination by Coevolution

Ke Xue, Yutong Wang|arXiv (Cornell University)|Aug 9, 2022
Opinion Dynamics and Social Influence被引用数 6
ひとこと要約

本稿では、異なるエージェントとパートナーの集団をペアリング、更新、選択を通じて共進化させることで、異種マルチエージェントゼロショット協調(ZSC)を実現する共進化ベースのフレームワークMAZEを提案する。本手法は、自発的対戦(self-play)および集団ベースの手法とは異なり、異種性を明示的にモデル化することで、多様な環境において未観測のパートナーと優れた協調を達成し、それらを上回る性能を発揮する。

ABSTRACT

Generating agents that can achieve zero-shot coordination (ZSC) with unseen partners is a new challenge in cooperative multi-agent reinforcement learning (MARL). Recently, some studies have made progress in ZSC by exposing the agents to diverse partners during the training process. They usually involve self-play when training the partners, implicitly assuming that the tasks are homogeneous. However, many real-world tasks are heterogeneous, and hence previous methods may be inefficient. In this paper, we study the heterogeneous ZSC problem for the first time and propose a general method based on coevolution, which coevolves two populations of agents and partners through three sub-processes: pairing, updating and selection. Experimental results on various heterogeneous tasks highlight the necessity of considering the heterogeneous setting and demonstrate that our proposed method is a promising solution for heterogeneous ZSC tasks.

研究の動機と目的

  • 協調的マルチエージェント強化学習(MARL)における、未観測で異種のヒューマンパートナーとゼロショット協調(ZSC)を達成する課題に対処すること。
  • エージェントとパートナーがスキルや能力において異なる異種環境において、従来の自発的対戦および集団ベースの手法に見られる限界を示すこと。
  • エージェントとパートナーのための別個の集団を維持することで、ZSC性能を向上させる、新たな共進化フレームワークMAZEを提案すること。
  • Overcookedおよびカスタムグリッドワールド環境を含む、複数の異種環境においてMAZEの有効性を検証すること。

提案手法

  • MAZEは、エージェント用とパートナー用の2つの異なる集団を共進化させ、自発的対戦における同種性の仮定を避ける。
  • フレームワークは3つのサブプロセスで構成される:環境内でエージェントとパートナーをペアリングし、共有報酬と多様性の重み付き和を用いてポリシーを更新し、優れた個体を選択する。
  • 多様性は、選択段階で過去のパートナーのアーカイブから多様なパートナーをサンプリングすることで向上する。
  • グローバル報酬の最大化とパートナーマルチプレックスのバランスを取るために重み付き損失関数を用い、未観測のパートナーへの一般化を向上させる。
  • 自発的対戦とは異なり、エージェントとパートナーが同一のポリシーであることを仮定しない、明示的な選択およびペアリングメカニズムを備えた集団ベースのトレーニング方式を採用する。
  • フレームワークはOvercookedおよびカスタムFillInTheGrid環境で評価され、各構成要素の寄与度を検証するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1RQ1: ヒューマンデータを含まない簡素化された二集団アプローチが、異種ZSCタスクにおいて自発的対戦および集団対戦を上回るか?
  • RQ2RQ2: 異種環境において、MAZEは最近の最先端手法と比較してZSC性能で優れているか?
  • RQ3RQ3: MAZEの各構成要素(例:多様性アーカイブ、選択メカニズム)が全体の性能に果たす寄与度は何か?
  • RQ4RQ4: MAZEのエージェントは、実際のヒューマン参加者とゼロショット環境で効果的に協調できるか?

主な発見

  • MAZEは、自発的対戦および集団対戦と比較して、異種ZSCタスクにおいて顕著に優れた性能を発揮し、異種性を明示的にモデル化する必要性を示している。
  • OvercookedのAAレイアウトでは、より大きなネットワークと多数のトレーニング世代を用いても、MAZEはSPおよびPPを上回る最終的なパフォーマンスを達成している。
  • t-SNEによる可視化では、MAZEが生成するパートナーの多様性が最も顕著で、埋め込み空間の異なる領域に広がっている。
  • MAZEのパートナーマルチプレックスメカニズムにより、未観測のパートナーとの協調性が向上し、一般化性能が向上していることが裏付けられている。
  • MAZEは他のZSC手法と同等のウォールクロック時間を維持しており、トラジェクトリ収集と更新が主な時間消費要因である。
  • 同種環境ではMAZEはSPおよびPPと同等の性能を示すが、異種バージョンでは明確な優位性を示しており、異種環境における利点が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。