Skip to main content
QUICK REVIEW

[論文レビュー] Coach-Player Multi-Agent Reinforcement Learning for Dynamic Team Composition

Бо Лю, Qiang Liu|arXiv (Cornell University)|May 18, 2021
Reinforcement Learning in Robotics参考文献 38被引用数 6
ひとこと要約

本論文は、集中型のコーチが全環境観測を用いて注目メカニズムを介して分散型のプレイヤーに戦略ベクトルを配布することで、動的で変化するチーム編成に対してもゼロショット一般化を可能にする、COPAと呼ばれるコーチ・プレイヤー型マルチエージェント強化学習フレームワークを提案する。この手法は通信頻度がたったの13%でさえも強く性能を発揮し、全エージェントが完全な観測を持つ設定を上回る結果を示しており、異種かつ動的チームにおける適応的で低コストな協調の有効性を実証している。

ABSTRACT

In real-world multi-agent systems, agents with different capabilities may join or leave without altering the team's overarching goals. Coordinating teams with such dynamic composition is challenging: the optimal team strategy varies with the composition. We propose COPA, a coach-player framework to tackle this problem. We assume the coach has a global view of the environment and coordinates the players, who only have partial views, by distributing individual strategies. Specifically, we 1) adopt the attention mechanism for both the coach and the players; 2) propose a variational objective to regularize learning; and 3) design an adaptive communication method to let the coach decide when to communicate with the players. We validate our methods on a resource collection task, a rescue game, and the StarCraft micromanagement tasks. We demonstrate zero-shot generalization to new team compositions. Our method achieves comparable or better performance than the setting where all players have a full view of the environment. Moreover, we see that the performance remains high even when the coach communicates as little as 13% of the time using the adaptive communication strategy.

研究の動機と目的

  • チーム編成が変化する動的環境において、チームの構成やメンバーの能力が変動する状況でのマルチエージェントチームの協調を解決すること。
  • 再訓練なしにトレーニング時に見られなかったチーム編成に対してもゼロショット一般化を可能にすること。
  • 集中型コーチからの適応的で戦略的な戦略配布により、通信負荷を低減しながら高い性能を維持すること。
  • プレイヤーが部分的観測しか持たない状況において、コーチの役割が協調性をどのように向上させるかを調査すること。
  • リソース収集、救助ゲーム、StarCraftのミクロマネジメントタスクを含む多様な環境でフレームワークを検証すること。

提案手法

  • コーチは環境の全観測を用いて、注目メカニズムを用いて定期的にプレイヤーに戦略ベクトルをブロードキャストする。
  • プレイヤーは注目ベースの統合モジュールを介して、最新の戦略ベクトルを意思決定に統合する。
  • 戦略ベクトルの学習を正則化するための変分的目的関数が導入され、ポリシーの安定性と一般化性能が向上する。
  • コーチがいつ、どのプレイヤーと通信するかを決定する適応的通信ポリシーが設計され、不要な送信を削減する。
  • 集中型トレーニングと分散型実行(CTDE)を採用するが、コーチからプレイヤーへの制限付きで戦略的な情報共有を許容することで、厳密なCTDEを緩和する。
  • トレーニング中にチーム編成をサンプリングすることで動的環境をシミュレートし、テスト時に新しい編成に対してもゼロショット一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1コーチ・プレイヤー枠組みは、トレーニング時に見られなかった新しいチーム編成に対してもゼロショット一般化を達成できるか?
  • RQ2コーチからの適応的通信が性能と通信効率にどのように影響するか?
  • RQ3プレイヤーが部分的観測しか持たない状況において、全観測可能なプレイヤーと比較して集中型コーチが協調性をどのように向上させるか?
  • RQ4動的チーム設定において、COPAは完全分散型または完全観測型のベースラインと比較してどのように性能を発揮するか?
  • RQ5動的チーム協調において、強力な性能を発揮するために必要な最小通信頻度は何か?

主な発見

  • COPAのプレイヤーは部分的観測しか持たないが、全観測を持つ設定と同等またはそれ以上の性能を達成する。
  • 救助ゲーム環境では、全観測を持つエージェントは部分的観測を持つエージェントよりも性能が劣るが、コーチが導入されると著しく性能が向上する。
  • 適応的通信により、通信頻度がたった13%(一部の設定では0.04)でもCOPAは強力な性能を維持し、高い通信効率を示す。
  • 3-8szおよび3-8MMM StarCraftミクロマネジメントタスクにおいて、COPAは通信頻度が0.04であっても10%以上の勝率を維持し、周期的通信ベースラインを上回る。
  • アブレーションスタディの結果、変分的正則化と適応的通信戦略が性能と一般化性能の向上に不可欠であることが示された。
  • 本手法は、3つのベンチマーク環境すべてにおいて、チーム編成の変更(チームサイズの変化やエージェント能力の違いを含む)に対してもゼロショット一般化を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。