Skip to main content
QUICK REVIEW

[论文解读] Coach-Player Multi-Agent Reinforcement Learning for Dynamic Team Composition

Бо Лю, Qiang Liu|arXiv (Cornell University)|May 18, 2021
Reinforcement Learning in Robotics参考文献 38被引用 6
一句话总结

本文提出COPA,一种教练-玩家多智能体强化学习框架,通过使用具备全局观测的集中式教练,利用注意力机制将策略向量分发给去中心化的玩家,从而实现对动态团队构成的零样本泛化。该方法在通信频率低至13%时仍表现出色,且优于所有智能体均具备完整观测的设置,证明了在异构、动态团队中采用自适应、低成本协调的有效性。

ABSTRACT

In real-world multi-agent systems, agents with different capabilities may join or leave without altering the team's overarching goals. Coordinating teams with such dynamic composition is challenging: the optimal team strategy varies with the composition. We propose COPA, a coach-player framework to tackle this problem. We assume the coach has a global view of the environment and coordinates the players, who only have partial views, by distributing individual strategies. Specifically, we 1) adopt the attention mechanism for both the coach and the players; 2) propose a variational objective to regularize learning; and 3) design an adaptive communication method to let the coach decide when to communicate with the players. We validate our methods on a resource collection task, a rescue game, and the StarCraft micromanagement tasks. We demonstrate zero-shot generalization to new team compositions. Our method achieves comparable or better performance than the setting where all players have a full view of the environment. Moreover, we see that the performance remains high even when the coach communicates as little as 13% of the time using the adaptive communication strategy.

研究动机与目标

  • 解决团队构成动态变化(团队规模和成员能力各异)的多智能体团队协调挑战。
  • 在不重新训练的情况下实现对未见团队构成的零样本泛化。
  • 通过集中式教练自适应地分发策略,降低通信开销,同时保持高性能。
  • 探究教练在玩家仅具备部分观测时对协调能力的提升作用。
  • 在资源收集、救援游戏及星际争霸微操任务等多种环境中验证该框架的有效性。

提出的方法

  • 教练利用环境的全局视图,通过注意力机制周期性地向玩家广播策略向量。
  • 玩家通过基于注意力的融合模块将最新策略向量融入其决策过程。
  • 引入变分目标以正则化策略向量的学习,提升策略稳定性和泛化能力。
  • 设计自适应通信策略,使教练能够自主决定何时以及与谁通信,从而减少不必要的传输。
  • 框架采用集中式训练、去中心化执行(CTDE)范式,但放宽了严格CTDE的限制,允许教练向玩家进行有限且有策略的信息共享。
  • 在训练过程中采样不同的团队构成,以模拟动态环境,从而实现在测试时对新团队构成的零样本泛化。

实验结果

研究问题

  • RQ1教练-玩家框架能否实现对训练期间未见过的新团队构成的零样本泛化?
  • RQ2教练的自适应通信如何影响性能与通信效率?
  • RQ3当玩家仅具备部分观测时,集中式教练是否相比完全可观测的玩家能显著提升协调能力?
  • RQ4在动态团队设置中,COPA相较于完全去中心化或完全可观测的基线方法表现如何?
  • RQ5在动态团队协调中,实现高性能所需的最低通信频率是多少?

主要发现

  • COPA在性能上达到或优于所有玩家均具备完整观测的设置,尽管COPA中的玩家仅拥有部分观测。
  • 在救援游戏环境中,具备完整观测的智能体表现反而不如具备部分观测的智能体,但引入教练后性能显著提升。
  • 通过自适应通信,COPA在通信频率低至13%(部分设置中为0.04)时仍能保持强劲性能,展现出极高的通信效率。
  • 在3-8sz和3-8MMM星际争霸微操任务中,COPA在通信频率为0.04时仍保持胜率超过10%,优于周期性通信的基线方法。
  • 消融实验表明,变分正则化与自适应通信策略对性能与泛化能力至关重要。
  • 该方法在所有三个基准环境中均能实现对新团队构成的零样本泛化,包括团队规模与智能体能力的变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。