Skip to main content
QUICK REVIEW

[论文解读] Heterogeneous Multi-agent Zero-Shot Coordination by Coevolution

Ke Xue, Yutong Wang|arXiv (Cornell University)|Aug 9, 2022
Opinion Dynamics and Social Influence被引用 6
一句话总结

本文提出 MAZE,一种基于共同进化的异构多智能体零样本协调(ZSC)框架,通过配对、更新和选择机制共同进化不同群体的智能体与伙伴。该方法通过显式建模异质性,在零样本协调任务中优于自对弈和基于种群的方法,在多种环境中实现了与未见过的伙伴更优的协调表现。

ABSTRACT

Generating agents that can achieve zero-shot coordination (ZSC) with unseen partners is a new challenge in cooperative multi-agent reinforcement learning (MARL). Recently, some studies have made progress in ZSC by exposing the agents to diverse partners during the training process. They usually involve self-play when training the partners, implicitly assuming that the tasks are homogeneous. However, many real-world tasks are heterogeneous, and hence previous methods may be inefficient. In this paper, we study the heterogeneous ZSC problem for the first time and propose a general method based on coevolution, which coevolves two populations of agents and partners through three sub-processes: pairing, updating and selection. Experimental results on various heterogeneous tasks highlight the necessity of considering the heterogeneous setting and demonstrate that our proposed method is a promising solution for heterogeneous ZSC tasks.

研究动机与目标

  • 为解决在合作式多智能体强化学习(MARL)中与未见过的异质人类伙伴进行零样本协调(ZSC)的挑战。
  • 展示现有自对弈和基于种群的方法在异质设置下的局限性,其中智能体与伙伴在技能或能力上存在差异。
  • 提出一种新颖的共同进化框架 MAZE,通过为智能体和伙伴维护独立的种群以提升 ZSC 性能。
  • 在包括 Overcooked 和自定义网格世界环境在内的多个异质环境中验证 MAZE 的有效性。

提出的方法

  • MAZE 共同进化两个不同的种群:一个用于智能体,一个用于伙伴,避免了自对弈中同质性的假设。
  • 该框架通过三个子过程运行:在环境中配对智能体与伙伴,通过共享奖励与多样性的加权和更新策略,以及选择表现优异的个体。
  • 通过维护一个过去伙伴的档案,从该档案中采样多样化的伙伴以增强多样性。
  • 使用加权损失函数平衡全局奖励最大化与伙伴多样性,以提升对未见过伙伴的泛化能力。
  • 该方法采用基于种群的训练方案,具有显式的筛选与配对机制,与自对弈中智能体与伙伴为同一策略的方法不同。
  • 该框架在 Overcooked 和自定义 FillInTheGrid 环境上进行评估,并对各组件的贡献进行了消融研究。

实验结果

研究问题

  • RQ1RQ1:在不使用人类数据的情况下,简化的双种群方法是否在异质 ZSC 任务中优于自对弈和种群对弈?
  • RQ2RQ2:在异质环境中,MAZE 与近期最先进方法相比,其 ZSC 性能如何?
  • RQ3RQ3:MAZE 的各组件(如多样性档案、筛选机制)对整体性能的贡献如何?
  • RQ4RQ4:MAZE 智能体是否能在零样本设置下成功与真实人类参与者协调?

主要发现

  • MAZE 在异质 ZSC 任务中显著优于自对弈和种群对弈,证明了显式建模异质性的必要性。
  • 在 Overcooked AA 布局中,即使使用更大的网络和更多的训练代次,MAZE 的最终性能仍优于 SP 和 PP。
  • 通过 t-SNE 可视化显示,MAZE 生成的伙伴多样性最为广泛,其伙伴在嵌入空间中分布于不同的区域。
  • MAZE 中的伙伴多样性机制带来了更好的泛化能力,表现为与未见过伙伴的协调性能提升。
  • MAZE 的实际运行时间与其他 ZSC 方法相当,轨迹收集与更新是主要耗时组件。
  • 在同质环境中,MAZE 的表现与 SP 和 PP 相当;但在异质变体环境中,其表现明显更优,证实了其在异质设置中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。