Skip to main content
QUICK REVIEW

[论文解读] From Explicit Communication to Tacit Cooperation:A Novel Paradigm for Cooperative MARL

Dapeng Li, Zhiwei Xu|arXiv (Cornell University)|Apr 28, 2023
Distributed Control Multi-Agent Systems被引用 4
一句话总结

本文提出TACO,一种新颖的协作式多智能体强化学习范式,通过在训练过程中结合实时全局信息与轨迹重构的全局特征,实现从显式通信到隐性协作的渐进式过渡。通过逐步减少对显式通信的依赖,TACO在推理阶段完全去中心化且无需任何通信的情况下,性能仍可与基于通信的方法(如QMIX)相媲美或更优。

ABSTRACT

Centralized training with decentralized execution (CTDE) is a widely-used learning paradigm that has achieved significant success in complex tasks. However, partial observability issues and the absence of effectively shared signals between agents often limit its effectiveness in fostering cooperation. While communication can address this challenge, it simultaneously reduces the algorithm's practicality. Drawing inspiration from human team cooperative learning, we propose a novel paradigm that facilitates a gradual shift from explicit communication to tacit cooperation. In the initial training stage, we promote cooperation by sharing relevant information among agents and concurrently reconstructing this information using each agent's local trajectory. We then combine the explicitly communicated information with the reconstructed information to obtain mixed information. Throughout the training process, we progressively reduce the proportion of explicitly communicated information, facilitating a seamless transition to fully decentralized execution without communication. Experimental results in various scenarios demonstrate that the performance of our method without communication can approaches or even surpasses that of QMIX and communication-based methods.

研究动机与目标

  • 解决在部分可观察多智能体环境中,由于缺乏共享信号而阻碍协作的集中式训练与去中心化执行(CTDE)范式所面临的局限性。
  • 克服基于通信的多智能体强化学习方法因通信成本高和部署限制而带来的实际应用问题。
  • 通过从智能体本地轨迹重构全局信息,实现在去中心化执行下的有效协作。
  • 开发一种从显式通信平稳过渡到隐性协作的训练范式,最小化无通信推理过程中的性能下降。
  • 证明重构的全局信息可在无需实时通信的情况下有效支持协作。

提出的方法

  • 引入一种混合信息表示方法,结合显式通信的全局信息与各智能体本地轨迹重构的全局特征。
  • 在训练过程中使用注意力机制动态加权并融合重构的与真实的全局信息。
  • 通过衰减系数α逐步降低显式通信的贡献,实现向隐性协作的渐进式转变。
  • 使用混合损失函数进行策略训练,该损失函数结合基于值函数的学习(如QMIX)与重构损失,以提高基于轨迹的全局特征重构的准确性。
  • 利用t-SNE可视化验证,重构特征与真实全局特征的分布高度一致。
  • 将TACO框架应用于现有的CTDE算法(如VDN和QMIX),构建TACO-VDN与TACO-QMIX。

实验结果

研究问题

  • RQ1一种从显式通信向隐性协作过渡的训练范式,是否能在推理阶段完全无通信的情况下实现有效的多智能体协作?
  • RQ2智能体能否从自身本地轨迹中有效重构全局信息?该重构是否能支持有效的协作?
  • RQ3在训练过程中逐步减少通信是否能提升无通信执行的性能?
  • RQ4TACO是否能在复杂且部分可观察的环境中超越标准CTDE方法与基于通信的MARL算法?
  • RQ5哪些超参数(如注意力头维度、通信衰减率)对TACO框架的性能影响最大?

主要发现

  • TACO-VDN与TACO-QMIX在所有评估场景中均优于其基线模型(VDN与QMIX),包括GRF环境中的acade­my_counterattack_hard等高难度环境。
  • 在GRF环境中,TACO-QMIX的性能优于QMIX-Attention,表明基于重构的无通信执行可超越基于通信的方法。
  • t-SNE可视化显示,重构的全局特征与真实全局特征的分布高度接近,表明重构具有语义意义且信息丰富。
  • 消融实验表明,通信的渐进衰减(α)优于立即完全通信(TACO-Leap),凸显了渐进过渡的重要性。
  • 较低的注意力头维度与适中的β值可实现最优性能,表明针对轨迹的全局特征学习中,更简单的重构头更为有效。
  • 该方法在无通信执行中达到最先进性能,在复杂任务中与QMIX-Attention等基于通信的方法相比表现相当或更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。