[论文解读] PMIC: Improving Multi-Agent Reinforcement Learning with Progressive Mutual Information Collaboration
本文提出PMIC,一种新颖的多智能体强化学习框架,通过逐步最大化全局状态与联合动作之间的互信息(MI),提升高质量协作的效率,同时最小化低质量协作的MI,从而实现更优的协作效果。通过采用双阶段渐进协作缓冲器(Dual Progressive Collaboration Buffer)与双互信息估计器(Dual Mutual Information Estimator),PMIC加速了学习过程,在多种多智能体强化学习基准测试中展现出更优的样本效率与性能表现。
Learning to collaborate is critical in Multi-Agent Reinforcement Learning (MARL). Previous works promote collaboration by maximizing the correlation of agents' behaviors, which is typically characterized by Mutual Information (MI) in different forms. However, we reveal sub-optimal collaborative behaviors also emerge with strong correlations, and simply maximizing the MI can, surprisingly, hinder the learning towards better collaboration. To address this issue, we propose a novel MARL framework, called Progressive Mutual Information Collaboration (PMIC), for more effective MI-driven collaboration. PMIC uses a new collaboration criterion measured by the MI between global states and joint actions. Based on this criterion, the key idea of PMIC is maximizing the MI associated with superior collaborative behaviors and minimizing the MI associated with inferior ones. The two MI objectives play complementary roles by facilitating better collaborations while avoiding falling into sub-optimal ones. Experiments on a wide range of MARL benchmarks show the superior performance of PMIC compared with other algorithms.
研究动机与目标
- 解决现有基于互信息的多智能体强化学习方法存在的局限性,即仅最大化相关性而无法区分高质量与低质量协作。
- 提出一种基于全局状态与联合动作之间互信息的新协作准则,为有效协作提供更优引导。
- 设计一种渐进式学习机制,通过双互信息估计,同时促进高质量协作并避免低质量协作。
- 开发一种可泛化的框架,兼容现有基于CTDE的多智能体强化学习算法,如MADDPG、MASAC与RODE。
提出的方法
- 引入一种新的协作准则,通过全局状态与联合动作之间的互信息(MI)进行度量,取代对额外全局输入的依赖。
- 设计双阶段渐进协作缓冲器(Du-PCB),分别维护高质量与低质量协作轨迹的正样本与负样本缓冲区。
- 实现双互信息估计器(Du-MIE),包含两个神经网络MI估计器:一个在负样本缓冲区最小化MI(上界估计),另一个在正样本缓冲区最大化MI(下界估计)。
- 使用CLUB与MINE训练MI估计器,分别提供MI的下界与上界,实现协作质量的渐进式优化。
- 通过添加Du-PCB与Du-MIE组件,将PMIC集成至现有MARL算法中,支持端到端训练与标准强化学习目标。
- 引入超参数α与β以平衡MI最大化与最小化的影响力,实现自适应的学习动态。
实验结果
研究问题
- RQ1仅通过最大化智能体行为之间的互信息,是否会导致次优协作?这种机制是否会阻碍学习过程?
- RQ2通过互信息估计区分高质量与低质量协作,是否能提升多智能体强化学习中的学习效率与性能表现?
- RQ3一种渐进式互信息估计框架,能够同时对优质行为最大化MI、对劣质行为最小化MI,是否可实现更快收敛与更优最终性能?
- RQ4当与MADDPG、MASAC等现有MARL算法结合时,PMIC在多样化环境中的有效性如何?
主要发现
- PMIC在多种具有离散与连续动作空间的合作环境中,显著加速学习过程,并在性能上优于基线多智能体强化学习算法。
- 在Wildlife Rescue环境中的实验表明,对次优行为最小化MI有助于跳出局部最优,使在200万时间步后获得更高的累积奖励。
- 消融实验表明,双阶段渐进协作缓冲器(Du-PCB)至关重要,若替换为标准回放缓冲区,性能将下降,原因在于缺乏对行为质量的区分能力。
- 参数分析显示,α与β对性能有显著影响,最优值取决于环境的协作结构特征——例如,在存在多种次优协作类型的环境中,应采用更高的β值。
- 所提出的全局状态与联合动作之间互信息度量方法,在引导有效协作方面优于其他替代性MI指标。
- PMIC具备良好泛化能力,可有效提升MADDPG、MASAC与RODE等多种多智能体强化学习算法的性能,证明其兼容性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。