Skip to main content
QUICK REVIEW

[论文解读] A Maximum Mutual Information Framework for Multi-Agent Reinforcement Learning

Woojun Kim, Whiyoung Jung|arXiv (Cornell University)|Jun 4, 2020
Reinforcement Learning in Robotics参考文献 29被引用 6
一句话总结

该论文提出了一种用于多智能体强化学习(MARL)的最大互信息(MMI)框架,通过用智能体动作之间的互信息正则化累积回报,增强了协调行为。利用潜在变量和变分推断,该方法推导出政策优化的可处理下界,从而提出VM3-AC算法,在多步行者和捕食者-猎物等高协调需求的任务中,优于MADDPG、I-SAC和MA-SAC。

ABSTRACT

In this paper, we propose a maximum mutual information (MMI) framework for multi-agent reinforcement learning (MARL) to enable multiple agents to learn coordinated behaviors by regularizing the accumulated return with the mutual information between actions. By introducing a latent variable to induce nonzero mutual information between actions and applying a variational bound, we derive a tractable lower bound on the considered MMI-regularized objective function. Applying policy iteration to maximize the derived lower bound, we propose a practical algorithm named variational maximum mutual information multi-agent actor-critic (VM3-AC), which follows centralized learning with decentralized execution (CTDE). We evaluated VM3-AC for several games requiring coordination, and numerical results show that VM3-AC outperforms MADDPG and other MARL algorithms in multi-agent tasks requiring coordination.

研究动机与目标

  • 解决在执行过程中缺乏显式通信或依赖的情况下,学习多智能体强化学习(MARL)中协调行为的挑战。
  • 克服独立学习和因子化策略在合作型MARL中阻碍协调的局限性。
  • 开发一种可处理且可扩展的框架,通过互信息正则化隐式促进协调行为。
  • 将互信息正则化整合到集中训练与去中心化执行(CTDE)范式下的策略优化过程中。

提出的方法

  • 引入潜在变量以在智能体动作之间诱导非零互信息,实现在无显式通信情况下的协调行为。
  • 应用变分下界,使在条件分布难以处理的情况下,互信息正则化仍具可处理性。
  • 推导出MMI正则化目标函数的下界,该函数结合了累积回报与动作之间的互信息。
  • 使用策略迭代最大化推导出的下界,从而得到变分最大互信息多智能体演员-critic(VM3-AC)算法。
  • 采用集中训练与去中心化执行(CTDE)机制,使智能体在训练期间可访问完整信息,而在部署时基于局部观测进行决策。
  • 将互信息正则化与熵正则化及集中式critic结合,以增强探索与协调能力。

实验结果

研究问题

  • RQ1能否有效利用智能体动作之间的互信息来提升多智能体强化学习中的协调性能?
  • RQ2在无显式通信且策略去中心化的MARL中,如何使互信息正则化具有可处理性?
  • RQ3在协调需求高的MARL任务中,将互信息引入目标函数是否能带来优于现有方法的性能提升?
  • RQ4潜在变量与温度超参数对所学策略的协调性与性能有何影响?

主要发现

  • 在多步行者、捕食者-猎物及合作导航等多个高协调需求环境中,VM3-AC在性能上优于MADDPG、I-SAC、MA-AC与MA-SAC。
  • 在包含N=4个智能体的多步行者环境中,VM3-AC实现了显著的性能提升,证明其在高协调场景中的有效性。
  • 消融实验表明,潜在变量对协调至关重要,移除后在N=3与N=4的多步行者设置中性能均下降。
  • 温度参数β控制着奖励与互信息之间的权衡,最优性能出现在β ≈ 0.05–0.1之间。
  • 在所评估环境中,VM3-AC显著优于最先进方法MAVEN,如附录结果所示。
  • 互信息正则化与熵正则化的结合优于单一正则化,表明二者具有协同增益效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。