Skip to main content
QUICK REVIEW

[论文解读] Learning Individually Inferred Communication for Multi-Agent Cooperation

Ziluo Ding, Tiejun Huang|arXiv (Cornell University)|Jun 11, 2020
Reinforcement Learning in Robotics参考文献 26被引用 19
一句话总结

本文提出了一种名为个体推理通信(I2C)的方法,用于多智能体强化学习,使智能体能够基于联合动作价值函数学习一对一通信的因果先验,从而在提升合作性能的同时减少通信开销。I2C在合作导航、猎物-捕食者和交通十字路口环境中均优于现有方法,通过因果影响学习确定通信对象,复杂交通场景下通信量最高减少37%。

ABSTRACT

Communication lays the foundation for human cooperation. It is also crucial for multi-agent cooperation. However, existing work focuses on broadcast communication, which is not only impractical but also leads to information redundancy that could even impair the learning process. To tackle these difficulties, we propose Individually Inferred Communication (I2C), a simple yet effective model to enable agents to learn a prior for agent-agent communication. The prior knowledge is learned via causal inference and realized by a feed-forward neural network that maps the agent's local observation to a belief about who to communicate with. The influence of one agent on another is inferred via the joint action-value function in multi-agent reinforcement learning and quantified to label the necessity of agent-agent communication. Furthermore, the agent policy is regularized to better exploit communicated messages. Empirically, we show that I2C can not only reduce communication overhead but also improve the performance in a variety of multi-agent cooperative scenarios, comparing to existing methods. The code is available at https://github.com/PKU-AI-Edge/I2C.

研究动机与目标

  • 为解决多智能体强化学习(MARL)中广播通信的低效与冗余问题。
  • 使智能体能够基于因果影响学习与谁通信,而非向所有智能体广播。
  • 在部分可观测、非平稳环境中,减少通信开销的同时提升合作性能。
  • 开发一种与现有CTDE框架兼容的通信控制机制。

提出的方法

  • I2C使用前馈神经网络将智能体的局部观测映射为关于应与哪些其他智能体通信的信念。
  • 通信先验通过联合动作价值函数进行因果推断学习,量化一个智能体的动作对另一个智能体策略的影响程度。
  • 利用因果效应对通信的必要性进行标注,从而实现通信先验的监督学习。
  • 引入相关性正则化项,以在接收到通信消息时改善策略学习。
  • I2C将通信限制在视野范围内的智能体之间,并支持一对一通信,而非所有智能体之间的广播。
  • I2C可作为通信控制模块与TarMAC等全通信方法集成,以降低通信开销。

实验结果

研究问题

  • RQ1能否利用智能体之间的因果影响,在MARL中学习到有意义的选择性一对一通信先验?
  • RQ2通过因果推断学习与谁通信,是否能在不牺牲性能的前提下减少通信开销?
  • RQ3I2C在合作多智能体任务中与全通信和无通信基线相比表现如何?
  • RQ4I2C能否作为现有全通信方法的有效通信控制机制?
  • RQ5相关性正则化是否能在智能体接收到通信消息时提升策略学习性能?

主要发现

  • 在交通十字路口的中等难度模式下,I2C+TarMAC实现了97.92%的成功率,优于TarMAC(97.60%),并显著超过无通信基线(79.19%)。
  • 在交通十字路口的高难度模式下,I2C+TarMAC达到92.17%的成功率——比TarMAC(89.24%)高出超过3%——而IC3Net和无通信基线分别仅达到40.47%和48.10%。
  • 与TarMAC相比,I2C在中等难度模式下通信开销减少了近34%,在高难度模式下减少了37%,证明了其有效的通信控制能力。
  • 消融实验确认,因果效应推断能准确捕捉通信的必要性,且相关性正则化提升了策略性能。
  • I2C在合作导航和猎物-捕食者环境中均优于通信与非通信基线,展现出跨任务的泛化能力。
  • 该方法与多种CTDE框架兼容,可作为插件用于现有全通信方法以减少通信开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。