Skip to main content
QUICK REVIEW

[论文解读] Heterogeneous Graph Attention Networks for Learning Diverse Communication

Esmaeil Seraj, Zheyuan Wang|arXiv (Cornell University)|Aug 21, 2021
Advanced Graph Neural Networks参考文献 43被引用 4
一句话总结

该论文提出HetNet,一种异构图注意力网络,通过新颖的多智能体异构演员-critic(MAHAC)框架,为具有不同能力的多智能体团队学习多样化且高效的通信协议。通过基于GNN的消息翻译实现跨类通信,该方法在异构环境中相比基线模型实现了约10%的性能提升。

ABSTRACT

Multi-agent teaming achieves better performance when there is communication among participating agents allowing them to coordinate their actions for maximizing shared utility. However, when collaborating a team of agents with different action and observation spaces, information sharing is not straightforward and requires customized communication protocols, depending on sender and receiver types. Without properly modeling such heterogeneity in agents, communication becomes less helpful and could even deteriorate the multi-agent cooperation performance. We propose heterogeneous graph attention networks, called HetNet, to learn efficient and diverse communication models for coordinating heterogeneous agents towards accomplishing tasks that are of collaborative nature. We propose a Multi-Agent Heterogeneous Actor-Critic (MAHAC) learning paradigm to obtain collaborative per-class policies and effective communication protocols for composite robot teams. Our proposed framework is evaluated against multiple baselines in a complex environment in which agents of different types must communicate and cooperate to satisfy the objectives. Experimental results show that HetNet outperforms the baselines in learning sophisticated multi-agent communication protocols by achieving $\sim$10\% improvements in performance metrics.

研究动机与目标

  • 解决异构多智能体团队中因智能体具有不同的动作、观测和传感器能力而导致的通信效率低下问题。
  • 开发一种可扩展的、端到端的通信学习框架,同时考虑状态空间和动作空间中的智能体异质性。
  • 设计一种通信协议,使不同类型智能体能够交换有意义且与任务相关的资讯,即使它们的“语言”不同。
  • 在新的多智能体异构部分可观察马尔可夫决策过程(MAH-POMDP)环境中评估该框架,以捕捉现实世界中团队构成的多样性。
  • 证明在通信中建模异质性可提升协调性与性能,优于标准的多智能体强化学习(MARL)基线方法。

提出的方法

  • 提出一种新问题形式化:多智能体异构部分可观察马尔可夫决策过程(MAH-POMDP),用于建模具有异构智能体的协作任务。
  • 引入HetNet,一种异构图注意力网络,通过将智能体类型和角色编码为消息嵌入,学习跨类消息表示。
  • 采用集中式训练、分布式执行(CTDE)范式,实现策略与通信协议的端到端训练。
  • 在MAHAC算法中采用每类独立评论家结构,以支持按类别学习策略,并改善异构团队中的信用分配。
  • 设计一种长度有限、实值的通信通道,利用GNN将不同智能体类别的消息翻译为共享表示。
  • 应用消息传递机制,使每个智能体能够关注来自其他类别的相关信息,实现风格化、角色感知的通信。

实验结果

研究问题

  • RQ1能否学习到一种通信协议,有效协调具有不同动作空间和观测空间的异构智能体?
  • RQ2与同质或非异质基线相比,建模通信中的智能体异质性如何提升多智能体协调性能?
  • RQ3不同评论家架构(集中式、每类、每智能体)对异构MARL中学习效率与性能的影响如何?
  • RQ4所提出的框架能否在保持优异性能的前提下,泛化至同质与异质环境?
  • RQ5图注意力机制如何增强智能体间通信的信息相关性与多样性?

主要发现

  • HetNet在同质与异质环境中,相较于SOTA基线(如CommNet与IC3Net),性能指标均实现约10%的提升。
  • MAHAC中采用的每类评论家结构相比完全集中式评论家,提升了学习效率与性能,平均将任务完成步数从10.01减少至9.81。
  • HetNet采用每类与每智能体评论家时性能相近,且均优于集中式评论家变体,表明按类别信用分配可增强学习效果。
  • 消融实验确认,建模通信中的异质性至关重要——若不建模,通信反而会降低性能。
  • 该框架泛化能力良好,在采用的同质环境(猎物-捕食者)与新型异质环境(捕食者-捕获-猎物)中均表现出色。
  • 基于GNN的消息翻译机制使智能体能够“使用”一种共享语言,成功消除了异构智能体之间的语言障碍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。