Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Actor-Critic with Hierarchical Graph Attention Network

Heechang Ryu, Hayong Shin|arXiv (Cornell University)|Sep 27, 2019
Reinforcement Learning in Robotics参考文献 31被引用 9
一句话总结

本文提出HAMA,一种多智能体强化学习框架,结合分层图注意力网络(HGAT)与多智能体演员-critic学习,以在合作-竞争环境中建模智能体间及组间的关系。通过利用智能体间与组间注意力机制,HAMA实现了更具策略性、可解释性及可迁移性的策略,在混合合作-竞争任务中表现优于现有方法,并在新智能体组合上展现出强大的零样本迁移能力。

ABSTRACT

Most previous studies on multi-agent reinforcement learning focus on deriving decentralized and cooperative policies to maximize a common reward and rarely consider the transferability of trained policies to new tasks. This prevents such policies from being applied to more complex multi-agent tasks. To resolve these limitations, we propose a model that conducts both representation learning for multiple agents using hierarchical graph attention network and policy learning using multi-agent actor-critic. The hierarchical graph attention network is specially designed to model the hierarchical relationships among multiple agents that either cooperate or compete with each other to derive more advanced strategic policies. Two attention networks, the inter-agent and inter-group attention layers, are used to effectively model individual and group level interactions, respectively. The two attention networks have been proven to facilitate the transfer of learned policies to new tasks with different agent compositions and allow one to interpret the learned strategies. Empirically, we demonstrate that the proposed model outperforms existing methods in several mixed cooperative and competitive tasks.

研究动机与目标

  • 解决现有多智能体强化学习(MARL)方法在复杂、异构环境中可迁移性与可扩展性有限的问题。
  • 使用结构化的图注意力机制,对智能体之间的层级关系——包括组内与组间关系——进行建模。
  • 实现去中心化的策略,使其能够根据动态状态依赖关系自适应地在合作与竞争之间切换。
  • 通过分析组内与组间交互的注意力权重,提升策略的可解释性。
  • 展示在不同智能体数量与组合的新任务中,对已训练策略的零样本迁移能力。

提出的方法

  • HAMA采用分层图注意力网络(HGAT),通过独立的智能体间与组间注意力层,在个体与组的层次上对智能体进行建模。
  • 智能体间注意力层计算同一组内个体智能体之间的注意力权重,以捕捉合作动力学。
  • 组间注意力层计算组与组之间的注意力,以建模跨组的竞争或战略性协调。
  • HGAT将每个智能体的局部观测转化为上下文相关的、信息浓缩的嵌入向量,用于策略学习。
  • 该模型采用集中训练、去中心化执行(CTDE)框架,使用嵌入表示对个体评论家与演员进行训练。
  • 该架构支持表示与策略的端到端学习,注意力权重为战略决策的可解释性提供支持。

实验结果

研究问题

  • RQ1分层图注意力机制是否能提升在混合合作-竞争多智能体环境中的策略性能?
  • RQ2智能体间与组间注意力的结合是否能增强策略的适应性与可迁移性?
  • RQ3在小规模多智能体任务上训练的策略,在不同智能体组合的大规模任务中可迁移的程度如何?
  • RQ4HGAT模型中的注意力权重是否可用于解释与说明智能体的决策过程?
  • RQ5与平面或单层图结构相比,分层图结构在建模多智能体交互方面表现如何?

主要发现

  • HAMA在四种不同的合作-竞争游戏场景中均优于现有MARL方法,包括MADDPG、COMA与MAAC。
  • 消融实验表明,包含分层图与双注意力机制的完整HAMA模型(HG-IAGA)性能最高,优于SG-IAA与HG-NA等变体。
  • 当在3对3捕食者-猎物游戏中训练的策略被迁移至m对n配置时,当m > n时,捕食者的成功率接近1.0,表明其具备强大的零样本迁移能力。
  • 智能体间注意力权重显示,当智能体协同行动以围堵猎物时,其合作程度提高(如捕食者之间相互关注);而组间注意力则显示出对敌对组的竞争意图。
  • 在“强者为王”游戏中,组的大小决定捕获能力,HAMA成功学习到协调较大捕食者组以捕获聚集猎物,优于基线模型。
  • 注意力可视化证实,该模型基于动态注意力模式学习到了有意义且可解释的策略,如协同追捕或竞争性目标锁定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。