Skip to main content
QUICK REVIEW

[论文解读] Effective and Stable Role-Based Multi-Agent Collaboration by Structural Information Principles

Xianghua Zeng, Hao Peng|arXiv (Cornell University)|Apr 3, 2023
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出SIRD,一种基于结构信息原理的角色发现方法,通过一维和K维结构熵最小化,将角色发现转化为层次化动作空间聚类。集成至SR-MARL后,其在具有挑战性的StarCraft II微操控任务中实现了最先进性能,胜率最高提升6.08%,方差降低66.30%,实现了无需手动超参数调优的稳定、高效且与算法无关的多智能体协作。

ABSTRACT

Role-based learning is a promising approach to improving the performance of Multi-Agent Reinforcement Learning (MARL). Nevertheless, without manual assistance, current role-based methods cannot guarantee stably discovering a set of roles to effectively decompose a complex task, as they assume either a predefined role structure or practical experience for selecting hyperparameters. In this article, we propose a mathematical Structural Information principles-based Role Discovery method, namely SIRD, and then present a SIRD optimizing MARL framework, namely SR-MARL, for multi-agent collaboration. The SIRD transforms role discovery into a hierarchical action space clustering. Specifically, the SIRD consists of structuralization, sparsification, and optimization modules, where an optimal encoding tree is generated to perform abstracting to discover roles. The SIRD is agnostic to specific MARL algorithms and flexibly integrated with various value function factorization approaches. Empirical evaluations on the StarCraft II micromanagement benchmark demonstrate that, compared with state-of-the-art MARL algorithms, the SR-MARL framework improves the average test win rate by 0.17%, 6.08%, and 3.24%, and reduces the deviation by 16.67%, 30.80%, and 66.30%, under easy, hard, and super hard scenarios.

研究动机与目标

  • 解决现有基于角色的多智能体强化学习(MARL)方法在依赖人工超参数调优或预设角色时存在的不稳定与低效问题。
  • 开发一种无需子任务或角色分配先验知识的自监督、自动角色发现机制。
  • 提升在具有大联合状态-动作空间的协作性、部分可观测环境中的MARL有效性与稳定性。
  • 实现与各种值函数分解方法的无缝集成,且无需修改底层MARL算法。

提出的方法

  • SIRD方法构建一个加权、无向且完全的行动图,其中顶点代表动作,边权重反映对团队目标的功能相关性。
  • 应用一维结构熵最小化以稀疏化行动图,生成捕捉层次化动作关系的初始编码树。
  • 在稀疏图上进一步最小化K维结构熵,以获得用于层次化动作空间聚类的最优编码树。
  • 通过在最优编码树上执行层次化抽象,实现角色发现,将平坦聚类转化为结构化角色分解。
  • SR-MARL框架将SIRD与QMIX和QPLEX等值函数分解方法结合,用SIRD引导的角色抽象替代原有的混合网络。
  • 该框架与具体MARL算法无关,可灵活扩展至其他值分解架构。

实验结果

研究问题

  • RQ1能否利用结构信息原理,在无需人工超参数调优的情况下,实现自动、稳定且有效的协作式MARL角色发现?
  • RQ2与平坦聚类相比,通过编码树实现的层次化动作空间聚类在角色发现质量与学习稳定性方面表现如何?
  • RQ3SIRD在不同任务难度水平下,对现有MARL算法的性能与鲁棒性提升程度如何?
  • RQ4将SIRD与值函数分解方法结合,是否能持续提升胜率与训练稳定性?

主要发现

  • 在StarCraft II微操控行为基准测试中,SR-MARL在简单、困难和超难地图上分别相对于最先进基线模型,平均测试胜率提升0.17%、6.08%和3.24%。
  • SR-MARL在简单、困难和超难地图上分别将测试胜率的方差降低了16.67%、30.80%和66.30%,表明训练稳定性显著提升。
  • 消融实验表明,结构化与稀疏化均不可或缺:移除结构化(ST-MARL)或稀疏化(SP-MARL)均导致性能显著下降。
  • SR-MARL-3(最大树高为3)在超难地图MMM2上的表现优于SR-MARL-2(树高为2),表明更深层次的层次结构对复杂任务更有利。
  • 当与QMIX和QPLEX集成时,该框架均实现一致的性能提升,证明其在不同值函数分解方法上的兼容性与有效性。
  • SIRD方法完全与MARL算法无关,可无需修改架构地灵活嵌入各类值分解架构中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。