Skip to main content
QUICK REVIEW

[论文解读] Cooperative Multi-Agent Transfer Learning with Level-Adaptive Credit Assignment

Tianze Zhou, Fubiao Zhang|arXiv (Cornell University)|Jun 1, 2021
Reinforcement Learning in Robotics参考文献 33被引用 10
一句话总结

本文提出了一种新型协作多智能体强化学习框架,通过层级自适应Transformer架构和专用混合网络(LA-QTransformer),实现了协调知识的鲁棒迁移。通过将多智能体协调分解为自适应的、智能体特定的模式,并采用群体不变的智能体设计(PIT),该方法在StarCraft II微操控行为任务中实现了最先进性能,在迁移与非迁移场景下均优于现有基线方法。

ABSTRACT

Extending transfer learning to cooperative multi-agent reinforcement learning (MARL) has recently received much attention. In contrast to the single-agent setting, the coordination indispensable in cooperative MARL constrains each agent's policy. However, existing transfer methods focus exclusively on agent policy and ignores coordination knowledge. We propose a new architecture that realizes robust coordination knowledge transfer through appropriate decomposition of the overall coordination into several coordination patterns. We use a novel mixing network named level-adaptive QTransformer (LA-QTransformer) to realize agent coordination that considers credit assignment, with appropriate coordination patterns for different agents realized by a novel level-adaptive Transformer (LA-Transformer) dedicated to the transfer of coordination knowledge. In addition, we use a novel agent network named Population Invariant agent with Transformer (PIT) to realize the coordination transfer in more varieties of scenarios. Extensive experiments in StarCraft II micro-management show that LA-QTransformer together with PIT achieves superior performance compared with state-of-the-art baselines.

研究动机与目标

  • 解决现有迁移学习方法在协作多智能体强化学习中的局限性,即仅关注智能体策略迁移而忽略协调知识的迁移。
  • 实现在不同智能体群体和协调模式下,协调知识的鲁棒迁移。
  • 开发一种可扩展且泛化能力强的架构,支持动态智能体群体,并在多样化场景中保持性能。
  • 通过新型混合网络显式建模多层级协调模式,改进基于值函数的MARL中的信用分配。
  • 设计一种群体不变的智能体结构,使协调知识能泛化至不同数量的智能体。

提出的方法

  • 引入层级自适应Transformer(LA-Transformer),通过硬注意力或混合特征融合,动态识别并聚焦于每个智能体的适当协调层级(如成对、三元组等)。
  • 设计层级自适应QTransformer(LA-QTransformer),一种新型混合网络,整合来自LA-Transformer的协调模式,以在基于值函数的MARL中实现鲁棒的信用分配。
  • 提出基于Transformer的群体不变智能体(PIT),一种新型智能体网络架构,通过在实体级特征上应用注意力机制,实现不同智能体数量下的协调知识泛化。
  • 将全局协调分解为可重用的协调模式,实现超越个体策略的结构性协调知识迁移。
  • 采用课程训练策略,逐步增加智能体数量,以验证鲁棒性并提升协调模式学习效果。
  • 通过满足单调性约束的LA-QTransformer实现信用分配,支持有效的联合Q值估计。

实验结果

研究问题

  • RQ1是否能够有效分解并迁移不同协作多智能体任务中、具有不同智能体群体的协调模式?
  • RQ2如何设计一种混合网络,以支持自适应的、层级特定的协调模式,同时确保正确的信用分配?
  • RQ3群体不变的智能体架构在多大程度上能泛化协调知识至不同数量的智能体?
  • RQ4显式建模协调模式是否能带来优于端到端策略迁移的迁移性能?
  • RQ5课程学习是否能改善复杂多智能体环境中协调模式的发现与利用?

主要发现

  • LA-QTransformer采用混合注意力机制在5m(3m)StarCraft II地图上实现了97.1%的胜率,优于QMIX(95.3%)和LA-QTransformer(硬注意力)(97.1%)。
  • 在5m6m(8m9m)场景中,LA-QTransformer(混合)实现了97.1%的胜率,显著优于QMIX(96.1%)和LA-QTransformer(硬注意力)(96.9%)。
  • 在5m6m(8m9m)地图上,该方法在无预训练情况下仍达到83.2%的胜率,展现出强大的泛化能力与鲁棒性。
  • 消融实验表明,堆叠多个标准Transformer无法提升性能,而LA-Transformer能明确捕捉最优协调层级。
  • PIT智能体设计通过课程训练逐步增加群体规模,验证了其在不同智能体数量间实现有效协调知识迁移的能力。
  • 可解释性分析显示,LA-Transformer成功识别并利用了StarCraft II中的相关协调模式,如成对与三元组编队。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。