Skip to main content
QUICK REVIEW

[论文解读] More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization

Jiangxing Wang, Deheng Ye|arXiv (Cornell University)|Sep 26, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出多智能体条件策略分解(MACPF),通过建模智能体依赖关系实现更集中的训练,同时通过分解的策略结构支持去中心化执行。MACPF 在 SMAC 和 MPE 等合作式多智能体强化学习环境中的实验表明,其在更快收敛速度和更优性能方面优于基线方法,通过学习条件分解为独立策略并引入修正项的依赖本地策略,实现了最优联合策略性能。

ABSTRACT

In cooperative multi-agent reinforcement learning (MARL), combining value decomposition with actor-critic enables agents to learn stochastic policies, which are more suitable for the partially observable environment. Given the goal of learning local policies that enable decentralized execution, agents are commonly assumed to be independent of each other, even in centralized training. However, such an assumption may prohibit agents from learning the optimal joint policy. To address this problem, we explicitly take the dependency among agents into centralized training. Although this leads to the optimal joint policy, it may not be factorized for decentralized execution. Nevertheless, we theoretically show that from such a joint policy, we can always derive another joint policy that achieves the same optimality but can be factorized for decentralized execution. To this end, we propose multi-agent conditional policy factorization (MACPF), which takes more centralized training but still enables decentralized execution. We empirically verify MACPF in various cooperative MARL tasks and demonstrate that MACPF achieves better performance or faster convergence than baselines. Our code is available at https://github.com/PKU-RL/FOP-DMAC-MACPF.

研究动机与目标

  • 为解决现有 MARL 方法在训练中假设智能体独立所带来的局限性,该假设限制了联合策略的表达能力,并阻碍收敛至全局最优。
  • 通过在策略学习过程中显式建模智能体之间的依赖关系,实现更集中的训练,从而提升联合策略质量。
  • 通过推导出与依赖联合策略性能相当的独立策略,确保去中心化执行得以保留。
  • 通过实证验证,在复杂合作环境中引入训练阶段的智能体依赖关系可提升性能并加快收敛速度。

提出的方法

  • 提出多智能体条件策略分解(MACPF),在集中式训练中基于链式法则的依赖结构对最优联合策略进行分解。
  • 引入联合策略的条件分解,将其分解为独立本地策略与依赖性策略修正项,从而支持去中心化执行。
  • 采用基于混合器网络的软策略迭代方法,与 FOP 不同,使联合 Q 值可基于概率的链式法则进行分解。
  • 理论上证明:对于任意实现最优性能的依赖联合策略,均存在一个等效的独立联合策略,其期望回报保持不变。
  • 采用双流架构:一路用于学习依赖策略(用于集中式训练),另一路用于学习独立策略(用于去中心化执行)。
  • 在演员-评论家框架中应用该方法,结合最大熵目标,确保在部分可观测设置下实现随机策略学习。

实验结果

研究问题

  • RQ1在集中式训练中建模智能体依赖关系,是否能实现合作式 MARL 中更优的联合策略优化?
  • RQ2能否通过去中心化策略实现与集中式依赖联合策略相同的最优性能?
  • RQ3在复杂合作环境中,训练阶段引入智能体间依赖关系是否能提升收敛速度与最终性能?
  • RQ4能否通过条件分解导出的独立策略,实现与依赖联合策略相当的性能?
  • RQ5MACPF 在胜率与训练稳定性方面,相较于 FOP、QMIX、QPLEX 和 MAPPO 等最先进基线方法表现如何?

主要发现

  • 在 SMAC 的 18 张地图中,MACPF 在 16 张地图上优于 FOP、QMIX、QPLEX 和 MAPPO,且在 16/18 张地图中胜率不低于最佳基线方法。
  • 在具有挑战性的“走廊”地图中,MACPF 胜率接近 70%,而其他值分解算法无法学习到有意义的策略。
  • 在 MPE 基准测试中,MACPF 在简单扩散任务中取得 -118.24 ± 2.74 的平均奖励,显著优于 QMIX(-145.93 ± 21.09)和 FOP(-125.19 ± 5.42)。
  • 消融实验表明,MACPF 的性能提升源于对依赖关系的建模,因为不包含依赖策略的 MACPF_CONTROL 在全部四张 SMAC 地图上表现均逊于 MACPF。
  • 如图 10 所示,MACPF 中的独立本地策略在整个训练过程中均与依赖联合策略性能一致,验证了理论上的等价性。
  • 在 SMAC 的高难与超难地图中,MACPF 的收敛速度优于基线方法,尤其在更具挑战性的“短视”变体(视野范围减小且缺少队友信息)中表现优势更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。