Skip to main content
QUICK REVIEW

[论文解读] Decomposed Soft Actor-Critic Method for Cooperative Multi-Agent Reinforcement Learning

Yuan Pu, Shaochen Wang|arXiv (Cornell University)|Apr 14, 2021
Reinforcement Learning in Robotics参考文献 18被引用 12
一句话总结

本文提出了一种新颖的多智能体软演员评论家(mSAC)方法,通过将价值函数分解与软演员评论家原则相结合,实现在合作式多智能体强化学习中的高效异策略学习。通过使用线性混合Q网络、去中心化概率策略以及可选的反事实优势函数,mSAC在《星际争霸II》微操任务中实现了最先进性能,尤其在2c_vs_64zg和MMM2等大动作空间环境中的表现尤为突出,优于COMA,并在大多数基准测试中与QMIX持平。

ABSTRACT

Deep reinforcement learning methods have shown great performance on many challenging cooperative multi-agent tasks. Two main promising research directions are multi-agent value function decomposition and multi-agent policy gradients. In this paper, we propose a new decomposed multi-agent soft actor-critic (mSAC) method, which effectively combines the advantages of the aforementioned two methods. The main modules include decomposed Q network architecture, discrete probabilistic policy and counterfactual advantage function (optinal). Theoretically, mSAC supports efficient off-policy learning and addresses credit assignment problem partially in both discrete and continuous action spaces. Tested on StarCraft II micromanagement cooperative multiagent benchmark, we empirically investigate the performance of mSAC against its variants and analyze the effects of the different components. Experimental results demonstrate that mSAC significantly outperforms policy-based approach COMA, and achieves competitive results with SOTA value-based approach Qmix on most tasks in terms of asymptotic perfomance metric. In addition, mSAC achieves pretty good results on large action space tasks, such as 2c_vs_64zg and MMM2.

研究动机与目标

  • 为在集中训练、去中心化执行(CTDE)范式下解决合作式多智能体强化学习(MARL)中的信用分配问题与可扩展性问题。
  • 将软演员评论家的样本效率与稳定性,与价值函数分解方法相结合,用于异策略MARL。
  • 通过联合优化完整策略分布,提升高维动作空间中的探索与策略优化效果。
  • 探究反事实优势函数在复杂多智能体信用分配场景中的有效性。
  • 与基于策略(如COMA)和基于价值(如QMIX)的最先进MARL方法相比,实现具有竞争力或更优的性能。

提出的方法

  • 该方法采用分解的Q网络架构,其中联合Q值通过仅依赖于本地观测与动作的个体Q值进行线性混合。
  • 每个智能体使用去中心化概率策略,通过软演员评论家学习以同时最大化期望回报与熵。
  • 可选地应用反事实优势函数,通过估计单个动作对全局回报的影响来改善信用分配。
  • 混合网络为线性结构,且仅依赖于全局状态,确保满足线性分解的理论条件。
  • 通过利用最大熵强化学习框架与经验回放,支持高效的异策略学习。
  • 该方法在CTDE设置下进行训练:使用集中式评论家进行价值估计,去中心化执行用于策略推理。

实验结果

研究问题

  • RQ1将软演员评论家与价值函数分解相结合,是否能在合作式MARL中实现稳定且样本高效的异策略学习?
  • RQ2与ε-贪婪或贪婪选择相比,使用完整策略分布进行探索在高维动作空间中是否更有效?
  • RQ3反事实优势函数是否能改善复杂、难以探索的合作任务中的信用分配与性能表现?
  • RQ4在《星际争霸II》微操任务中,mSAC与COMA(基于策略)和QMIX(基于价值)相比,在性能与稳定性方面表现如何?
  • RQ5mSAC是否能在2c_vs_64zg和MMM2等大动作空间环境中有良好泛化能力?

主要发现

  • mSAC在所有《星际争霸II》微操地图上显著优于基于策略的方法COMA,尤其在渐近胜率与训练稳定性方面表现突出。
  • 在大多数标准地图(如8m、1c3s5z、3m、3s5z)上,mSAC达到的渐近性能与QMIX相当,展现出与最先进基于价值方法相当的竞争力。
  • 在2c_vs_64zg和MMM2等大动作空间任务中,mSAC的性能显著优于QMIX,凸显其在复杂动作空间场景中的优势。
  • 使用完整策略分布进行探索,相比ε-贪婪策略,能实现更有效且结构化的探索,尤其在高维动作空间中表现更优。
  • 反事实优势函数在更困难的任务(如3s_vs_5z)中提升了性能,但在较简单环境中影响较小,表明其在复杂信用分配问题中作用最为关键。
  • 训练稳定性因随机种子不同而异,部分运行达到最高90%胜率,而另一些则为零,表明在困难地图中探索仍是挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。