[论文解读] Regularized Softmax Deep Multi-Agent $Q$-Learning
本文提出正则化软最大(RES)深度多智能体Q学习,一种通过结合基于基线的正则化方案与软最大算子的高效近似,以减少多智能体Q学习中过估计问题的一般性方法。应用于QMIX时,RES稳定了学习过程,防止了值估计无界增长,并在StarCraft II微操控任务和多智能体粒子环境上实现了最先进性能。
Tackling overestimation in $Q$-learning is an important problem that has been extensively studied in single-agent reinforcement learning, but has received comparatively little attention in the multi-agent setting. In this work, we empirically demonstrate that QMIX, a popular $Q$-learning algorithm for cooperative multi-agent reinforcement learning (MARL), suffers from a more severe overestimation in practice than previously acknowledged, and is not mitigated by existing approaches. We rectify this with a novel regularization-based update scheme that penalizes large joint action-values that deviate from a baseline and demonstrate its effectiveness in stabilizing learning. Furthermore, we propose to employ a softmax operator, which we efficiently approximate in a novel way in the multi-agent setting, to further reduce the potential overestimation bias. Our approach, Regularized Softmax (RES) Deep Multi-Agent $Q$-Learning, is general and can be applied to any $Q$-learning based MARL algorithm. We demonstrate that, when applied to QMIX, RES avoids severe overestimation and significantly improves performance, yielding state-of-the-art results in a variety of cooperative multi-agent tasks, including the challenging StarCraft II micromanagement benchmarks.
研究动机与目标
- 为解决深度多智能体Q学习中严重的过估计问题,特别是QMIX中的问题,该问题在以往研究中未受到足够重视。
- 通过防止联合动作值估计无界增长来稳定学习,从而避免性能下降。
- 在多智能体设置中,减少过估计偏差,超越双估计算法或现有正则化方法的性能。
- 为多智能体强化学习中大规模联合动作空间,开发一种高效且可扩展的软最大算子近似方法。
- 设计一种通用方法,适用于任何基于Q学习的多智能体强化学习算法,不限于QMIX。
提出的方法
- 引入一种基于正则化的更新机制,通过惩罚偏离基线的联合动作Q值,使用折扣回报作为基线以稳定学习。
- 采用一种新颖且高效的联合动作子空间上的软最大算子近似,其收敛至真实软最大值的速度呈指数级。
- 推导出一种改进的贝尔曼损失,结合正则化惩罚与软最大近似,以减少过估计偏差。
- 在软最大近似中使用温度参数,以控制探索与利用之间的权衡。
- 通过将QMIX的标准Q学习更新替换为RES更新规则,将该方法应用于QMIX,同时保持单调混合网络结构不变。
- 采用基于子空间的采样策略,高效计算软最大近似,而无需枚举完整的联合动作空间。
实验结果
研究问题
- RQ1尽管QMIX使用了双DQN和裁剪双Q学习,为何在实践中仍会遭受严重过估计?
- RQ2现有单智能体过估计缓解技术(如双估计算法或软最大)能否有效适配到多智能体设置中?
- RQ3当联合动作空间随智能体数量呈指数级增长时,如何稳定联合动作值函数中的过估计?
- RQ4一种惩罚偏离基线的正则化方案是否能提升多智能体强化学习中的学习稳定性和性能?
- RQ5是否存在一种高效且可扩展的软大量算子近似方法,可在大规模多智能体动作空间中保持高精度?
主要发现
- 在多智能体粒子环境中,RES-QMIX消除了值估计无界增长的问题,而QMIX的值估计发散并导致性能崩溃。
- 在所有测试的StarCraft II微操控行为地图上,RES-QMIX均实现了最先进性能,优于QMIX、QPLEX及其他最先进基线方法。
- 即使不使用双估计算法,RES-QMIX(单模型)在所有地图上均优于标准QMIX和使用双估计算法的QMIX,证明了正则化本身的有效性。
- RES-QMIX的值估计显著小于且更稳定,验证了其过估计偏差的减少。
- 所提出的软最大近似在逆温度参数下以指数速度收敛至真实软最大值,确保高精度的同时计算成本极低。
- 该方法具有良好的泛化能力:RES可应用于任何基于Q学习的多智能体强化学习算法,不仅限于QMIX,并在多种环境中保持性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。