[论文解读] MASER: Multi-Agent Reinforcement Learning with Subgoals Generated from Experience Replay Buffer
MASER 提出了一种多智能体强化学习方法,通过在经验回放缓冲区中平衡个体与总 Q 值,自动从经验中生成子目标,从而在稀疏奖励环境中实现高效学习。它通过基于 Q 函数的内在奖励机制,结合可操作表征学习,在 StarCraft II 微操任务中优于当前最先进(SOTA)的 MARL 算法。
In this paper, we consider cooperative multi-agent reinforcement learning (MARL) with sparse reward. To tackle this problem, we propose a novel method named MASER: MARL with subgoals generated from experience replay buffer. Under the widely-used assumption of centralized training with decentralized execution and consistent Q-value decomposition for MARL, MASER automatically generates proper subgoals for multiple agents from the experience replay buffer by considering both individual Q-value and total Q-value. Then, MASER designs individual intrinsic reward for each agent based on actionable representation relevant to Q-learning so that the agents reach their subgoals while maximizing the joint action value. Numerical results show that MASER significantly outperforms StarCraft II micromanagement benchmark compared to other state-of-the-art MARL algorithms.
研究动机与目标
- 解决在稀疏奖励设置下合作性多智能体强化学习中的样本效率与信用分配问题。
- 通过实现基于经验的自动子目标生成,克服依赖任务特定子目标设计的局限性。
- 设计内在奖励,引导各智能体朝向子目标前进,同时通过一致的 Q 值分解保持联合策略优化。
- 在不依赖密集奖励塑形或领域特定子目标工程的前提下,提升稀疏奖励多智能体环境中的学习效率与最终性能。
提出的方法
- 基于经验回放缓冲区中轨迹的局部状态,通过个体 Q 值与总 Q 值的加权组合,选择生成子目标。
- 在 CTDE(集中训练、去中心化执行)范式下,使用混合网络实现一致的 Q 值分解。
- 通过基于 Q 函数的可操作距离,为每个智能体设计内在奖励,该距离通过表征学习获得,用于衡量向子目标的进展。
- 在损失函数中引入回合校正机制,通过对齐内在奖励信号与实际子目标达成,稳定训练过程。
- 通过为个体效用设置独立损失项,更新本地 Q 网络,确保个体贡献的稳定学习。
- 采用双目标优化:在最大化联合 Q 值的同时,通过源自可操作表征的内在奖励引导智能体达成子目标。
实验结果
研究问题
- RQ1在稀疏奖励 MARL 中,是否可以不依赖领域特定知识,仅从经验回放缓冲区自动生成子目标?
- RQ2在子目标选择中平衡个体与总 Q 值,对学习效率与最终性能有何影响?
- RQ3基于可操作表征的 Q 函数内在奖励,在多智能体稀疏奖励设置下,能在多大程度上提升样本效率?
- RQ4个体损失与回合校正组件在 MASER 的训练稳定性与性能方面分别起到何种作用?
- RQ5在 StarCraft II 微操任务等具有挑战性的稀疏奖励环境中,MASER 是否优于现有的最先进 MARL 算法?
主要发现
- MASER 在 StarCraft II 微操任务(包括 2s3z、3m、8m 和 2m_vs_1z)中显著优于当前最先进 MARL 算法。
- 基于个体与总 Q 值(α=0.5)的子目标选择策略表现最佳,优于随机选择或仅使用单一 Q 值类型的方法。
- 消融实验确认,个体损失与回合校正组件对稳定且高效的训练均至关重要。
- 基于 Q 函数的可操作距离表征实现了有效的内在奖励学习,使 MASER 在 3m-cliff 稀疏奖励环境中成功运行,而基线方法则失败。
- 对 2s3z 任务中子目标选择的可视化分析表明,MASER 学习到了角色特异性行为——冲锋者从远距离攻击,狂战士近距离近身作战——与领域知识一致。
- 该方法在无需显式奖励塑形或预定义子目标的情况下,实现了有效的信用分配与角色专业化,展现出在多样化稀疏奖励任务中的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。