Skip to main content
QUICK REVIEW

[论文解读] Credit Assignment with Meta-Policy Gradient for Multi-Agent Reinforcement Learning

Jianzhun Shao, Hongchang Zhang|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics参考文献 43被引用 5
一句话总结

该论文提出MNMPG,一种基于元学习的框架,利用元策略梯度在CTDE范式下的多智能体强化学习中学习信用分配的全局层次结构。通过利用'训练更新'产生的回合奖励差异作为激励信号,改进了单调混合网络中的奖励分解,仅通过简单的效用网络,在5个超难《星际争霸II》微操地图中的4张上实现了最先进性能。

ABSTRACT

Reward decomposition is a critical problem in centralized training with decentralized execution~(CTDE) paradigm for multi-agent reinforcement learning. To take full advantage of global information, which exploits the states from all agents and the related environment for decomposing Q values into individual credits, we propose a general meta-learning-based Mixing Network with Meta Policy Gradient~(MNMPG) framework to distill the global hierarchy for delicate reward decomposition. The excitation signal for learning global hierarchy is deduced from the episode reward difference between before and after "exercise updates" through the utility network. Our method is generally applicable to the CTDE method using a monotonic mixing network. Experiments on the StarCraft II micromanagement benchmark demonstrate that our method just with a simple utility network is able to outperform the current state-of-the-art MARL algorithms on 4 of 5 super hard scenarios. Better performance can be further achieved when combined with a role-based utility network.

研究动机与目标

  • 为解决多智能体强化学习在集中训练、独立执行(CTDE)范式下准确奖励分解的挑战。
  • 通过学习一种引导更有效Q值组合的全局层次结构,改进信用分配。
  • 开发一种可泛化的框架,在无需先验知识或复杂架构修改的情况下,增强现有CTDE方法。
  • 通过自学习的全局层次结构,提升复杂协作多智能体任务中的探索能力和稳定性。

提出的方法

  • 该方法采用元策略梯度学习,训练一种引导混合网络中信用分配的全局层次结构。
  • 引入了'训练更新'——一系列应用于初始效用策略生成轨迹的Q学习更新,以模拟改进的行为。
  • 元学习的激励信号源自训练更新前后回合回报的差异。
  • 使用一个简单的两层效用网络生成局部Q值,通过满足IGM原则的单调混合网络进行混合。
  • 全局层次结构被训练以最大化训练更新带来的预期回报提升,实现在无外部先验条件下的自我改进。
  • 该框架与现有CTDE算法(如QMIX、RODE、ROMA和MAVEN)兼容,可作为其训练流程的附加模块。

实验结果

研究问题

  • RQ1基于元学习的方法是否能在不依赖先验知识或复杂架构的情况下,提升多智能体强化学习中的信用分配?
  • RQ2通过元策略梯度学习得到的全局层次结构,在增强单调混合网络的奖励分解方面效果如何?
  • RQ3所提出的方法是否在具有挑战性的协作多智能体任务中优于当前最先进MARL算法?
  • RQ4该框架是否可在不同CTDE架构间泛化,同时保持性能和稳定性?
  • RQ5基于角色的效用网络的集成如何影响所提方法的性能和鲁棒性?

主要发现

  • 采用简单两层效用网络的MNMPG框架,在《星际争霸II》微操基准测试的5张超难地图中,有4张优于当前最先进MARL算法。
  • 该方法在SMAC基准测试中表现卓越,在2m_vs_1z、3m、10m和2c3z等地图上实现了最先进结果。
  • 当与基于角色的效用网络结合时,方法性能进一步提升,且训练稳定性显著改善。
  • 消融实验验证了元策略梯度策略的有效性,表明奖励差异信号对学习有意义全局层次结构至关重要。
  • 该框架普遍适用于多种CTDE方法,包括QMIX、RODE和ROMA,且在无需架构重构的情况下提升了其性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。