Skip to main content
QUICK REVIEW

[论文解读] SHAQ: Incorporating Shapley Value Theory into Multi-Agent Q-Learning

Jianhong Wang, Yuan Zhang|arXiv (Cornell University)|May 31, 2021
Reinforcement Learning in Robotics参考文献 45被引用 9
一句话总结

本文提出 SHAQ,一种将 Shapley 值理论融入全局奖励博弈的价值分解的多智能体强化学习算法。通过引入马尔可夫 Shapley 值(MSV)和 Shapley-Bellman 最优方程(SBOE),SHAQ 实现了理论上有根基的信用分配,使协作式 MARL 场景下的性能与可解释性均达到高水平。

ABSTRACT

Value factorisation is a useful technique for multi-agent reinforcement learning (MARL) in global reward game, however its underlying mechanism is not yet fully understood. This paper studies a theoretical framework for value factorisation with interpretability via Shapley value theory. We generalise Shapley value to Markov convex game called Markov Shapley value (MSV) and apply it as a value factorisation method in global reward game, which is obtained by the equivalence between the two games. Based on the properties of MSV, we derive Shapley-Bellman optimality equation (SBOE) to evaluate the optimal MSV, which corresponds to an optimal joint deterministic policy. Furthermore, we propose Shapley-Bellman operator (SBO) that is proved to solve SBOE. With a stochastic approximation and some transformations, a new MARL algorithm called Shapley Q-learning (SHAQ) is established, the implementation of which is guided by the theoretical results of SBO and MSV. We also discuss the relationship between SHAQ and relevant value factorisation methods. In the experiments, SHAQ exhibits not only superior performances on all tasks but also the interpretability that agrees with the theoretical analysis. The implementation of this paper is on https://github.com/hsvgbkhgbv/shapley-q-learning.

研究动机与目标

  • 解决多智能体强化学习(MARL)中价值分解方法缺乏理论可解释性的问题。
  • 通过马尔可夫凸博弈的概念,形式化动态、马尔可夫环境下的协作博弈论框架。
  • 在协作式 MARL 中,利用 Shapley 值推导出理论坚实、具备高效性、对称性与零智能体可识别性的信用分配机制。
  • 开发一种新型 MARL 算法——Shapley Q 学习(SHAQ),该算法具备收敛性与可解释性,并支持去中心化执行。
  • 验证所提方法在性能上优于最先进基线,同时提供透明、理论基础坚实的信用分配。

提出的方法

  • 提出马尔可夫 Shapley 值(MSV),作为 Shapley 值在马尔可夫凸博弈中的推广,确保在全联盟下具有核心稳定性。
  • 推导出 Shapley-Bellman 最优方程(SBOE),作为 Bellman 方程的扩展,用于刻画在联合确定性策略下最优 MSV 的特性。
  • 提出 Shapley-Bellman 算子(SBO)并证明其收敛至 SBOE,从而实现最优值的稳定学习。
  • 通过 SBO 的随机近似与架构转换,开发 SHAQ,实现去中心化执行的同时保持收敛性。
  • 使用超网络实现注意力加权机制,以在实践中近似 Shapley 值,确保与理论性质的一致性。
  • 采用联盟结构采样策略估算边际贡献,并使用单调函数对注意力权重进行缩放,以实现稳定的价值分解。

实验结果

研究问题

  • RQ1Shapley 值理论能否被扩展至动态、马尔可夫协作博弈,以提供理论上有根基的价值分解方法?
  • RQ2所提出的马尔可夫 Shapley 值(MSV)在协作式 MARL 中是否满足效率、对称性与零智能体可识别性等关键公理?
  • RQ3Shapley-Bellman 最优方程(SBOE)及其相关 Shapley-Bellman 算子(SBO)能否用于推导出收敛且去中心化的 MARL 算法?
  • RQ4所得到的 SHAQ 算法在全局奖励博弈中是否相比现有价值分解方法展现出更优的性能与可解释性?
  • RQ5SHAQ 中的信用分配是否既能理论合理,又能与协作任务中智能体的实际贡献在实证上保持一致?

主要发现

  • SHAQ 在所有评估任务中均取得更优性能,包括猎物-捕食者与多智能体星际争霸基准,优于最先进基线。
  • SHAQ 的信用分配具有可解释性,并与理论性质一致:能正确识别零智能体,确保效率,并反映边际贡献。
  • 已证明 Shapley-Bellman 算子(SBO)收敛至最优 SBOE,确保学习过程的理论稳定性与正确性。
  • 由于 SBO 与 MSV 框架提供了理论保证,SHAQ 即使在去中心化执行下仍能保持收敛性与性能。
  • SHAQ 中注意力权重的实现确保了各智能体权重之和始终小于或等于 1,从而保持价值分解的一致性。
  • 实证结果证实,SHAQ 中的注意力权重反映了实际的智能体贡献,对齐最优联合策略的动作被赋予更高的权重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。