Skip to main content
QUICK REVIEW

[论文解读] DFAC Framework: Factorizing the Value Function via Quantile Mixture for Multi-Agent Distributional Q-Learning

Wei-Fang Sun, Cheng‐Kuang Lee|arXiv (Cornell University)|Feb 16, 2021
Reinforcement Learning in Robotics参考文献 27被引用 9
一句话总结

本文提出DFAC框架,通过使用分位数混合与均值-形状分解来建模回报分布,将多智能体强化学习中的值函数分解扩展至分布式RL。该方法在保持个体-全局最大(IGM)性质的同时实现了分布式值函数分解,在StarCraft II多智能体挑战赛所有超难难度地图上均优于期望值基线方法。

ABSTRACT

In fully cooperative multi-agent reinforcement learning (MARL) settings, the environments are highly stochastic due to the partial observability of each agent and the continuously changing policies of the other agents. To address the above issues, we integrate distributional RL and value function factorization methods by proposing a Distributional Value Function Factorization (DFAC) framework to generalize expected value function factorization methods to their DFAC variants. DFAC extends the individual utility functions from deterministic variables to random variables, and models the quantile function of the total return as a quantile mixture. To validate DFAC, we demonstrate DFAC's ability to factorize a simple two-step matrix game with stochastic rewards and perform experiments on all Super Hard tasks of StarCraft Multi-Agent Challenge, showing that DFAC is able to outperform expected value function factorization baselines.

研究动机与目标

  • 解决在随机、部分可观测的多智能体环境中,期望值函数分解方法的局限性。
  • 弥合合作性多智能体强化学习中分布式强化学习与值函数分解之间的差距。
  • 在分布式设置下保持个体-全局最大(IGM)性质,以实现稳定且高效的去中心化执行。
  • 开发一种计算高效的联合回报分布分解为个体效用分布的方法。

提出的方法

  • 引入均值-形状分解,将期望值函数分解推广至分布式设置,同时保持IGM条件。
  • 采用分位数混合,将总回报分布表示为个体智能体效用分布的组合。
  • 利用分位数回归与隐式分位数网络,高效近似个体效用的分位数函数。
  • 在实验中应用移动平均平滑滤波器以稳定训练曲线。
  • 将独立Q-learning(IQL)与值函数分解方法(VDN、QMIX)扩展为对应的分布式变体(DIQL、DDN、DMIX),用于消融实验与对比。
  • 在两步矩阵博弈及StarCraft多智能体挑战赛(SMAC)的所有超难地图上验证该框架。

实验结果

研究问题

  • RQ1在具有随机奖励与部分可观测性的合作性多智能体环境中,能否有效应用分布式值函数分解?
  • RQ2在将值函数分解推广至分布式回报时,如何保持个体-全局最大(IGM)性质?
  • RQ3通过分位数混合建模回报分布,对MARL中的学习稳定性与性能有何影响?
  • RQ4基于DFAC的变体与对应的期望值基线方法相比,在具有挑战性的SMAC地图上,胜率与累积得分表现如何?

主要发现

  • 基于DFAC的方法,特别是DDN与DMIX,在StarCraft多智能体挑战赛的所有超难地图上均优于其期望值基线方法(VDN与QMIX)。
  • 在最困难的地图6h_vs_8z上,仅有DDN与DMIX成功学习到有效策略,而基线方法失败。
  • 所有超难地图上,分布式变体(DDN、DMIX)的最终胜率更高,平均得分也优于其基线方法。
  • DIQL(IQL的分布式变体)已优于标准IQL,验证了即使在无分解的情况下,分布式学习在MARL中仍具有优势。
  • 分位数混合方法能够高效且稳定地将联合回报分布分解为个体效用分布。
  • 尽管结构简单,DDN仍表现出色,表明分布式分解可提升复杂MARL场景下的数据效率与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。