Skip to main content
QUICK REVIEW

[论文解读] Scaling up Mean Field Games with Online Mirror Descent

Julien Pérolat, Sarah Perrin|arXiv (Cornell University)|Feb 28, 2021
Artificial Intelligence in Games参考文献 40被引用 10
一句话总结

本文提出在线镜像下降(OMD)作为一种可扩展算法,用于在平均场博弈(MFGs)中计算纳什均衡,通过利用连续时间动力学和Q函数整合,避免显式计算最优响应。在单调性假设下证明了收敛性,并通过实证表明,OMD可扩展至具有高达10^11个状态的MFG,其在大规模、多群体及共同噪声设置下的速度和可扩展性优于虚拟博弈(Fictitious Play)。

ABSTRACT

We address scaling up equilibrium computation in Mean Field Games (MFGs) using Online Mirror Descent (OMD). We show that continuous-time OMD provably converges to a Nash equilibrium under a natural and well-motivated set of monotonicity assumptions. This theoretical result nicely extends to multi-population games and to settings involving common noise. A thorough experimental investigation on various single and multi-population MFGs shows that OMD outperforms traditional algorithms such as Fictitious Play (FP). We empirically show that OMD scales up and converges significantly faster than FP by solving, for the first time to our knowledge, examples of MFGs with hundreds of billions states. This study establishes the state-of-the-art for learning in large-scale multi-agent and multi-population games.

研究动机与目标

  • 解决在大规模状态空间和大群体下,平均场博弈(MFGs)中均衡计算的可扩展性挑战。
  • 克服虚拟博弈(FP)的局限性,如高内存使用、收敛缓慢以及对最优响应计算的依赖。
  • 为单群体和多群体MFGs(包括存在共同噪声的场景)开发一种可扩展且内存高效的算法。
  • 在MFGs的标准单调性假设下,建立连续时间OMD的理论收敛保证。
  • 通过实证展示OMD在大规模MFGs中相较于FP在收敛速度和可扩展性方面的优越性。

提出的方法

  • 通过在时间上对集成Q函数的软最大值进行迭代更新策略,将在线镜像下降(OMD)应用于MFGs。
  • 通过时间积分的Q函数定义连续时间OMD算法:$ y^{i}_{n,t}(x^{i},a^{i}| au) = \int_0^t Q^{i,\pi^{i}_s,\mu^{\pi_s}}_n(x^{i},a^{i}|\tau)ds $。
  • 使用镜像映射 $ \Gamma $ 更新策略:$ \pi^{i}_{n,t}(\cdot|x^{i},\tau) = \Gamma(y^{i}_{n,t}(x^{i},\cdot|\tau)) $。
  • 通过在共同噪声下对每个群体的前向和后向动力学进行建模,将该方法扩展至多群体MFGs。
  • 在奖励函数单调性和奖励结构可分性假设下,证明收敛至纳什均衡。
  • 使用深度强化学习估计高维状态空间中的Q函数,从而实现对万亿量级状态-动作对的可扩展性。

实验结果

研究问题

  • RQ1在线镜像下降(OMD)是否可在连续时间平均场博弈中被理论证明收敛至纳什均衡?
  • RQ2OMD在大规模MFGs中是否在收敛速度和可扩展性方面优于虚拟博弈(FP)?
  • RQ3OMD是否可扩展至具有共同噪声的多群体MFGs,同时保持收敛性和效率?
  • RQ4OMD在MFGs中成功计算均衡的最大规模(以状态空间大小衡量)是多少?
  • RQ5OMD在大规模MFGs中的内存占用与FP相比如何?

主要发现

  • 在标准单调性和可分性假设下,OMD可理论证明收敛至连续时间MFG中的纳什均衡。
  • OMD可扩展至具有高达10^11个状态和万亿量级状态-动作对的MFG,相比先前方法实现了4至5个数量级的提升。
  • OMD的收敛速度显著快于虚拟博弈(FP),实证结果表明其在各种拓扑结构(环面、正方形、环形)和初始化方式(角落、随机)下均表现更优。
  • OMD仅需存储当前策略和集成Q函数,相比FP(需存储平均策略和诱导分布),显著降低了内存使用。
  • 该方法成功推广至多群体MFGs和存在共同噪声的场景,同时保持理论收敛性和实证效率。
  • 所研究MFGs中的奖励函数满足单调性,这使得理论收敛性证明成为可能,并支撑了算法的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。