Skip to main content
QUICK REVIEW

[论文解读] Provable Fictitious Play for General Mean-Field Games

Qiaomin Xie, Zhuoran Yang|arXiv (Cornell University)|Oct 8, 2020
Reinforcement Learning in Robotics参考文献 71被引用 8
一句话总结

本文通过将问题表述为均值场状态与策略之间的虚构博弈,提出了一种适用于一般均值场博弈的可证明收敛的单循环强化学习算法。通过交替使用梯度下降与近端策略优化(PPO),该方法实现了对纳什均衡的次线性收敛,这是该设定下首个具有可证明收敛性的单循环方法。

ABSTRACT

We propose a reinforcement learning algorithm for stationary mean-field games, where the goal is to learn a pair of mean-field state and stationary policy that constitutes the Nash equilibrium. When viewing the mean-field state and the policy as two players, we propose a fictitious play algorithm which alternatively updates the mean-field state and the policy via gradient-descent and proximal policy optimization, respectively. Our algorithm is in stark contrast with previous literature which solves each single-agent reinforcement learning problem induced by the iterates mean-field states to the optimum. Furthermore, we prove that our fictitious play algorithm converges to the Nash equilibrium at a sublinear rate. To the best of our knowledge, this seems the first provably convergent single-loop reinforcement learning algorithm for mean-field games based on iterative updates of both mean-field state and policy.

研究动机与目标

  • 为解决多智能体强化学习中因'多智能体诅咒'带来的可扩展性挑战。
  • 开发一种计算高效的、用于平稳均值场博弈的单循环强化学习算法。
  • 替代每轮迭代中需精确求解内层MDP的双循环方法。
  • 证明所提算法以次线性速率收敛至纳什均衡。
  • 建立首个基于策略与均值场状态迭代更新的、可证明收敛的单循环均值场博弈强化学习算法。

提出的方法

  • 将均值场博弈建模为代表性智能体策略与均值场状态之间的二人博弈。
  • 通过交替更新:利用梯度下降更新均值场状态,利用近端策略优化(PPO)更新策略。
  • 采用虚构博弈动态,使每个玩家对另一方的当前策略做出最优响应。
  • 使用深度神经网络进行函数逼近,以处理高维状态与动作空间。
  • 应用理论工具,包括压缩映射、Pinsker不等式与柯西-施瓦茨不等式,以建立收敛性边界。
  • 通过界定策略与均值场状态相对于均衡的平均偏差,推导出次线性收敛速率。

实验结果

研究问题

  • RQ1单循环强化学习算法是否能在一般均值场博弈中实现对纳什均衡的可证明收敛?
  • RQ2所提出的虚构博弈算法的收敛速率与现有双循环方法相比如何?
  • RQ3在均值场博弈设定下,对策略与均值场状态进行交替更新,可建立哪些理论保证?
  • RQ4当使用函数逼近与随机更新时,该算法是否仍能保持收敛性?
  • RQ5收敛速率对时间跨度、近似误差等问题参数的依赖关系如何?

主要发现

  • 所提算法对纳什均衡的收敛速率分别为:策略偏差的 $ \mathcal{O}\left(\frac{\log T}{T^{4/9}}\right) $ 与均值场状态偏差的 $ \mathcal{O}\left(\frac{\log T}{T^{1/9}}\right) $。
  • 在较弱假设下建立收敛速率,包括有界密度比与值函数的Lipschitz连续性。
  • 该方法避免在每轮迭代中精确求解内层MDP,从而实现单循环结构,显著提升计算效率。
  • 理论分析利用Jensen不等式、柯西-施瓦茨不等式与Pinsker不等式,以界定策略与状态偏差。
  • 算法对近似误差 $ \varepsilon $ 具有鲁棒性,收敛速率与 $ \mathcal{O}(\varepsilon^{1/4}) $ 成比例。
  • 本工作首次提出基于策略与均值场状态联合更新的、可证明收敛的单循环强化学习算法,适用于均值场博弈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。