Skip to main content
QUICK REVIEW

[论文解读] Learning in Discounted-cost and Average-cost Mean-field Games

Berkay Anahtarcı, Can Deha Karıksız|arXiv (Cornell University)|Dec 31, 2019
Reinforcement Learning in Robotics参考文献 37被引用 7
一句话总结

本文提出了一种在折扣成本和平均成本准则下,针对离散时间平均场博弈的无模型学习算法,采用拟合Q-迭代方法近似平均场均衡(MFE)算子。通过证明MFE算子为压缩映射,作者建立了具有概率误差界下的收敛性,并表明在有限玩家设置下,所学习的策略构成近似纳什均衡。

ABSTRACT

We consider learning approximate Nash equilibria for discrete-time mean-field games with nonlinear stochastic state dynamics subject to both average and discounted costs. To this end, we introduce a mean-field equilibrium (MFE) operator, whose fixed point is a mean-field equilibrium (i.e. equilibrium in the infinite population limit). We first prove that this operator is a contraction, and propose a learning algorithm to compute an approximate mean-field equilibrium by approximating the MFE operator with a random one. Moreover, using the contraction property of the MFE operator, we establish the error analysis of the proposed learning algorithm. We then show that the learned mean-field equilibrium constitutes an approximate Nash equilibrium for finite-agent games.

研究动机与目标

  • 开发一种学习算法,用于在具有非线性状态动态的大规模群体随机动态博弈中计算近似纳什均衡。
  • 通过引入具有折扣和平均成本准则下收敛性保证的无模型学习方法,扩展先前关于平稳平均场均衡的研究。
  • 通过提出具有误差分析的学习算法,弥合平均场均衡理论存在性与实际计算之间的差距。
  • 证明所学习的平均场均衡策略在有限玩家博弈中可作为近似纳什均衡。
  • 利用MFE算子的压缩性质,建立所提学习算法的收敛速率和误差界。

提出的方法

  • 引入一个平均场均衡(MFE)算子,其不动点对应于平稳平均场均衡。
  • 在较弱正则性条件下证明MFE算子为压缩映射,从而提供收敛性保证。
  • 提出一种基于拟合Q-迭代的无模型学习算法,利用采样数据近似MFE算子。
  • 通过随机近似MFE算子来处理未知系统动态,使其适用于现实场景。
  • 基于压缩性质进行误差分析,以界定所学策略与真实MFE策略之间的偏差。
  • 将所学策略应用于构建有限玩家博弈中的近似纳什均衡,利用NCE原理。

实验结果

研究问题

  • RQ1能否开发一种无模型学习算法,用于在具有折扣成本和平均成本准则的离散时间随机平均场博弈中计算近似平均场均衡?
  • RQ2所提出的学习算法是否能以可量化的概率收敛速率收敛到真实的平均场均衡?
  • RQ3如何利用MFE算子的压缩性质来建立学习算法的误差界?
  • RQ4所学习的平均场均衡策略在有限玩家博弈中在多大程度上可作为近似纳什均衡?
  • RQ5在何种充分条件下,拟合Q-迭代方法能在此情境下产生稳定且收敛的学习过程?

主要发现

  • 在较弱正则性条件下,证明了平均场均衡(MFE)算子为压缩映射,确保了均衡的存在性与唯一性。
  • 基于拟合Q-迭代的所提学习算法,利用压缩性质以概率收敛速率收敛到真实的MFE策略。
  • 利用压缩系数和函数类的覆盖数,界定了所学策略与真实MFE策略之间的误差。
  • 所学策略在有限玩家博弈中构成近似纳什均衡,且近似质量随玩家数量增加而提高。
  • 该算法适用于折扣成本和平均成本准则,扩展了以往局限于特定成本结构的研究。
  • 使用Lipschitz连续函数的上确界范数理论界,以控制学习过程中的近似误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。