Skip to main content
QUICK REVIEW

[论文解读] Learning in anonymous nonatomic games with applications to first-order mean field games

Saeed Hadikhanloo|arXiv (Cornell University)|Apr 2, 2017
Game Theory and Applications被引用 12
一句话总结

本文提出了针对具有玩家特定动作集的匿名非原子博弈的学习方法——虚构博弈(Fictitious Play)与在线镜像下降(Online Mirror Descent),在单调性条件下证明了其收敛至纳什均衡。该框架适用于一阶平均场博弈,为这一类连续动作、非原子博弈中的两种学习动态均建立了收敛性。

ABSTRACT

We introduce a model of anonymous games with the player dependent action sets. We propose several learning procedures based on the well-known Fictitious Play and Online Mirror Descent and prove their convergence to equilibrium under the classical monotonicity condition. Typical examples are first-order mean field games.

研究动机与目标

  • 将经典的博弈学习动态——虚构博弈与在线镜像下降——推广至具有玩家特定动作集的匿名非原子博弈。
  • 在标准单调性条件下,建立这些学习过程收敛至纳什均衡的理论结果。
  • 将结果应用于一阶平均场博弈,其中玩家选择具有固定初始位置的连续路径,且成本函数相同。
  • 将先前仅适用于势博弈的收敛结果推广至更广泛的单调成本博弈类别。
  • 为大规模、非原子博弈中通过学习实现均衡形成的理论基础提供支持,此类博弈具有连续动作。

提出的方法

  • 提出一种匿名非原子博弈模型,其中每位玩家具有不同的动作集,但成本函数依赖于其他参与者动作的经验分布。
  • 通过让玩家基于对手动作的经验频率更新信念,并对这些信念进行最优响应,来改进虚构博弈。
  • 采用基于Bregman散度的更新规则的在线镜像下降,以处理连续动作集并确保遗憾最小化。
  • 基于Schmeidler与Mas-Collel的框架,利用不动点论证,在连续性与紧致性条件下证明纳什均衡的存在性。
  • 运用分解定理与弱收敛技术,证明学习序列极限测度在动作集对应关系下的分解具有一致性。
  • 依赖单调性条件(Rosen条件)以确保学习动态收敛至唯一均衡,并保证唯一性。

实验结果

研究问题

  • RQ1在具有玩家依赖动作集的匿名非原子博弈中,虚构博弈能否收敛至纳什均衡?
  • RQ2在单调性条件下,在线镜像下降在这些博弈中是否收敛至均衡?
  • RQ3在何种条件下,成本函数的单调性能保证连续动作匿名博弈中学习动态的收敛性?
  • RQ4学习过程如何适配具有连续路径与分布耦合的一阶平均场博弈?
  • RQ5为确保非原子博弈中经验分布的收敛性,需要哪些拓扑与测度论工具?

主要发现

  • 在单调性条件下,虚构博弈在具有玩家特定动作集的匿名非原子博弈中收敛至纳什均衡。
  • 在相同单调性条件下,在线镜像下降也收敛至纳什均衡,收敛速率取决于Bregman散度的结构。
  • 在一阶平均场博弈中,唯一纳什均衡由耦合的哈密顿-雅可比方程与福克-普朗克方程的解所表征。
  • 在弱收敛下,极限测度相对于动作集对应关系的分解被保持,从而确保均衡策略的一致性。
  • 收敛结果适用于比势博弈更广泛的匿名博弈类别,扩展了对稳定博弈与群体博弈的既有研究。
  • 该框架适用于一阶平均场博弈,其中玩家优化具有固定初始位置的路径,且成本函数依赖于其他玩家的分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。