Skip to main content
QUICK REVIEW

[论文解读] Discrete-time Risk-sensitive Mean-field Games

Naci Saldı, Tamer Başar|arXiv (Cornell University)|Aug 12, 2018
Stochastic processes and financial applications参考文献 2被引用 5
一句话总结

本文在无限时域折扣成本准则下,通过指数效用函数建模风险敏感性,首次在一般波兰状态空间和动作空间、有界代价函数的条件下,建立了离散时间风险敏感型均场博弈中均场均衡的存在性。证明了在大但有限的群体规模下,均场均衡策略构成一个近似纳什均衡,首次将风险敏感控制扩展至离散时间均场博弈理论。

ABSTRACT

In this paper, we study a class of discrete-time mean-field games under the infinite-horizon risk-sensitive discounted-cost optimality criterion. Risk-sensitivity is introduced for each agent (player) via an exponential utility function. In this game model, each agent is coupled with the rest of the population through the empirical distribution of the states, which affects both the agent's individual cost and its state dynamics. Under mild assumptions, we establish the existence of a mean-field equilibrium in the infinite-population limit as the number of agents ($N$) goes to infinity, and then show that the policy obtained from the mean-field equilibrium constitutes an approximate Nash equilibrium when $N$ is sufficiently large.

研究动机与目标

  • 将均场博弈理论扩展至具有风险敏感代价准则的离散时间系统,其中风险敏感性通过指数效用函数建模。
  • 在一般波兰状态空间和动作空间以及有界单阶段代价的条件下,建立无限群体规模极限下均场均衡的存在性。
  • 证明均场均衡策略在具有大量但有限数量参与者的博弈中构成近似纳什均衡。
  • 弥合连续时间风险敏感型均场博弈与其离散时间对应物之间的差距,后者在很大程度上局限于风险中性设定。

提出的方法

  • 构建一个离散时间均场博弈模型,其中每个参与者的代价和动态依赖于群体状态的经验分布。
  • 通过指数效用函数引入风险敏感性,为每个参与者建立风险敏感的折扣代价准则。
  • 应用纳什确定性等价(NCE)原理,将无限群体博弈分解为一个带分布约束的单参与者随机控制问题。
  • 利用福克-普朗克方程描述极限状态分布的演化,利用汉密尔顿-雅可比-贝尔曼(HJB)方程刻画最优策略。
  • 采用概率测度的弱收敛及一致等度连续性论证,证明经验分布向极限测度的收敛性。
  • 建立在均场均衡策略下,参与者状态经验分布向极限分布收敛,确保一致性。

实验结果

研究问题

  • RQ1在一般波兰状态空间和动作空间以及有界代价函数的条件下,离散时间风险敏感型均场博弈中是否存在均场均衡?
  • RQ2由均场均衡导出的策略能否作为具有大量参与者的有限群体博弈中的近似纳什均衡?
  • RQ3通过指数效用函数建模的风险敏感性,如何影响离散时间均场博弈中均衡的结构与存在性?
  • RQ4在无限群体规模极限下,参与者状态经验分布向极限分布收敛的条件是什么?
  • RQ5转移核和代价函数的性质如何影响均场均衡的稳定性和连续性?

主要发现

  • 本文证明了在一般波兰状态空间和动作空间以及有界单阶段代价的条件下,离散时间风险敏感型均场博弈在无限群体规模极限下存在均场均衡。
  • 证明了均场均衡策略在足够大但有限数量参与者的博弈中构成近似纳什均衡。
  • 通过弱收敛和一致等度连续性论证,建立了参与者状态经验分布向极限分布的收敛性。
  • 证明了值函数族和转移核族具有一致有界性和等度连续性,确保了极限下的稳定性。
  • 证明依赖于第一参与者状态经验分布向极限分布的一致收敛,这是验证NCE原理的关键步骤。
  • 该结果在较弱假设下成立,包括代价函数有界性,以及在均场项中转移核和代价函数的连续性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。