Skip to main content
QUICK REVIEW

[论文解读] Multiplayer Performative Prediction: Learning in Decision-Dependent Games

Adhyyan Narang, Evan Faulkner|arXiv (Cornell University)|Jan 10, 2022
Advanced Bandit Algorithms Research被引用 6
一句话总结

本文提出多玩家行为预测(multi-player performative prediction),一种博弈论框架,用于建模竞争性机器学习场景中决策依赖的数据分布。该研究建立了重复微调和梯度方法收敛至行为稳定均衡的条件,并提供了强单调性的充分条件,使得可通过自适应和无导数算法高效计算纳什均衡。实验表明,战略性建模在网约车和贷款市场中能改善结果。

ABSTRACT

Learning problems commonly exhibit an interesting feedback mechanism wherein the population data reacts to competing decision makers' actions. This paper formulates a new game theoretic framework for this phenomenon, called "multi-player performative prediction". We focus on two distinct solution concepts, namely (i) performatively stable equilibria and (ii) Nash equilibria of the game. The latter equilibria are arguably more informative, but can be found efficiently only when the game is monotone. We show that under mild assumptions, the performatively stable equilibria can be found efficiently by a variety of algorithms, including repeated retraining and the repeated (stochastic) gradient method. We then establish transparent sufficient conditions for strong monotonicity of the game and use them to develop algorithms for finding Nash equilibria. We investigate derivative free methods and adaptive gradient algorithms wherein each player alternates between learning a parametric description of their distribution and gradient steps on the empirical risk. Synthetic and semi-synthetic numerical experiments illustrate the results.

研究动机与目标

  • 建模机器学习中的策略反馈,其中数据分布会因多个决策者的行为而改变。
  • 形式化一种新的博弈论框架——多玩家行为预测,用于分析此类交互式、决策依赖的学习问题。
  • 分析两种解概念:行为稳定均衡(在重复微调中常见)和纳什均衡(更具信息量但更难计算)。
  • 建立强单调性的充分条件,使能通过基于梯度和无导数的方法高效计算纳什均衡。
  • 通过实证证明,建模行为效应可显著提升网约车和贷款市场等竞争性场景中的结果。

提出的方法

  • 提出一种博弈论模型,其中每位玩家的数据分布依赖于所有玩家的行为,从而捕捉学习中的策略反馈。
  • 将行为稳定均衡定义为重复微调的不动点,并在光滑性、凸性和利普希茨条件下证明其存在性与唯一性。
  • 分析重复微调和(随机)梯度方法收敛至行为稳定均衡的性质,其有限时间迭代复杂度与单玩家场景下的最先进结果一致。
  • 推导出游戏强单调性的透明充分条件,从而实现纳什均衡的高效计算。
  • 开发无导数和自适应梯度算法,玩家在学习参数化分布与通过经验风险梯度更新之间交替进行。
  • 采用固定步长的随机梯度下降来计算均衡,并在实验中对比短视与非短视更新策略。

实验结果

研究问题

  • RQ1在多玩家决策依赖学习中,重复微调在何种条件下会收敛至行为稳定均衡?
  • RQ2在多玩家行为预测博弈中,纳什均衡在何种条件下可被高效计算?
  • RQ3战略性建模及对竞争对手行为的意识如何影响竞争性学习场景中的结果?
  • RQ4在因竞争导致数据分布变化时,忽略行为效应的实证后果是什么?
  • RQ5在网约车市场等现实应用中,将行为反馈纳入梯度更新对收入和需求有何影响?

主要发现

  • 在温和的光滑性、凸性和利普希茨假设下,行为稳定均衡存在且唯一,可通过重复微调和梯度方法高效求解。
  • 基于梯度的方法寻找行为稳定均衡的迭代复杂度降低至与单玩家场景下最先进的保证相当。
  • 推导出强单调性的充分条件,使能通过自适应和无导数算法高效计算纳什均衡。
  • 在网约车实验中,尽管大多数地点需求下降,但建模行为效应使双方玩家的收入均提高,原因在于均衡时定价上升。
  • 当至少一名玩家部分短视(意识到自身影响但未意识到对手影响)时,纳什均衡下双方收入高于完全短视情形。
  • 当另一名玩家完全短视时,非短视玩家在纳什均衡下反而更差,表明战略性意识对实现最优结果至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。