Skip to main content
QUICK REVIEW

[论文解读] Extensive-Form Perfect Equilibrium Computation in Two-Player Games

Gabriele Farina, Nicola Gatti|arXiv (Cornell University)|Nov 15, 2016
Game Theory and Applications参考文献 3被引用 9
一句话总结

本文提出一种基于Lemke方法的路径跟随算法,用于计算双人博弈中的广义形式完美均衡(EFPE)。研究表明,在一般和博弈中,计算EFPE是PPAD完全问题,而在零和博弈中则属于FP类,通过在序列形式中使用符号乘法扰动来处理非完美控制,从而通过线性互补问题实现高效计算。

ABSTRACT

We study the problem of computing an Extensive-Form Perfect Equilibrium (EFPE) in 2-player games. This equilibrium concept refines the Nash equilibrium requiring resilience w.r.t. a specific vanishing perturbation (representing mistakes of the players at each decision node). The scientific challenge is intrinsic to the EFPE definition: it requires a perturbation over the agent form, but the agent form is computationally inefficient, due to the presence of highly nonlinear constraints. We show that the sequence form can be exploited in a non-trivial way and that, for general-sum games, finding an EFPE is equivalent to solving a suitably perturbed linear complementarity problem. We prove that Lemke's algorithm can be applied, showing that computing an EFPE is $ extsf{PPAD}$-complete. In the notable case of zero-sum games, the problem is in $ extsf{FP}$ and can be solved by linear programming. Our algorithms also allow one to find a Nash equilibrium when players cannot perfectly control their moves, being subject to a given execution uncertainty, as is the case in most realistic physical settings.

研究动机与目标

  • 开发一种在双人博弈中计算广义形式完美均衡(EFPE)的计算高效方法。
  • 通过在序列形式中引入符号扰动,将代理形式中的非线性约束问题重新表述,以解决该挑战。
  • 证明在一般和博弈中,EFPE的计算是PPAD完全问题,而在零和博弈中属于FP类。
  • 为在执行不确定性下计算均衡提供一个框架,以建模物理代理中的非完美控制。
  • 通过乘法扰动方法,将现有准完美均衡的计算方法扩展至EFPE。

提出的方法

  • 使用序列形式重新表述EFPE问题,将代理形式中的非线性约束转化为线性互补问题(LCP)。
  • 在序列形式变量的系数上引入符号乘法扰动,以支持路径跟随方法的实现。
  • 对数值扰动后的LCP应用Lemke算法,以计算EFPE,确保每次迭代的时间复杂度为多项式时间。
  • 证明该扰动是有效的,并在扰动参数ε趋近于零时保证解的唯一性。
  • 证明在零和博弈中,LCP可简化为线性规划(LP),从而可通过标准LP求解器在多项式时间内求解。
  • 利用LCP中的基计算,直接从扰动系统解中恢复均衡策略。

实验结果

研究问题

  • RQ1在双人一般和博弈中,能否高效计算广义形式完美均衡?
  • RQ2计算EFPE的问题是否为PPAD完全问题?Lemke算法是否可应用于求解该问题?
  • RQ3如何在均衡计算中捕捉玩家的非完美控制行为——即通过执行不确定性建模?
  • RQ4能否通过序列形式将代理形式中的非线性约束有效转化为计算上可处理的形式?
  • RQ5零和博弈的结构是否允许比一般和博弈更高效的求解?如果是,其计算复杂度为何?

主要发现

  • 在双人一般和博弈中计算EFPE是PPAD完全问题,确立了该问题的计算难度。
  • 在双人零和博弈中,EFPE的计算问题可在多项式时间内求解,因此属于FP复杂度类。
  • 对序列形式系数施加符号乘法扰动,可支持路径跟随算法以计算EFPE。
  • Lemke算法可应用于数值扰动后的LCP,以计算EFPE,且每次迭代的时间复杂度为多项式时间。
  • 该方法可推广至建模执行不确定性下的战略行为,例如在机器人或物理代理中的应用。
  • 该方法通过类似扰动技术,自然地扩展至一般和博弈中准完美均衡的计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。