Skip to main content
QUICK REVIEW

[论文解读] Last-iterate Convergence in Extensive-Form Games

Chung‐Wei Lee, Christian Kroer|arXiv (Cornell University)|Jun 27, 2021
Artificial Intelligence in Games参考文献 45被引用 4
一句话总结

本文在具有完美记忆的两玩家零和广义形式博弈中,建立了乐观后悔最小化算法的最后迭代收敛性,证明了如扩展型乐观乘法权重更新(DOMWU)等算法可线性收敛至纳什均衡,而传统CFR方法依赖平均化处理且收敛缓慢。核心贡献在于通过强凸正则化器与乐观更新,为序列博弈中更快的直接收敛提供了理论基础。

ABSTRACT

Regret-based algorithms are highly efficient at finding approximate Nash equilibria in sequential games such as poker games. However, most regret-based algorithms, including counterfactual regret minimization (CFR) and its variants, rely on iterate averaging to achieve convergence. Inspired by recent advances on last-iterate convergence of optimistic algorithms in zero-sum normal-form games, we study this phenomenon in sequential games, and provide a comprehensive study of last-iterate convergence for zero-sum extensive-form games with perfect recall (EFGs), using various optimistic regret-minimization algorithms over treeplexes. This includes algorithms using the vanilla entropy or squared Euclidean norm regularizers, as well as their dilated versions which admit more efficient implementation. In contrast to CFR, we show that all of these algorithms enjoy last-iterate convergence, with some of them even converging exponentially fast. We also provide experiments to further support our theoretical results.

研究动机与目标

  • 解决在广义形式博弈中,计数反事实后悔最小化(CFR)方法因收敛缓慢及平均化开销带来的问题。
  • 探究乐观后悔最小化算法是否可在具有完美记忆的零和广义形式博弈中实现最后迭代收敛。
  • 为使用强凸正则化器的乐观镜像下降算法建立明确的收敛速率。
  • 确定最后迭代收敛在理论上快于平均迭代收敛的条件。
  • 将近期在正常形式博弈中关于最后迭代收敛的进展,拓展至广义形式博弈。

提出的方法

  • 在具有完美记忆的广义形式博弈的序列形式表示中形式化问题。
  • 应用带有强凸正则化器的乐观在线镜像下降(OMD),包括基础微分熵、平方欧几里得范数及其扩展变体。
  • 利用扩展型熵正则化器实现高效实现,并在纳什均衡唯一性的假设下证明线性收敛。
  • 通过Bregman散度建立收敛性,并利用与博弈相关的常数界定向最优策略的距离。
  • 分析乐观更新的行为,确保最后迭代趋近于纳什均衡,而不仅平均策略。
  • 证明在纳什均衡唯一性假设下,DOMWU等算法可实现指数(线性)收敛速率。

实验结果

研究问题

  • RQ1乐观后悔最小化算法是否可在具有完美记忆的两玩家零和广义形式博弈中实现最后迭代收敛?
  • RQ2像DOMWU这样的算法是否可线性收敛至纳什均衡?在何种条件下?
  • RQ3为何CFR及其变体虽在平均迭代中收敛,但最后迭代却不收敛?
  • RQ4能否将乐观算法的理论收敛速率提升至优于O(1/√T)或O(1/T)?
  • RQ5是否存在理论依据解释为何在实践中,乐观算法的最后迭代性能优于平均策略?

主要发现

  • 所有使用强凸正则化器的乐观后悔最小化算法,包括DOMWU,在具有完美记忆的两玩家零和广义形式博弈中均实现最后迭代收敛。
  • 在纳什均衡唯一性假设下,扩展型乐观乘法权重更新(DOMWU)算法线性收敛至唯一纳什均衡。
  • 相比之下,标准CFR及其变体(如CFR+)即使在经验上也未能实现最后迭代收敛,因其依赖平均化处理。
  • DOMWU的收敛速率被证明为指数(线性),远快于典型后悔最小化算法的O(1/√T)或O(1/T)速率。
  • 理论分析表明,至最优策略的Bregman散度呈指数衰减,这是建立线性收敛性的关键。
  • 尽管DOGDA表现出强劲的实验性能和渐近线性收敛,但由于扩展型欧几里得正则化器的技术挑战,其具体收敛速率仍为开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。