Skip to main content
QUICK REVIEW

[论文解读] Learning to Correlate in Multi-Player General-Sum Sequential Games

Andrea Celli, Alberto Marchesi|arXiv (Cornell University)|Oct 14, 2019
Experimental Behavioral Economics Studies被引用 20
一句话总结

本文提出 CFR-Jr,一种用于计算多玩家、一般和序贯博弈中粗相关均衡(CCEs)的新型后悔最小化算法。通过在固定间隔内整合联合策略重构,CFR-Jr 实现了对 CCE 的次线性后悔收敛——理论与实证均证明其速度优于先前的 CFR-S 算法及最先进算法,同时保持计算效率与可扩展性。

ABSTRACT

In the context of multi-player, general-sum games, there is an increasing interest in solution concepts modeling some form of communication among players, since they can lead to socially better outcomes with respect to Nash equilibria, and may be reached through learning dynamics in a decentralized fashion. In this paper, we focus on coarse correlated equilibria (CCEs) in sequential games. First, we complete the picture on the complexity of finding social-welfare-maximizing CCEs by showing that the problem is not in Poly-APX unless P = NP. Furthermore, simple arguments show that CFR - working with behavioral strategies - may not converge to a CCE. However, we devise a simple variant (CFR-S) which provably converges to the set of CCEs, but may be empirically inefficient. Thus, we design a variant of the CFR algorithm (called CFR-Jr) which approaches the set of CCEs with a regret bound sub-linear in the size of the game, and is shown to be dramatically faster than CFR-S and the state-of-the-art algorithms to compute CCEs.

研究动机与目标

  • 解决多玩家、一般和序贯博弈中计算粗相关均衡(CCEs)的高效、去中心化算法缺乏的问题。
  • 克服标准 CFR 算法在一般和博弈设置下收敛至行为策略均衡而非 CCE 的局限性。
  • 设计一种学习算法,可证明在博弈树规模上以次线性后悔收敛至 CCE。
  • 通过在算法中支持可配置的联合分布重构频率,平衡计算效率与解的质量。
  • 实证表明,CFR-Jr 在收敛速度与运行时间上优于 CFR-S 及现有最先进算法。

提出的方法

  • 提出 CFR-S,一种计谋后悔最小化(CFR)的变体,通过在每次迭代中重构标准形式策略,可证明收敛至 CCE 集合。
  • 提出 CFR-Jr 作为 CFR-S 的优化变体,每隔 k 次迭代执行一次联合分布重构,降低计算开销。
  • 使用联合策略重构过程将行为策略转换为标准形式策略,确保收敛至 CCE。
  • 在信息集上应用后悔最小化动态,保持局部后悔最小化,同时通过标准形式策略的乘积实现全局 CCE 收敛。
  • 实现加权平均机制以计算平均联合策略,确保以次线性后悔收敛至 CCE。
  • 引入 CFR-Jr-k 作为可配置变体,支持在重构频率、运行时间与联合策略支持大小之间进行权衡。

实验结果

研究问题

  • RQ1能否设计一种后悔最小化算法,使其在多玩家、一般和序贯博弈中可证明收敛至粗相关均衡(CCEs)?
  • RQ2在三名或以上玩家的序贯博弈中,寻找社会福利最大化的 CCE 的计算复杂度是多少?
  • RQ3如何高效地将联合策略重构集成到 CFR 风格算法中,以确保 CCE 收敛,同时避免过度计算成本?
  • RQ4在 CCE 计算算法中,重构频率、收敛速度与存储需求之间存在何种权衡?
  • RQ5经过修改的 CFR 算法在实践中能否实现比 CFR-S 及最先进 CCE 计算方法更快的收敛速度?

主要发现

  • 在三名或以上玩家的序贯博弈中,计算社会福利最大化的 CCE 问题不属于 Poly-APX,除非 P = NP,这确立了强烈的不可近似性结果。
  • CFR-S 在理论上被证明可收敛至 CCE 集合,但因每次迭代均进行完整重构,实证效率低下。
  • CFR-Jr 在博弈树规模上实现了次线性后悔,实验表明其收敛速度显著快于 CFR-S 及现有最先进算法。
  • 实证结果表明,CFR-Jr 采用更高重构频率(如每 1–5 次迭代)可减少运行时间,同时保持强收敛性;而较低频率则能更快收敛至低 epsilon 解。
  • 平均联合策略的支持大小随重构频率增加而增大,较低的 k 值因更高频的策略更新,存储需求最高可达十倍。
  • 在 Kuhn3-6 和 Kuhn3-10 博弈实例中,CFR-Jr 在迭代次数与实际运行时间上均优于基线方法,展现出实际优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。