Skip to main content
QUICK REVIEW

[论文解读] Efficient Deviation Types and Learning for Hindsight Rationality in Extensive-Form Games

Dustin Morrill, Ryan D'Orazio|arXiv (Cornell University)|Feb 13, 2021
Artificial Intelligence in Games参考文献 47被引用 9
一句话总结

本文提出广义形式后悔最小化(EFR),一种在广义形式博弈中实现事后理性学习的高效算法,支持任意行为偏离集合。EFR 实现了次线性后悔,计算复杂度与偏离复杂度紧密相关,并识别出部分序列偏离类型,可在中等长度博弈中保持可处理性的同时实现优异性能——通常与完整行为偏离性能相当。

ABSTRACT

Hindsight rationality is an approach to playing general-sum games that prescribes no-regret learning dynamics for individual agents with respect to a set of deviations, and further describes jointly rational behavior among multiple agents with mediated equilibria. To develop hindsight rational learning in sequential decision-making settings, we formalize behavioral deviations as a general class of deviations that respect the structure of extensive-form games. Integrating the idea of time selection into counterfactual regret minimization (CFR), we introduce the extensive-form regret minimization (EFR) algorithm that achieves hindsight rationality for any given set of behavioral deviations with computation that scales closely with the complexity of the set. We identify behavioral deviation subsets, the partial sequence deviation types, that subsume previously studied types and lead to efficient EFR instances in games with moderate lengths. In addition, we present a thorough empirical analysis of EFR instantiated with different deviation types in benchmark games, where we find that stronger types typically induce better performance.

研究动机与目标

  • 为一般和博弈中的广义形式博弈(EFGs)开发一个可扩展的框架,其中理性通过相对于策略变换(偏离)的后悔来衡量,而非前瞻性最优性。
  • 通过识别保持强性能的高效偏离子集,解决在广义形式博弈中使用所有行为偏离的计算不可行性问题。
  • 形式化尊重广义形式博弈结构的行为偏离,并将时间选择整合进反事实后悔最小化(CFR),以创建一个通用且可扩展的算法。
  • 为 EFR 在新部分序列偏离类型下的实例化提供理论后悔边界,并通过实证验证,显示其性能优于先前方法。

提出的方法

  • 提出 EFR(广义形式后悔最小化),作为 CFR 的推广,支持在决策点处分解为动作变换的任意行为偏离集合。
  • 引入四种新型部分序列偏离类型——TIPS、CSPS、BPS 和 CF,它们涵盖先前研究的类型(外部、因果、动作、反事实),并实现 EFR 的高效计算。
  • 将时间选择整合进 CFR,以实现可观测的序列理性,确保反事实偏离和部分序列偏离分别涵盖外部偏离和因果偏离。
  • 为每种新偏离类型下的 EFR 推导出次线性后悔边界,证明在事后理性框架下的理论收敛保证。
  • 实现不同偏离类型的 EFR,并在 OpenSpiel 的基准博弈中评估其性能,比较学习曲线和胜率。
  • 探讨未来扩展方向,如固定份额预测和上下文树加权技术,以平衡后悔边界复杂度与计算成本。

实验结果

研究问题

  • RQ1能否设计一种通用的后悔最小化算法,以实现广义形式博弈中任意行为偏离集合的事后理性?
  • RQ2哪些行为偏离子集可在中等长度博弈中实现 EFR 的高效计算,同时保持强性能?
  • RQ3在基准博弈中,不同偏离类型(如 TIPS、CSPS、BHV)在后悔边界和实证性能方面如何比较?
  • RQ4在 EFR 中使用更强的偏离类型时,计算效率与性能之间的权衡如何?
  • RQ5EFR 是否可扩展为与最优偏离的复杂度相关,而非整个偏离集合的规模?

主要发现

  • 使用最强部分序列偏离类型(TIPS)的 EFR 通常与使用完整行为偏离集合(BHv)的 EFR 表现几乎相当,在 Sheriff 博弈中达到 0.91 胜率,在三人 Goofspiel 中达到 0.87。
  • 更强的偏离类型始终带来更好的性能:BHv 在 Goofspiel(固定)中达到 0.63 胜率,而最弱的 ACT 类型仅达 0.51,显示出清晰的性能梯度。
  • 在三人 Goofspiel 且牌堆递减的设定中,CF 和 BPS 偏离在收敛前的早期回合表现优于其他类型,表明其对博弈结构和初始条件的敏感性。
  • 学习曲线显示,更强的偏离类型导致策略更新更慢,表明性能与计算速度之间存在权衡。
  • 相对于反事实偏离,TIPS EFR 的后悔边界大于 CFR,但 TIPS EFR 仍累积更多奖励,表明尽管理论成本更高,其实际表现仍更优。
  • 实证结果证实,使用部分序列偏离的 EFR 实现了次线性后悔和可观测的序列理性,验证了理论框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。