Skip to main content
QUICK REVIEW

[论文解读] Monte Carlo Continual Resolving for Online Strategy Computation in Imperfect Information Games

Michal Šustr, Vojtěch Kovařík|arXiv (Cornell University)|Dec 18, 2018
Artificial Intelligence in Games参考文献 29被引用 5
一句话总结

本文提出蒙特卡洛持续求解(MCCR),一种适用于不完美信息两玩家零和广义形式博弈(EFG)的领域无关在线策略计算方法。它将持续求解方法从扑克推广至更广泛场景,采用蒙特卡洛反事实遗憾最小化(MCCFR)作为求解器,实现$O(T^{-1/2})$的可被利用性衰减,并在部分领域中优于OOS和IS-MCTS,同时避免了OOS的内存增长问题,且具备理论保证。

ABSTRACT

Online game playing algorithms produce high-quality strategies with a fraction of memory and computation required by their offline alternatives. Continual Resolving (CR) is a recent theoretically sound approach to online game playing that has been used to outperform human professionals in poker. However, parts of the algorithm were specific to poker, which enjoys many properties not shared by other imperfect information games. We present a domain-independent formulation of CR applicable to any two-player zero-sum extensive-form games that works with an abstract resolving algorithm. We further describe and implement its Monte Carlo variant (MCCR) which uses Monte Carlo Counterfactual Regret Minimization (MCCFR) as a resolver. We prove the correctness of CR and show an $O(T^{-1/2})$-dependence of MCCR's exploitability on the computation time. Furthermore, we present an empirical comparison of MCCR with incremental tree building to Online Outcome Sampling and Information-set MCTS on several domains.

研究动机与目标

  • 将持续求解方法从扑克推广至任意两玩家零和广义形式博弈(EFG),且具有不完美信息特性。
  • 开发一种领域无关的在线策略计算框架,避免离线求解器带来的内存与计算负担。
  • 解决现有在线算法(如OOS)的局限性,后者因从游戏起点采样而导致内存增长与高方差问题。
  • 设计一种理论坚实、可扩展的在线算法,可适配多种求解器(包括MCCFR),实现高效在线计算。
  • 在多种不完美信息博弈领域中,对MCCR的性能进行实证评估,对比OOS、IS-MCTS与MCCFR。

提出的方法

  • 提出一种适用于任意两玩家零和广义形式博弈(即使具有复杂公共状态结构与多动作状态)的广义持续求解(CR)框架。
  • 提出蒙特卡洛持续求解(MCCR),作为CR的一种具体实现,其内部求解器采用蒙特卡洛反事实遗憾最小化(MCCFR)。
  • 定义一个求解装置,可动态维护并更新相关信息集的反事实价值估计,从而支持增量式策略计算。
  • 允许将求解器替换为任意EFG求解器,包括经典CFR、基于神经网络的深度有限搜索或领域专用启发式方法。
  • 结合重要性采样与反事实价值估计,维持可被利用性的理论保证,同时支持在线计算。
  • 实现两种变体:MCCR(重置)与MCCR(保留),其区别在于是否在不同游戏状态间保留过往的反事实价值估计。

实验结果

研究问题

  • RQ1持续求解方法能否从扑克推广至任意两玩家零和广义形式博弈(EFG)且具有不完美信息?
  • RQ2MCCR是否保持理论合理性,并在在线策略计算中实现次线性可被利用性衰减?
  • RQ3在多种博弈领域中,MCCR在可被利用性与对弈胜率方面相较于OOS与IS-MCTS的表现如何?
  • RQ4MCCR的性能对反事实价值估计质量的敏感度如何?
  • RQ5是否存在某些博弈类别中,MCCR显著优于现有在线算法(如OOS或IS-MCTS)?

主要发现

  • MCCR实现了可被利用性对计算时间的$O(T^{-1/2})$依赖关系,验证了其理论合理性。
  • 在PTTT领域,MCCR(保留)对MCCFR的胜率为17.7%,优于OOS-PST(−5.6%)与OOS-IST(−3.5%)。
  • 在GP-4644领域,MCCR(保留)对OOS-PST与OOS-IST的胜率均为14.2%;而OOS-PST与OOS-IST对MCCR(保留)的胜率分别低8.1%与8.9%。
  • 当反事实价值估计质量较差时,MCCR的可被利用性收敛速度慢于OOS,且其对弈表现弱于OOS与IS-MCTS。
  • 在GP-4644领域,MCCR(保留)优于MCCFR(14.2% vs. −8.7%);在PTTT领域,MCCR(保留)优于MCCFR(17.7% vs. 0.1%),表明更优的估计可提升策略质量。
  • MCCR无需预计算评估函数,且避免了OOS的内存增长问题,因此在长时间运行的游戏中比OOS更具可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。