Skip to main content
QUICK REVIEW

[论文解读] Unlocking the Potential of Deep Counterfactual Value Networks

Ryan Zarick, Bryan Pellegrino|arXiv (Cornell University)|Jul 20, 2020
Artificial Intelligence in Games参考文献 42被引用 9
一句话总结

本文提出 Supremus,一种基于深度反事实价值网络(DCFVnet)的扑克 AI,通过改进的反事实遗憾最小化(DCFR+)、更大的训练数据、更精细的动作离散化以及 GPU 优化实现,显著超越 DeepStack。Supremus 以 176 ± 44 个小盲单位/局击败强基准代理 Slumbot,其可被利用性低于 DeepStack,证明当经过充分优化时,DCFVnet 可实现不完美信息博弈中的最先进性能。

ABSTRACT

Deep counterfactual value networks combined with continual resolving provide a way to conduct depth-limited search in imperfect-information games. However, since their introduction in the DeepStack poker AI, deep counterfactual value networks have not seen widespread adoption. In this paper we introduce several improvements to deep counterfactual value networks, as well as counterfactual regret minimization, and analyze the effects of each change. We combined these improvements to create the poker AI Supremus. We show that while a reimplementation of DeepStack loses head-to-head against the strong benchmark agent Slumbot, Supremus successfully beats Slumbot by an extremely large margin and also achieves a lower exploitability than DeepStack against a local best response. Together, these results show that with our key improvements, deep counterfactual value networks can achieve state-of-the-art performance.

研究动机与目标

  • 解决尽管 DCFVnet 在不完美信息博弈中具有理论潜力,但其实际应用仍有限的问题。
  • 识别并解决原始 DeepStack 实现中的性能差距,特别是其对强基准代理 Slumbot 的失败。
  • 改进基于 DCFVnet 的代理的关键组件,包括均衡查找的收敛速度、神经网络的准确性、动作抽象的粒度以及训练数据规模。
  • 证明通过这些改进,DCFVnet 可在无限注德州扑克中实现最先进性能。
  • 建立一个高性能、原生 GPU 的 DCFVnet 流程,以实现在大规模不完美信息博弈中更快更准确的搜索。

提出的方法

  • 重新实现 DeepStack 以识别性能瓶颈,特别是均衡查找和神经网络训练方面的瓶颈。
  • 提出 DCFR+,一种改进的反事实遗憾最小化算法,具有更优的经验收敛速度和更少的遗憾累积。
  • 设计自定义的、完全基于 GPU 加速的 Supremus 实现,使用 CUDA 和 C++,以消除内存传输开销并最大化吞吐量。
  • 针对每个游戏阶段(河牌、转牌、翻牌、前牌)分别训练神经网络,采用分层子博弈求解和大规模数据(河牌网络最多达 5000 万子博弈)。
  • 采用多级动作抽象,使用更精细的下注选项(如 0.33、0.5、0.75 池底大小的下注),相比 DeepStack 的粗粒度离散化更为精细。
  • 使用 Huber 损失作为神经网络的训练目标,其验证损失显著低于 DeepStack,表明价值函数泛化能力更强。

实验结果

研究问题

  • RQ1当关键组件得到改进时,深度反事实价值网络是否能在无限注德州扑克中实现最先进性能?
  • RQ2尽管原始 DeepStack 具有理论优势,为何其未获得广泛采用?
  • RQ3均衡查找收敛性、神经网络准确性和动作抽象粒度的改进在多大程度上提升了 DCFVnet 的性能?
  • RQ4一个 GPU 优化的端到端 DCFVnet 流程是否能超越如 Slumbot 这类成熟的基于抽象的代理?
  • RQ5增加训练数据量和更深的搜索深度如何影响 HUNL 扑克中可被利用性和人机对战表现?

主要发现

  • Supremus 以 176 ± 44 个小盲单位/局击败 Slumbot,后者是顶级非搜索型扑克 AI,也是 2018 年年度计算机扑克竞赛冠军。
  • DeepStack 的重新实现版本以 63 ± 40 个小盲单位/局输给 Slumbot,表明原始 DCFVnet 方法在标准基准下不具备竞争力。
  • Supremus 的可被利用性为 3 mbb/g,显著低于 DeepStack,表明其均衡收敛更优,且对反制策略的脆弱性更低。
  • Supremus 的河牌网络验证 Huber 损失为 0.015,而 DeepStack 对应的(转牌)网络为 0.026,表明其价值函数泛化能力更强。
  • Supremus 的翻牌网络验证 Huber 损失为 0.011,是 DeepStack 的 0.034 的约三分之一,表明其在更深游戏状态下的学习能力更优。
  • Supremus 在单张 GPU 上完成 1000 次 DCFR+ 迭代仅需 0.8 秒,较相同硬件上 DeepStack 的速度提升 6 倍以上,得益于优化的 GPU 内存访问和内核设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。