Skip to main content
QUICK REVIEW

[论文解读] Student of Games: A unified learning algorithm for both perfect and imperfect information games

Martin Schmid, Matej Moravčík|arXiv (Cornell University)|Dec 6, 2021
Artificial Intelligence in Games被引用 8
一句话总结

Student of Games (SoG) 是一种统一的学习算法,结合了引导式搜索、自我对弈强化学习以及博弈论推理,在完全信息与不完全信息游戏中均实现了优异表现。该算法收敛至近似最优策略,在国际象棋、围棋、无注额德州扑克以及苏格兰场游戏中超越了以往的智能体,展现出在多种游戏类型间强大的泛化能力,且仅需极少的领域特定设计。

ABSTRACT

Games have a long history as benchmarks for progress in artificial intelligence. Approaches using search and learning produced strong performance across many perfect information games, and approaches using game-theoretic reasoning and learning demonstrated strong performance for specific imperfect information poker variants. We introduce Student of Games, a general-purpose algorithm that unifies previous approaches, combining guided search, self-play learning, and game-theoretic reasoning. Student of Games achieves strong empirical performance in large perfect and imperfect information games -- an important step towards truly general algorithms for arbitrary environments. We prove that Student of Games is sound, converging to perfect play as available computation and approximation capacity increases. Student of Games reaches strong performance in chess and Go, beats the strongest openly available agent in heads-up no-limit Texas hold'em poker, and defeats the state-of-the-art agent in Scotland Yard, an imperfect information game that illustrates the value of guided search, learning, and game-theoretic reasoning.

研究动机与目标

  • 开发一种通用算法,统一整合自我对弈学习、引导式搜索与博弈论推理,适用于完全信息与不完全信息游戏。
  • 解决现有算法通常仅针对完全信息或不完全信息游戏设计,而难以同时适用于两类游戏的缺陷。
  • 在包括国际象棋、围棋、扑克和苏格兰场在内的多样化、大规模游戏中实现优异的实证性能,且不依赖大量领域特定知识。
  • 证明该算法在计算资源与近似能力提升时,能够收敛至近似最优策略。
  • 通过单一算法框架在不同游戏类型间实现泛化,推动真正通用的强化学习智能体的发展。

提出的方法

  • SoG 采用增长树反事实遗憾最小化(GT-CFR),一种任意时间的局部搜索方法,非均匀地扩展子博弈,以聚焦于最相关未来的状态。
  • 它使用可靠的自我对弈学习,利用游戏结果和过往搜索轨迹中的递归子搜索来训练价值网络与策略网络。
  • 该算法通过重新求解子博弈,整合博弈论推理,以在在线对弈过程中保持策略的一致性与低可被利用性。
  • 它应用神经网络实现价值函数与策略函数,通过结合搜索经验的自我对弈进行训练,实现高效的样本学习。
  • SoG 利用递归搜索与价值网络自举机制,提升长时域游戏(如苏格兰场)中的规划深度与策略质量。
  • 该框架基于因子化观测随机博弈(FOSG)形式化,支持对机会节点与决策节点的建模。

实验结果

研究问题

  • RQ1一个单一算法能否有效结合引导式搜索、自我对弈学习与博弈论推理,以掌握完全信息与不完全信息游戏?
  • RQ2随着计算资源与模型容量的增加,该算法是否能收敛至近似最优策略?
  • RQ3SoG 是否能在不进行显著架构或超参数调整的前提下,泛化至包括国际象棋、围棋、扑克与苏格兰场在内的多样化游戏类型?
  • RQ4在具有长规划时域与隐藏信息的游戏场景中,SoG 的性能与最先进智能体相比如何?
  • RQ5搜索质量与自我对弈学习对可被利用性与最终策略强度有何影响?

主要发现

  • 在国际象棋中,SoG 对 AlphaZero 的相对等级分达到 +1970(s=16k,t=800k),展现了在完全信息游戏中的强大表现。
  • 在围棋中,SoG 的相对等级分达到 +2025(非递归)与 +1838(递归查询),优于多个 AlphaZero 配置。
  • 在两人无注额德州扑克中,SoG 击败了目前公开可用的最强智能体,展现了在不完全信息环境中的优越性。
  • 在苏格兰场(一种长时域不完全信息游戏)中,SoG 超越了最先进智能体,凸显了引导式搜索与长期规划的价值。
  • 在可计算的小型游戏中,SoG 展现出极低的可被利用性,证实了其正确性与收敛至近似纳什均衡的能力。
  • 该算法在不同超参数设置下表现出稳健性,性能在不同搜索模拟与训练步数间保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。