Skip to main content
QUICK REVIEW

[论文解读] Mastering Strategy Card Game (Legends of Code and Magic) via End-to-End Policy and Optimistic Smooth Fictitious Play

Wei Xi, Yongxin Zhang|arXiv (Cornell University)|Mar 7, 2023
Artificial Intelligence in Games被引用 5
一句话总结

本文提出了一种端到端深度强化学习策略以及一种乐观平滑虚假参与法(OSFP)算法,以掌握双阶段策略集换卡游戏《代码与魔法传说》。通过将深度强化学习作为OSFP中的平滑最佳响应求解器,该方法实现了纳什均衡收敛,并在COG2022竞赛的两个赛道中均获得第一名,展示了在多阶段游戏设置中的强大性能。

ABSTRACT

Deep Reinforcement Learning combined with Fictitious Play shows impressive results on many benchmark games, most of which are, however, single-stage. In contrast, real-world decision making problems may consist of multiple stages, where the observation spaces and the action spaces can be completely different across stages. We study a two-stage strategy card game Legends of Code and Magic and propose an end-to-end policy to address the difficulties that arise in multi-stage game. We also propose an optimistic smooth fictitious play algorithm to find the Nash Equilibrium for the two-player game. Our approach wins double championships of COG2022 competition. Extensive studies verify and show the advancement of our approach.

研究动机与目标

  • 解决观察空间与动作空间在不同阶段有所差异的多阶段策略游戏挑战,例如《代码与魔法传说》。
  • 开发一种端到端策略,将卡组构建与战斗阶段统一为单一可训练策略。
  • 设计一种乐观平滑虚假参与法(OSFP)算法,以在大规模双人零和游戏中高效收敛至纳什均衡。
  • 通过大量实验与竞赛基准验证该方法的优越性。

提出的方法

  • 提出一种乐观平滑虚假参与法(OSFP)算法,将深度强化学习作为平滑最佳响应求解器,并为双人零和游戏提供最后一迭代收敛保证。
  • 在博弈树空间中将策略表示为树形结构(treeplexes),实现对多个决策阶段策略的表示,并满足概率质量约束。
  • 采用变分不等式(VI)公式表达纳什均衡为最佳响应算子的不动点,从而实现高效优化。
  • 采用双线性收益函数 $ u(x,y) = x^T A y $,其中 $ A $ 为收益矩阵,并为VI优化定义收益向量 $ F(z) = (Ay, -A^T x)^T $。
  • 在推理阶段引入温度缩放与argmax推理策略以提升动作选择性能,其中 $ \tau = 0^+ $ 时胜率提升至53%,优于 $ \tau = 1.0 $。
  • 评估了采用参数化扩展策略(p, n, m)的蒙特卡洛树搜索(MCTS),发现更高的扩展深度与持续时间可提升胜率,但降低样本效率。

实验结果

研究问题

  • RQ1端到端深度强化学习策略是否能有效统一双阶段策略集换卡游戏中的卡组构建与战斗阶段?
  • RQ2所提出的乐观平滑虚假参与法(OSFP)算法是否能在大规模、多阶段游戏中实现最后一迭代收敛至纳什均衡?
  • RQ3在相同计算与时间预算下,基于MCTS的规划方法与纯端到端无模型训练方法在该游戏中表现如何比较?
  • RQ4后处理技术如温度缩放与单回合必杀(OTK)在多大程度上提升了策略性能?
  • RQ5所提方法是否能在COG2022等竞赛基准中超越基于规则或分阶段处理的方法?

主要发现

  • 所提方法在COG2022竞赛的LoCM 1.5与LoCM 1.2两个赛道中均获得第一名,展现出强大的竞技表现。
  • 推理阶段采用温度缩放 $ \tau = 0^+ $ 使胜率提升至53%,优于 $ \tau = 1.0 $,表明动作选择精度得到改善。
  • 在相同资源预算下,采用参数 (0.00025, 400, 40) 的MCTS实现对基线的56%胜率,表明更深层次规划带来性能增益。
  • 当以实际运行时间衡量时,MCTS带来的性能增益随时间推移而减弱,表明规划质量与样本效率之间存在权衡。
  • 从竞争队伍中移除OTK规则后其胜率下降2%,表明OTK是强有力的基于规则启发式策略;然而,其对我们模型的影响微乎其微,表明模型具备更优越的血量计算能力。
  • 广泛的消融实验与对比研究证实,端到端策略与OSFP框架相较于基线方法与基于规则的方法,持续且可度量地实现了性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。