Skip to main content
QUICK REVIEW

[论文解读] XDO: A Double Oracle Algorithm for Extensive-Form Games

Stephen McAleer, John B. Lanier|arXiv (Cornell University)|Mar 11, 2021
Reinforcement Learning in Robotics参考文献 26被引用 5
一句话总结

本文提出XDO,一种用于多阶段博弈的新型双Oracle算法,可在与信息状态数量成线性关系的迭代次数内保证收敛至近似纳什均衡——显著优于PSRO,后者可能需要指数级的迭代次数。该方法在每个信息状态而非仅根节点处计算最优回应,其神经网络变体NXDO是首个在高维连续动作序列博弈中找到近似纳什均衡的深度强化学习方法。

ABSTRACT

Policy Space Response Oracles (PSRO) is a reinforcement learning (RL) algorithm for two-player zero-sum games that has been empirically shown to find approximate Nash equilibria in large games. Although PSRO is guaranteed to converge to an approximate Nash equilibrium and can handle continuous actions, it may take an exponential number of iterations as the number of information states (infostates) grows. We propose Extensive-Form Double Oracle (XDO), an extensive-form double oracle algorithm for two-player zero-sum games that is guaranteed to converge to an approximate Nash equilibrium linearly in the number of infostates. Unlike PSRO, which mixes best responses at the root of the game, XDO mixes best responses at every infostate. We also introduce Neural XDO (NXDO), where the best response is learned through deep RL. In tabular experiments on Leduc poker, we find that XDO achieves an approximate Nash equilibrium in a number of iterations an order of magnitude smaller than PSRO. Experiments on a modified Leduc poker game and Oshi-Zumo show that tabular XDO achieves a lower exploitability than CFR with the same amount of computation. We also find that NXDO outperforms PSRO and NFSP on a sequential multidimensional continuous-action game. NXDO is the first deep RL method that can find an approximate Nash equilibrium in high-dimensional continuous-action sequential games. Experiment code is available at https://github.com/indylab/nxdo.

研究动机与目标

  • 解决PSRO在多阶段博弈中因标准形式下策略表示效率低下而导致的指数级迭代复杂度问题。
  • 开发一种直接在多阶段策略上运行的双Oracle算法,通过在每个信息状态混合最优回应来实现。
  • 设计一种神经网络扩展NXDO,能够处理先前深度强化学习方法难以收敛至纳什均衡的高维连续动作序列博弈。
  • 证明XDO在计算量相近的情况下,其可被利用性低于CFR与PSRO,尤其在策略支持稀疏的博弈中表现更优。
  • 建立理论与实证保证,证明XDO的收敛时间与信息状态数量成线性关系,而PSRO在最坏情况下可能呈指数级增长。

提出的方法

  • XDO维护一组纯策略,并仅使用这些策略中的动作构建受限博弈。
  • 在每次迭代中,通过多阶段求解器(如CFR或虚幻博弈)求解受限博弈以获得元纳什均衡,并通过在未见信息状态处任意选择动作将该均衡扩展至完整博弈。
  • 在每个信息状态计算元纳什均衡的最优回应,并将其加入策略集合,从而确保博弈树中各处的局部策略改进。
  • 与仅在根节点混合策略的PSRO不同,XDO允许在每个信息状态进行策略混合,从而实现更高效且精确的策略表示。
  • NXDO用深度强化学习策略网络(如PPO或DDQN)替代精确最优回应,以在大规模或连续动作博弈中学习近似最优回应。
  • NXDO中的受限博弈使用选择策略集合中策略的元动作,并通过类似NFSP的神经网络多阶段博弈求解器求解,从而实现信息状态间的泛化。

实验结果

研究问题

  • RQ1能否在多阶段博弈中设计一种双Oracle算法,使其收敛时间与信息状态数量成线性关系,从而避免PSRO可能存在的指数级复杂度?
  • RQ2在每个信息状态而非仅根节点处混合最优回应,是否能加快收敛速度并降低大规模博弈中的可被利用性?
  • RQ3该算法的深度强化学习变体NXDO能否在高维连续动作序列博弈中有效找到近似纳什均衡?
  • RQ4在修改后的Leduc德州扑克与连续动作博弈中,XDO与PSRO及CFR相比,在可被利用性与样本效率方面表现如何?
  • RQ5在大型或连续动作空间的博弈中,NXDO中神经网络的使用在多大程度上实现了泛化并提升了性能?

主要发现

  • 在Leduc德州扑克中,XDO在7次迭代内即可将可被利用性降至0.1,而PSRO需超过150次迭代才能达到类似水平。
  • 在2-Clone Leduc德州扑克中,XDO因剪枝冗余动作而显著减少访问的游戏状态数,其可被利用性优于CFR+与MCCFR。
  • 在Oshi-Zumo游戏中,XDO优于SDO、CFR+与MCCFR,展现出对多样化博弈结构的鲁棒性。
  • 在2D与16D连续动作损失博弈中,NXDO在性能上优于PSRO与NFSP,其中基于PPO的最优回应学习使高维空间中的收敛成为可能。
  • 在20-Clone Leduc德州扑克中,基于DDQN的最优回应学习的NXDO优于PSRO,尽管由于内层循环经验成本更高,其优势较表格设置下更小。
  • 结果表明,当纳什均衡仅在每个信息状态混合极少数动作时,XDO与NXDO尤为有效,其表现优于CFR与NFSP等在动作数量增加时性能显著下降的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。