[论文解读] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning
DouZero 是一种基于自我博弈的深度强化学习智能体,能够掌握 DouDizhu 这款复杂的三人斗地主纸牌游戏。该游戏具有不完美信息和庞大的动作空间。通过结合蒙特卡洛树搜索与深度神经网络,采用卡牌矩阵的动作编码方式,并进行并行自我博弈训练,DouZero 实现了超人类水平的表现——在 Botzone 排行榜上 344 个智能体中排名第一——且无需依赖人工设计的抽象化方法或领域特定启发式规则。
Games are abstractions of the real world, where artificial agents learn to compete and cooperate with other agents. While significant achievements have been made in various perfect- and imperfect-information games, DouDizhu (a.k.a. Fighting the Landlord), a three-player card game, is still unsolved. DouDizhu is a very challenging domain with competition, collaboration, imperfect information, large state space, and particularly a massive set of possible actions where the legal actions vary significantly from turn to turn. Unfortunately, modern reinforcement learning algorithms mainly focus on simple and small action spaces, and not surprisingly, are shown not to make satisfactory progress in DouDizhu. In this work, we propose a conceptually simple yet effective DouDizhu AI system, namely DouZero, which enhances traditional Monte-Carlo methods with deep neural networks, action encoding, and parallel actors. Starting from scratch in a single server with four GPUs, DouZero outperformed all the existing DouDizhu AI programs in days of training and was ranked the first in the Botzone leaderboard among 344 AI agents. Through building DouZero, we show that classic Monte-Carlo methods can be made to deliver strong results in a hard domain with a complex action space. The code and an online demo are released at https://github.com/kwai/DouZero with the hope that this insight could motivate future work.
研究动机与目标
- 开发一个强大的 DouDizhu AI 智能体,该款游戏是具有不完美信息和庞大动态动作空间的挑战性三人回合制纸牌游戏。
- 克服传统强化学习算法(如 DQN 和 A3C)在大动作空间中因过估计和泛化能力差而产生的局限性。
- 消除对人工设计的启发式规则或动作抽象(如踢手网络或分解规则)的依赖,这些方法容易出错且计算成本高。
- 证明经典蒙特卡洛方法可通过深度学习显著增强,从而在复杂高维游戏环境中实现优异表现。
- 仅使用单台服务器和四块 GPU,从零开始通过自我博弈训练智能体,在远短于以往方法所需的时间内实现超人类水平表现。
提出的方法
- 采用并行智能体的自我博弈强化学习框架,高效生成多样化的游戏轨迹。
- 通过深度神经网络增强蒙特卡洛树搜索(MCTS),利用原始卡牌状态预测策略函数和价值函数。
- 将动作编码为卡牌矩阵(例如表示对子、顺子及组合),使模型能够泛化至未见过的合法动作。
- 使用残差卷积神经网络处理手牌并编码动作表征,提升泛化能力并减少过估计偏差。
- 在自我博弈过程中应用加权策略(WP)目标,以稳定学习并改善策略收敛性。
- 从零开始端到端训练智能体,仅依赖游戏规则和自我博弈,无需任何人类演示或启发式先验知识。
实验结果
研究问题
- RQ1一个基于自我博弈的深度强化学习智能体是否能在不依赖人工设计动作抽象的前提下,实现 DouDizhu 中的超人类水平表现?
- RQ2神经网络增强的蒙特卡洛树搜索在处理 DouDizhu 中庞大且动态的动作空间方面效果如何?
- RQ3通过卡牌矩阵进行动作编码在复杂纸牌游戏中对稀有或未见过的合法移动的泛化能力提升程度如何?
- RQ4在单台服务器配备四块 GPU 的条件下从零开始训练的系统,是否能超越依赖复杂启发式规则或贝叶斯推理的现有 AI 智能体?
- RQ5在不完美信息、团队合作的纸牌游戏中,缺乏领域特定抽象是否能带来更鲁棒和泛化能力更强的策略?
主要发现
- DouZero 在仅训练数天后即超越所有现有 DouDizhu AI 程序,在 Botzone 排行榜上 344 个智能体中排名第一。
- 在训练半天内,该智能体对强基线模型(包括 CQN 和基于启发式规则的智能体)的胜率超过 90%。
- DouZero 的表现超越了此前 SOTA 智能体 DeltaDou,后者需超过两个月的训练时间,且依赖贝叶斯推理和启发式踢手规则。
- 该模型展现出强大的泛化能力,通过其动作编码机制有效处理了罕见或未见过的卡牌组合。
- 该系统在不使用任何人工设计抽象的前提下实现了超人类水平表现,完全依赖自我博弈和神经网络策略/价值网络。
- 采用卡牌矩阵编码使智能体能够泛化至训练中不常出现的动作,相较于标准 DQN 方法,有效降低了过估计偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。