[论文解读] Combinational Q-Learning for Dou Di Zhu
本文提出组合Q学习(CQL),一种用于中国纸牌游戏斗地主的两阶段深度强化学习方法,该方法具有庞大的组合动作空间。通过使用具有顺序不变最大池化的分解提议网络(DPN)和移动提议网络(MPN),CQL减少了动作空间并建模了复杂的卡牌关系,在无需人类示范或先验知识的情况下实现了人类水平的表现。
Deep reinforcement learning (DRL) has gained a lot of attention in recent years, and has been proven to be able to play Atari games and Go at or above human levels. However, those games are assumed to have a small fixed number of actions and could be trained with a simple CNN network. In this paper, we study a special class of Asian popular card games called Dou Di Zhu, in which two adversarial groups of agents must consider numerous card combinations at each time step, leading to huge number of actions. We propose a novel method to handle combinatorial actions, which we call combinational Q-learning (CQL). We employ a two-stage network to reduce action space and also leverage order-invariant max-pooling operations to extract relationships between primitive actions. Results show that our method prevails over state-of-the art methods like naive Q-learning and A3C. We develop an easy-to-use card game environments and train all agents adversarially from sractch, with only knowledge of game rules and verify that our agents are comparative to humans. Our code to reproduce all reported results will be available online.
研究动机与目标
- 为解决斗地主中动作数量随手牌大小呈指数级增长的组合动作空间挑战。
- 建模复杂动作关系——即某一动作的价值依赖于未来行动和卡牌组合——超越简单的动作价值估计。
- 仅使用游戏规则从零开始训练智能体,无需人类示范或领域特定先验知识。
- 在部分可观测、信息不对称的纸牌游戏中实现与人类专家相当的性能。
提出的方法
- CQL采用两阶段网络结构:分解提议网络(DPN)利用顺序不变的最大池化技术,选择有前景的卡牌分组。
- 移动提议网络(MPN)随后从分解后的动作集中选择最终可执行的动作,从而在每一层减少动作空间。
- 一种新颖的一维卷积卡牌表征方法有效编码手牌特征,捕捉相关卡牌点数和花色。
- 顺序不变的最大池化操作提取原始动作之间的关系特征,实现在不同卡牌组合间的泛化能力。
- 该方法采用仅基于游戏规则的自我对弈训练,避免使用人类数据或手工设计的启发式规则。
- 在DPN中对分解方案进行随机采样,以确保探索性,同时保持计算可行性。
实验结果
研究问题
- RQ1深度强化学习能否有效处理斗地主中因每个动作都是玩家手牌子集而导致的动作组合爆炸问题?
- RQ2在深度Q学习框架中,如何建模动作关系,特别是当前动作与未来动作之间的相互依赖性?
- RQ3仅使用游戏规则从零开始训练的智能体是否能在复杂且信息不对称的纸牌游戏中达到人类水平的表现?
- RQ4分层结构与顺序不变神经组件在组合动作空间中在多大程度上能提升样本效率与性能?
主要发现
- 当作为地主时,基于CQL的智能体在对阵人类玩家时取得了30%的胜率,表明其在更具挑战性的角色中表现强劲。
- 当作为农民时,CQL智能体在对阵人类对手的比赛中赢得了60%的游戏,表明其在团队合作与策略方面表现更优。
- 智能体展现出自发协作行为:两名农民智能体在无监督情况下学会了协调,例如通过战略性出牌控制游戏节奏。
- CQL在对抗性训练中优于基线方法(如朴素DQN和A3C),证实其在处理大规模动作空间方面的有效性。
- 该方法在不使用人类数据的情况下实现了人类水平的表现,完全依赖游戏规则与自我对弈训练。
- 表2中的对局记录显示,CQL智能体在真实对局中成功实现了协同配合,例如一名农民打出*,$以传递控制信号,从而促成制胜组合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。