[论文解读] Mastering the Game of No-Press Diplomacy via Human-Regularized Reinforcement Learning and Planning
本文提出了一种名为 RL-DiL-piKL 的自博弈强化学习框架,通过 DiL-piKL 实现人类正则化的规划,使智能体在合作竞争类游戏中能与人类表现出色。在一场200局无压力版《危机边缘》(Diplomacy)比赛中,使用该方法训练的两个 Diplodocus 智能体取得了最高平均得分,并列第一和第三名,超越了所有参与超过两局的人类玩家。
No-press Diplomacy is a complex strategy game involving both cooperation and competition that has served as a benchmark for multi-agent AI research. While self-play reinforcement learning has resulted in numerous successes in purely adversarial games like chess, Go, and poker, self-play alone is insufficient for achieving optimal performance in domains involving cooperation with humans. We address this shortcoming by first introducing a planning algorithm we call DiL-piKL that regularizes a reward-maximizing policy toward a human imitation-learned policy. We prove that this is a no-regret learning algorithm under a modified utility function. We then show that DiL-piKL can be extended into a self-play reinforcement learning algorithm we call RL-DiL-piKL that provides a model of human play while simultaneously training an agent that responds well to this human model. We used RL-DiL-piKL to train an agent we name Diplodocus. In a 200-game no-press Diplomacy tournament involving 62 human participants spanning skill levels from beginner to expert, two Diplodocus agents both achieved a higher average score than all other participants who played more than two games, and ranked first and third according to an Elo ratings model.
研究动机与目标
- 为解决自博弈强化学习在涉及人类的合作竞争类游戏中的局限性,即仅靠自博弈无法与人类惯例对齐。
- 开发一种规划算法,将奖励最大化策略正则化为人类模仿行为,提升与人类队友协作的泛化能力。
- 将该正则化方法整合进一个自博弈强化学习框架,实现同时学习类人合作与高水平战略玩法。
- 在大规模、多样化的真人比赛中评估所提出的智能体 Diplodocus,以衡量其在真实场景中对高水平人类玩家的表现。
提出的方法
- 提出 DiL-piKL,一种规划算法,将固定的正则化参数 λ 替换为 λ 值的概率分布,从而在推理阶段实现对人类行为更稳健的模仿。
- 引入 RL-DiL-piKL,一种自博弈强化学习算法,结合 DiL-piKL 与策略和价值函数训练,使智能体能够同时学习高水平对局表现和与人类兼容的合作策略。
- 采用基于 Transformer 的策略网络,配合 LSTM 头进行动作选择,通过课程化自博弈与人类数据的演员-评论家强化学习进行训练。
- 采用基于后悔最小化与纳什均衡计算的搜索算法,并通过 DiL-piKL 增强,以平衡探索与对人类惯例的模仿。
- 应用修改后的效用函数,证明在该框架下 DiL-piKL 是一种无遗憾学习算法,确保收敛至最优行为。
- 使用 RL-DiL-piKL 训练 Diplodocus 智能体,超参数经调优以确保稳定性和性能,包括学习率、批量大小和搜索迭代次数。
实验结果
研究问题
- RQ1在合作竞争类游戏中,与人类协作时,使用人类正则化规划训练的强化学习智能体是否能超越纯自博弈训练的智能体?
- RQ2在具有复杂协调需求的多智能体游戏中,将人类模仿整合到规划阶段是否能显著提升智能体性能?
- RQ3一种融合人类行为模型的自博弈强化学习框架,是否能在无压力版《危机边缘》中实现超人类表现,同时保持与人类队友的有效协作?
- RQ4当应用于模仿学习和强化学习训练的策略时,DiL-piKL 与 Hedge 或 RM 等基线搜索方法相比,性能如何?
- RQ5所生成的智能体在真实人类比赛中在多大程度上体现了人类惯例和战略规范?
主要发现
- 在200局无压力版《危机边缘》比赛中,使用 RL-DiL-piKL 训练的两个 Diplodocus 智能体在所有参与超过两局的48名参赛者中取得了最高平均得分。
- 根据贝叶斯 Elo 评分模型,Diplodocus 智能体在比赛中整体排名第二和第四,超越了所有参与超过两局的人类玩家。
- DiL-piKL 仅在应用于 RL-DiL-piKL 训练的策略时显著提升了性能,对纯模仿学习策略则无明显改善,表明该方法需与人类正则化强化学习联合训练。
- 起始国家的实证 Elo 偏差值(如法国 +59,奥地利 -24)与专家共识高度一致,验证了模型捕捉游戏动态与起始位置优势的能力。
- DiL-piKL 中使用 λ 参数的概率分布,相比固定 λ 的替代方案,实现了更稳定、更有效的规划,尤其在复杂协调场景中表现更优。
- 结果表明,即使拥有大规模自博弈数据,人类正则化规划仍是实现在人类-多智能体交互中优异表现的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。