Skip to main content
QUICK REVIEW

[论文解读] Learning to Play No-Press Diplomacy with Best Response Policy Iteration

Thomas Anthony, Tom Eccles|arXiv (Cornell University)|Jun 8, 2020
Artificial Intelligence in Games参考文献 108被引用 18
一句话总结

本文提出了一种基于采样最优响应(SBR)的新型策略迭代框架,用于训练深度强化学习智能体在无压力外交(No-Press Diplomacy)中的表现。无压力外交是一款具有7名玩家、同时行动、大规模组合动作空间的挑战性游戏。该方法在自对弈和基于种群的评估中均显著优于先前的最先进智能体,游戏理论分析进一步证实其可被利用性降低。

ABSTRACT

Recent advances in deep reinforcement learning (RL) have led to considerable progress in many 2-player zero-sum games, such as Go, Poker and Starcraft. The purely adversarial nature of such games allows for conceptually simple and principled application of RL methods. However real-world settings are many-agent, and agent interactions are complex mixtures of common-interest and competitive aspects. We consider Diplomacy, a 7-player board game designed to accentuate dilemmas resulting from many-agent interactions. It also features a large combinatorial action space and simultaneous moves, which are challenging for RL algorithms. We propose a simple yet effective approximate best response operator, designed to handle large combinatorial action spaces and simultaneous moves. We also introduce a family of policy iteration methods that approximate fictitious play. With these methods, we successfully apply RL to Diplomacy: we show that our agents convincingly outperform the previous state-of-the-art, and game theoretic equilibrium analysis shows that the new process yields consistent improvements.

研究动机与目标

  • 开发一种适用于大规模组合动作空间和同时行动的多智能体游戏的可扩展强化学习方法,例如外交游戏。
  • 解决先前强化学习方法在非零和、多玩家游戏中合作与竞争并存时的局限性。
  • 设计一种近似最优响应算子,有效应对外交游戏动作空间的复杂性及回合制同时行动的特性。
  • 应用近似虚构博弈和迭代最优响应的策略迭代方法于多智能体环境。
  • 通过自对弈和基于种群的评估,实证验证该方法的优越性能。

提出的方法

  • 提出采样最优响应(SBR),一种专为大规模组合动作空间和同时行动设计的可扩展近似最优响应算子。
  • 引入策略迭代变体,近似多智能体环境中虚构博弈和迭代最优响应。
  • 使用图神经网络(GNN)表示游戏状态和策略,初始参数通过人类对弈数据集的模仿学习获得。
  • 采用正则化策略优化目标,结合熵正则化以促进探索和稳定性。
  • 应用游戏理论均衡分析,评估收敛性和可被利用性的改进。
  • 使用少样本可被利用性度量,量化并减少智能体被利用的脆弱性。

实验结果

研究问题

  • RQ1深度强化学习能否成功应用于无压力外交这一7名玩家、大规模组合动作空间和同时行动的游戏?
  • RQ2所提出的基于SBR的策略迭代框架是否在外交游戏中持续优于先前的最先进智能体?
  • RQ3该方法在少样本可被利用性度量下,可被利用性降低的程度如何?
  • RQ4在多玩家、混合动机环境中,策略迭代方法在多大程度上近似了虚构博弈和迭代最优响应?
  • RQ5尽管先前的强化学习微调失败,模仿学习与基于SBR的策略迭代结合是否能在外交游戏中实现更优性能?

主要发现

  • 所提出的智能体在一对一对弈和基于种群的评估中,显著优于先前的最先进DipNet智能体。
  • 该方法在游戏理论均衡分析中实现一致改进,表明其可被利用性降低,战略行为更具鲁棒性。
  • 少样本可被利用性度量显示,强化学习智能体比先前方法更难被利用,尽管仍存在一定程度的可被利用性。
  • 外交游戏的博弈树规模估计约为每局$10^{896.8}$,最大观测移动阶段每回合有$10^{64.3}$种合法联合行动。
  • 该方法在多智能体环境中收敛至稳定策略,附录中提供了多玩家游戏中虚构博弈理论收敛结果。
  • SBR算子有效处理了大规模动作空间和同时行动,使复杂多智能体环境中的可扩展策略学习成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。