Skip to main content
QUICK REVIEW

[论文解读] No Press Diplomacy: Modeling Multi-Agent Gameplay

Philip Paquette, Yuchen Lu|arXiv (Cornell University)|Sep 4, 2019
Opinion Dynamics and Social Influence被引用 15
一句话总结

本文提出DipNet,一种基于神经网络的无压力外交游戏策略模型,通过在150,000场人类对局上进行监督学习训练,并通过自我对弈强化学习进行微调。该模型实现了最先进性能,超越了基于规则的AI,并通过支持指令展现出有效的战术协作与合作。

ABSTRACT

Diplomacy is a seven-player non-stochastic, non-cooperative game, where agents acquire resources through a mix of teamwork and betrayal. Reliance on trust and coordination makes Diplomacy the first non-cooperative multi-agent benchmark for complex sequential social dilemmas in a rich environment. In this work, we focus on training an agent that learns to play the No Press version of Diplomacy where there is no dedicated communication channel between players. We present DipNet, a neural-network-based policy model for No Press Diplomacy. The model was trained on a new dataset of more than 150,000 human games. Our model is trained by supervised learning (SL) from expert trajectories, which is then used to initialize a reinforcement learning (RL) agent trained through self-play. Both the SL and RL agents demonstrate state-of-the-art No Press performance by beating popular rule-based bots.

研究动机与目标

  • 开发一种完全端到端的神经网络策略模型,用于无压力外交游戏,从人类对局中学习,无需显式通信。
  • 评估在非合作、高风险多智能体环境中,基于专家轨迹的监督学习是否能产生比自我对弈强化学习更富合作性的智能体。
  • 分析在自我对弈与专家模仿训练中,通过跨势力支持指令所涌现的合作行为。
  • 确立外交游戏作为具有复杂动作空间的丰富序列社会困境中动态合作的基准。

提出的方法

  • 使用来自超过15万场人类对局的新数据集,通过专家轨迹的监督学习训练深度神经网络策略(DipNet)。
  • 利用监督学习策略作为热启动,通过自我对弈训练强化学习智能体,以提升样本效率与收敛速度。
  • 设计基于Transformer的架构,采用FiLM条件化与掩码解码头,以建模长程依赖关系并预测支持指令。
  • 实现一个与DAIDE兼容的自定义游戏引擎,以支持可复现的评估与锦标赛式基准测试。
  • 使用TrueSkill对智能体进行排名,采用循环赛制,实现性能的统计比较。
  • 通过X-support-ratio与effective X-support-ratio进行联盟分析,量化支持指令中合作的频率与效率。

实验结果

研究问题

  • RQ1在无显式通信条件下,基于人类对局训练的神经网络策略是否能在无压力外交游戏中超越基于规则的AI?
  • RQ2在支持指令协调方面,基于专家轨迹的监督学习与自我对弈强化学习相比,哪种方法更能促进合作行为?
  • RQ3架构设计(如FiLM、棋盘状态编码)在多大程度上影响模型预测有效跨势力支持指令的能力?
  • RQ4在无压力外交游戏中,由于缺乏显式通信,是否会涌现出合作行为?其可量化测量方式为何?

主要发现

  • 监督学习(SL)智能体的有效跨势力支持比率(10.2%)高于自我对弈强化学习(RL)智能体(5.3%),表明其合作更有效。
  • 尽管TrueSkill评分相近,RL智能体发出的跨势力支持指令比例(9.1%)高于SL智能体(7.4%),但其有效性较低,表明合作频率与效用之间存在权衡。
  • 消融实验表明,移除FiLM条件化会降低有效合作程度,证实其在建模上下文感知支持决策中的关键作用。
  • 掩码解码器变体(缺乏棋盘状态输入)的X-support-ratio最高(12.1%),但有效合作率接近零(0.62%),证明单纯的支持频率并不等同于战略效用。
  • SL智能体在锦标赛对局中超越所有基于规则的基线模型,展现出无压力设置下的最先进性能。
  • 在1对1对战中,RL智能体表现出持续的胜率优势,表明其在竞争性对局中具备更强的泛化能力,尽管其合作能力较弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。