Skip to main content
QUICK REVIEW

[论文解读] Finding Friend and Foe in Multi-Agent Games

Jack Serrino, Max Kleiman‐Weiner|arXiv (Cornell University)|Jun 5, 2019
Artificial Intelligence in Games参考文献 40被引用 18
一句话总结

DeepRole 是一种多智能体强化学习算法,结合了反事实遗憾最小化(CFR)与深度价值网络及演绎推理,用于在隐藏角色游戏中识别盟友与敌方。在五人版《阿瓦隆》中,无论作为队友还是对手,其胜率均优于人类玩家和现有智能体,通过可解释的信念状态与自我对弈训练实现卓越表现。

ABSTRACT

Recent breakthroughs in AI for multi-agent games like Go, Poker, and Dota, have seen great strides in recent years. Yet none of these games address the real-life challenge of cooperation in the presence of unknown and uncertain teammates. This challenge is a key game mechanism in hidden role games. Here we develop the DeepRole algorithm, a multi-agent reinforcement learning agent that we test on The Resistance: Avalon, the most popular hidden role game. DeepRole combines counterfactual regret minimization (CFR) with deep value networks trained through self-play. Our algorithm integrates deductive reasoning into vector-form CFR to reason about joint beliefs and deduce partially observable actions. We augment deep value networks with constraints that yield interpretable representations of win probabilities. These innovations enable DeepRole to scale to the full Avalon game. Empirical game-theoretic methods show that DeepRole outperforms other hand-crafted and learned agents in five-player Avalon. DeepRole played with and against human players on the web in hybrid human-agent teams. We find that DeepRole outperforms human players as both a cooperator and a competitor.

研究动机与目标

  • 解决在角色隐藏且信息不对称的多智能体环境中与未知队友协作的挑战。
  • 开发一种能够推理联合信念并从部分可观测动作中推断角色的智能体。
  • 实现在《抵抗:阿瓦隆》等复杂社交游戏中,合作与欺骗并存的可扩展、可泛化的多智能体强化学习。
  • 创建可解释的胜率与信念状态表示,以提升决策能力与泛化性能。
  • 在真实世界的人机交互中评估智能体的表现,证明其在训练数据分布之外的鲁棒性与适应性。

提出的方法

  • 将向量形式的 CFR 与演绎推理模块结合,基于与观测结果的一致性,推断联合信念并推理部分可观测动作。
  • 通过约束条件增强深度价值网络,生成可解释的胜率表示,提升样本效率与泛化能力。
  • 采用自我对弈训练学习策略,无需人类数据,实现对人类策略的泛化。
  • 在对局过程中使用在线 CFR 迭代,适应新型人类行为,即使在分布外情况下亦能有效应对。
  • 结合受限价值网络与深度受限搜索,在大型博弈树中平衡探索与利用。
  • 采用信念状态追踪技术,估算敌方角色的概率,实现在时间推移中的准确推断。

实验结果

研究问题

  • RQ1强化学习智能体能否在无需人类演示数据的情况下,学会在《阿瓦隆》等隐藏角色游戏中识别盟友与敌方?
  • RQ2将演绎推理与 CFR 结合,在部分可观测环境下,对信念推断与决策制定的改进效果如何?
  • RQ3经自我对弈训练的智能体能否在真实人类与智能体混合团队中泛化,表现优于人类与手工设计的智能体?
  • RQ4可解释的信念状态在多大程度上提升了智能体对角色分配与团队动态的推理能力?
  • RQ5受限深度价值网络是否能提升复杂、部分可观测多智能体环境中的样本效率与泛化能力?

主要发现

  • 在五人版《阿瓦隆》中,DeepRole 与另外四个智能体合作时,胜率达到 78.5%,显著优于平均水平的人类玩家。
  • 当替换五人人类团队中的一名成员时,DeepRole 提升了团队胜率,证明其作为协作队友的有效性。
  • 在 ProAvalon.com 的人机混合对局中,DeepRole 作为队友赢得 63.4% 的对局,作为对手赢得 68.1%,在两种角色中均优于人类玩家。
  • 在 80% 的游戏中,当有三轮任务通过时,DeepRole 的信念状态迅速收敛至真实情况,即使仅通过自我对弈训练。
  • 该智能体的可解释信念表示使其实现了随时间推移对间谍角色的准确推断,信念估计值随游戏进程与数据积累而上升。
  • 即使未处理聊天信息或使用自然语言,DeepRole 在协调与竞争方面仍优于人类,表明其从自我对弈中实现了强大泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。