Skip to main content
QUICK REVIEW

[论文解读] Modelling Behavioural Diversity for Learning in Open-Ended Games

Nicolas Perez Nieves, Yaodong Yang|arXiv (Cornell University)|Mar 14, 2021
Reinforcement Learning in Robotics参考文献 8被引用 4
一句话总结

本文提出了一种基于行列式点过程(DPPs)的几何框架,用于定义游戏中行为多样性的严格度量。通过将该度量整合到最优响应动态中,作者开发了多样化的虚幻博弈(diverse fictitious play)和多样化的策略空间响应预言机(diverse policy-space response oracle),分别收敛至纳什均衡和α-排名,且在多种非传递性博弈中,其可被利用性低于PSRO基线。

ABSTRACT

Promoting behavioural diversity is critical for solving games with non-transitive dynamics where strategic cycles exist, and there is no consistent winner (e.g., Rock-Paper-Scissors). Yet, there is a lack of rigorous treatment for defining diversity and constructing diversity-aware learning dynamics. In this work, we offer a geometric interpretation of behavioural diversity in games and introduce a novel diversity metric based on determinantal point processes (DPP). By incorporating the diversity metric into best-response dynamics, we develop diverse fictitious play and diverse policy-space response oracle for solving normal-form games and open-ended games. We prove the uniqueness of the diverse best response and the convergence of our algorithms on two-player games. Importantly, we show that maximising the DPP-based diversity metric guarantees to enlarge the gamescape -- convex polytopes spanned by agents' mixtures of strategies. To validate our diversity-aware solvers, we test on tens of games that show strong non-transitivity. Results suggest that our methods achieve at least the same, and in most games, lower exploitability than PSRO solvers by finding effective and diverse strategies.

研究动机与目标

  • 解决多智能体强化学习与博弈论中行为多样性缺乏严格处理的问题。
  • 利用行列式点过程(DPPs)将行为多样性形式化为几何属性,实现策略选择的系统性方法。
  • 开发具备多样性的学习动态,使其在双人博弈中收敛至纳什均衡和α-排名等解概念。
  • 通过实证验证,多样性最大化可降低可被利用性,并在非传递性博弈中实现更广泛的博弈空间覆盖。
  • 通过引入基于DPP的多样性度量,克服PSRO中的循环策略重复问题,促进新颖且有效策略的发现。

提出的方法

  • 提出一种基于DPP的多样性度量,定义为在策略集合上DPP的期望基数,通过建模不同策略间的排斥关系来实现。
  • 将DPP多样性度量整合至最优响应动态,从而发展出多样化虚幻博弈(DFP)和多样化策略空间响应预言机(D-PSRO)。
  • 将多样化最优响应定义为在收益与DPP多样性之和上最大化的策略,确保在双人博弈中唯一性与收敛性。
  • 理论分析证明:DFP在双人博弈中收敛至纳什均衡,D-PSRO收敛至α-排名,且具备博弈空间扩展的保证。
  • 在28款真实世界博弈与合成的开放性博弈上进行实证评估,对比PSRO与PSRO rN基线,评估可被利用性与多样性。
  • 使用元博弈抽象将智能体表示为混合策略,实现对大规模策略空间(如AlphaStar中的888种策略)的可扩展评估。

实验结果

研究问题

  • RQ1如何利用几何与概率框架,正式定义并度量博弈中的行为多样性?
  • RQ2能否将基于DPP的多样性度量整合至最优响应动态,以提升非传递性博弈中的收敛性与策略覆盖?
  • RQ3与标准PSRO相比,最大化基于DPP的多样性是否能实现更低的可被利用性并更广泛地探索博弈空间?
  • RQ4所提出的多样性感知求解器是否能避免循环策略重复,并在开放性博弈中发现新颖且有效的策略?
  • RQ5基于DPP的多样性度量在多大程度上能保证由混合策略所张成的凸包(博弈空间)得到扩展?

主要发现

  • 所提出的基于DPP的多样性度量可保证博弈空间的扩展——即由智能体混合策略所张成的凸包,为多样性提供了几何依据。
  • 多样化虚幻博弈(DFP)在双人博弈中收敛至纳什均衡,多样化PSRO(D-PSRO)收敛至α-排名,且具有理论保证。
  • 在包含888种策略的AlphaStar元博弈中,D-PSRO仅使用少于50种策略即实现近乎零的可被利用性,优于趋于饱和的PSRO基线。
  • 在非传递性混合模型中,DPP-PSRO通过有效探索全部七个高斯峰,实现零可被利用性,而PSRO与PSRO rN因策略循环而失败。
  • 在Col. Blotto博弈中,D-PSRO在10场独立游戏(3个区域,10枚硬币)中持续实现低于PSRO与PSRO rN的可被利用性。
  • 在随机生成的零和标准型博弈中,多样化α-PSRO发现更多稳定的一致性循环(SSCCs),并获得更高的PCS得分,而标准α-PSRO表现出强烈的循环行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。