Skip to main content
QUICK REVIEW

[论文解读] Discovering Diverse Multi-Agent Strategic Behavior via Reward Randomization

Zhenggang Tang, Chao Yu|arXiv (Cornell University)|Jan 1, 2021
Reinforcement Learning in Robotics参考文献 65被引用 13
一句话总结

本文提出奖励随机化(Reward Randomization, RR),一种通过扰动多智能体博弈中的奖励结构来重塑策略空间景观的技术,使策略梯度算法能够发现多样化的高收益纳什均衡——尤其是难以触及的合作策略。所提出的奖励随机化策略梯度(Reward-Randomized Policy Gradient, RPG)算法在复杂游戏如猎鹿博弈(Stag-Hunt)、怪兽猎杀(Monster-Hunt)和Agar.io中成功识别出多种人类可解释的策略,使智能体能够根据对手类型动态响应,并通过微调或对手建模实现更优收益。

ABSTRACT

We propose a simple, general and effective technique, Reward Randomization for discovering diverse strategic policies in complex multi-agent games. Combining reward randomization and policy gradient, we derive a new algorithm, Reward-Randomized Policy Gradient (RPG). RPG is able to discover multiple distinctive human-interpretable strategies in challenging temporal trust dilemmas, including grid-world games and a real-world game Agar.io, where multiple equilibria exist but standard multi-agent policy gradient algorithms always converge to a fixed one with a sub-optimal payoff for every player even using state-of-the-art exploration techniques. Furthermore, with the set of diverse strategies from RPG, we can (1) achieve higher payoffs by fine-tuning the best policy from the set; and (2) obtain an adaptive agent by using this set of strategies as its training opponents. The source code and example videos can be found in our website: https://sites.google.com/view/staghuntrpg.

研究动机与目标

  • 解决标准多智能体策略梯度(PG)算法在存在多个纳什均衡的游戏中的局限性,即其始终收敛于次优均衡。
  • 发现高收益、人类可解释的战略行为——尤其是标准PG方法因收敛盆地过窄而无法达到的合作均衡。
  • 开发一种通用且有效的技术,用于探索多智能体马尔可夫博弈中的多样化策略模式,而无需依赖复杂的探索启发式方法。
  • 通过在多样化发现的策略上进行训练,实现自适应智能体的构建,使其能够根据对手行为动态调整策略。
  • 在真实世界和复杂环境中(包括Agar.io)证明奖励随机化的有效性,其中涌现行为与策略多样性至关重要。

提出的方法

  • 奖励随机化(RR)通过向奖励向量添加随机噪声来扰动多智能体博弈的奖励函数,从而有效改变策略空间中的策略模式景观。
  • 该方法将RR与策略梯度学习相结合,形成一种新算法——奖励随机化策略梯度(RPG),通过在随机化奖励下训练策略,以探索多样化的均衡。
  • RR在预训练阶段应用,通过多次随机奖励扰动,发现包括合作与竞争行为在内的多种独特策略。
  • 在发现多样化策略集后,该方法支持两种关键应用:(1) 对策略集中表现最佳的策略进行微调以获得更高收益;(2) 在发现的策略群体上训练自适应策略,实现动态策略切换。
  • 该方法利用了奖励扰动使高收益但低概率的均衡(如猎鹿博弈中的高风险合作)对基于梯度的优化更具可及性这一事实。
  • 该方法在三个环境上进行了评估:迭代猎鹿博弈(Iterative Stag-Hunt)、怪兽猎杀(Monster-Hunt)和Agar.io,并与标准PG及最先进的探索技术进行了消融实验与对比。

实验结果

研究问题

  • RQ1奖励随机化是否能有效发现标准策略梯度方法无法收敛的高收益合作均衡?
  • RQ2在复杂马尔可夫博弈中,奖励随机化与传统策略空间或动作空间探索技术相比,在发现多样化战略行为方面表现如何?
  • RQ3所发现的多样化策略集在多大程度上可用于训练具备根据对手类型动态调整行为能力的自适应智能体?
  • RQ4RPG是否能在不同游戏环境中(包括真实世界游戏如Agar.io)持续发现人类可解释的非平凡涌现策略?
  • RQ5所发现的策略集是否可用于零样本设置下的微调或对手建模,从而提升性能?

主要发现

  • 在迭代猎鹿博弈中,RPG发现了包括高收益合作与竞争行为在内的多样化策略,而标准PG始终收敛于次优的非合作均衡。
  • 在RPG发现的策略集上训练的自适应策略在四种人工设计的对手(包括以牙还牙和随机策略)上均表现出高绩效,展示了强大的动态适应能力。
  • 在怪兽猎杀游戏中,自适应策略在面对合作型对手时学会合作,面对竞争型对手时则选择回避或利用,这一行为在适应训练曲线中表现出稳定的频率模式。
  • 在Agar.io中,自适应策略成功学会与合作型伙伴合作,并避免被竞争型伙伴利用,表现为攻击频率初期下降,合作频率随时间上升。
  • RPG算法在Agar.io中发现了多种非平凡的涌现行为,包括协同群体攻击与战略性规避,这些行为在标准PG中未被发现。
  • 对RPG发现策略集中表现最佳的策略进行微调,获得了显著高于标准PG的收益,证实了策略发现多样性的重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。