Skip to main content
QUICK REVIEW

[论文解读] On Multi-Agent Learning in Team Sports Games

Yunqi Zhao, Igor Borovikov|arXiv (Cornell University)|Jun 25, 2019
Reinforcement Learning in Robotics参考文献 57被引用 12
一句话总结

本文提出一种分层强化学习方法,用于在团队体育类视频游戏中训练类人、高技能的智能体,结合行为克隆进行低层次行为学习,以及使用深度强化学习(PPO/DQN)进行高层次策略学习。实验结果表明,PPO在2v2对战中以55:45的微弱优势胜过DQN,且PPO的收敛速度比DQN快10倍;而Rainbow因超参数设置不当而失败。

ABSTRACT

In recent years, reinforcement learning has been successful in solving video games from Atari to Star Craft II. However, the end-to-end model-free reinforcement learning (RL) is not sample efficient and requires a significant amount of computational resources to achieve superhuman level performance. Model-free RL is also unlikely to produce human-like agents for playtesting and gameplaying AI in the development cycle of complex video games. In this paper, we present a hierarchical approach to training agents with the goal of achieving human-like style and high skill level in team sports games. While this is still work in progress, our preliminary results show that the presented approach holds promise for solving the posed multi-agent learning problem.

研究动机与目标

  • 开发在团队体育类游戏中表现类人且兼具高超技能水平的智能体。
  • 解决端到端无模型强化学习在生成类人行为方面存在的局限性以及样本效率低下的问题。
  • 探索分层学习方法,其中低层次动作通过行为克隆学习,高层次策略通过强化学习训练。
  • 评估训练策略在未见过环境中的泛化能力与鲁棒性。
  • 研究多智能体团队体育场景下的奖励塑形与信用分配机制。

提出的方法

  • 采用分层框架,通过中层模拟器(STS2)将低层次行为(行为克隆)与高层次策略(深度强化学习)分离。
  • 使用深度Q网络(DQN)与近端策略优化(PPO)训练智能体,采用稀疏奖励与塑形奖励。
  • 奖励塑形包括:进球+1分,被进球-1分,获得控球+0.8分,失去控球-0.8分。
  • 探索集中式训练(共享策略),但未引入高层规划器时无法学习到有效行为。
  • 使用STS2模拟器在完整游戏环境部署前训练并评估策略。
  • 未来计划整合迁移学习与集中式训练方法(QMIX、集中式评论器)以提升性能。

实验结果

研究问题

  • RQ1分层强化学习方法能否生成既具备类人行为特征又拥有高超技能水平的智能体?
  • RQ2在稀疏奖励设置下,PPO相较于DQN在训练多智能体策略时的有效性如何?
  • RQ3为何Rainbow在此环境中失败,尽管其在其他领域表现优异?
  • RQ4在传统AI对手上训练的策略,能在多大程度上泛化到新对手?
  • RQ5在团队体育类多智能体强化学习中,如何改进信用分配与团队协作?

主要发现

  • PPO在约6个月人类经验的训练时间内收敛,而DQN则需约5年,表明训练效率提升了10倍。
  • PPO团队在直接对战中以55:45击败DQN团队,表明其具有更好的泛化能力与策略鲁棒性。
  • DQN智能体在对阵传统AI时取得50%的得分率,表明其在训练环境中表现中等。
  • Rainbow智能体在所有实验中均失败,可能由于分布式强化学习或优先经验回放的超参数设置不当。
  • 使用单一策略对两个智能体进行集中式训练未能学习到有效行为,表明需要引入高层规划器。
  • 合理的奖励塑形使智能体能够学习到明确的进攻与防守角色,从而提升团队协作与控球控制能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。