Skip to main content
QUICK REVIEW

[论文解读] Skynet: A Top Deep RL Agent in the Inaugural Pommerman Team Competition

Chao Gao, Pablo Hernández-Leal|arXiv (Cornell University)|Apr 20, 2019
Reinforcement Learning in Robotics参考文献 10被引用 15
一句话总结

该论文提出 Skynet955,这是首届 Pommerman 团队竞赛中表现最佳的深度强化学习智能体,在‘学习智能体’类别中获得第二名。该智能体采用一种新颖的 ActionFilter 模块,用于剪枝不安全动作——特别是自杀式炸弹放置——从而实现更高效的探索与训练,结合 PPO 训练、奖励塑造以及对自对弈对手的课程学习。

ABSTRACT

The Pommerman Team Environment is a recently proposed benchmark which involves a multi-agent domain with challenges such as partial observability, decentralized execution (without communication), and very sparse and delayed rewards. The inaugural Pommerman Team Competition held at NeurIPS 2018 hosted 25 participants who submitted a team of 2 agents. Our submission nn_team_skynet955_skynet955 won 2nd place of the "learning agents'' category. Our team is composed of 2 neural networks trained with state of the art deep reinforcement learning algorithms and makes use of concepts like reward shaping, curriculum learning, and an automatic reasoning module for action pruning. Here, we describe these elements and additionally we present a collection of open-sourced agents that can be used for training and testing in the Pommerman environment. Code available at: https://github.com/BorealisAI/pommerman-baseline

研究动机与目标

  • 开发一个在部分可观测、稀疏奖励的 Pommerman 环境中实现去中心化执行的强大多智能体深度强化学习智能体。
  • 解决多智能体设置中延迟奖励、误导性信用分配和部分可观测性带来的挑战。
  • 通过动作过滤机制引入先验知识,提升样本效率与学习稳定性。
  • 通过课程学习与多样化训练对手,实现对多种对手类型的泛化能力。
  • 发布一套开源智能体,用于 Pommerman 环境中的基准测试与训练。

提出的方法

  • 采用使用近端策略优化(PPO)训练的神经网络策略,实现深度强化学习。
  • 实现了一个 ActionFilter 模块,通过手工规则剪枝非法及自杀性动作(例如导致自毁的炸弹放置)。
  • 通过课程学习,先在较弱对手(如 SmartRandomNoBomb)上进行训练,再逐步过渡到更强对手。
  • 应用奖励塑造,以鼓励安全且具策略性的行为,例如避免自伤和优先消灭敌人。
  • 仅在 V0 环境(无墙体坍塌)上进行训练,然后在竞赛的 V1 版本(含动态墙体坍塌)上进行评估。
  • 开源了一套智能体集合(StaticAgent、SmartRandom、SmartRandomNoBomb、CautiousAgent),用于训练与评估。

实验结果

研究问题

  • RQ1基于规则的过滤是否能通过剪枝动作提升稀疏奖励、部分可观测多智能体环境中的样本效率与学习稳定性?
  • RQ2在 Pommerman 团队设置中,跨对手类型进行课程学习在多大程度上能提升泛化能力与最终性能?
  • RQ3在简化环境(V0)上训练的深度强化学习智能体是否能有效泛化到包含动态墙体坍塌的更复杂版本(V1)?
  • RQ4将先验知识(如避免自杀)整合后,如何影响自对弈训练中战略行为的涌现?
  • RQ5对手多样性在防止过拟合并提升训练策略鲁棒性方面起到何种作用?

主要发现

  • Skynet955 智能体在 NeurIPS 2018 Pommerman 团队竞赛的‘学习智能体’类别中获得第二名。
  • ActionFilter 模块通过消除自杀性与非法动作,显著减少了动作空间,极大提升了训练稳定性和样本效率。
  • 该智能体对 SimpleAgent 对手团队的胜率高达 70%,但对 CautiousAgent 对手团队的胜率仅约 10%,凸显了泛化方面的挑战。
  • 采用课程学习(先在如 SmartRandomNoBomb 等较弱对手上训练)显著提升了最终性能与策略鲁棒性。
  • 开源的智能体,尤其是 SmartRandomNoBomb 和 CautiousAgent,作为训练 RL 智能体的强而不可被利用的对手,表现出色。
  • 尽管在 V0(无墙体坍塌)上进行训练,该智能体在 V1(含墙体坍塌)上仍表现出合理性能,表明在特定条件下所学策略具备可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。