Skip to main content
QUICK REVIEW

[论文解读] On Hard Exploration for Reinforcement Learning: a Case Study in Pommerman

Chao Gao, Bilal Kartal|arXiv (Cornell University)|Jul 26, 2019
Reinforcement Learning in Robotics被引用 4
一句话总结

本文以 Pommerman 为案例研究,针对多智能体强化学习中的困难探索问题提出解决方案。该方法引入一种基于模型的动作剪枝模块,可有效避免自杀式炸弹放置行为,从而在稀疏、延迟且具有欺骗性的奖励环境中实现样本高效的训练。该方法使 PPO 智能体在模型自由强化学习完全失效的情况下,仍能有效对抗静态对手和基线对手并取得优异表现。

ABSTRACT

How to best explore in domains with sparse, delayed, and deceptive rewards is an important open problem for reinforcement learning (RL). This paper considers one such domain, the recently-proposed multi-agent benchmark of Pommerman. This domain is very challenging for RL --- past work has shown that model-free RL algorithms fail to achieve significant learning without artificially reducing the environment's complexity. In this paper, we illuminate reasons behind this failure by providing a thorough analysis on the hardness of random exploration in Pommerman. While model-free random exploration is typically futile, we develop a model-based automatic reasoning module that can be used for safer exploration by pruning actions that will surely lead the agent to death. We empirically demonstrate that this module can significantly improve learning.

研究动机与目标

  • 分析为何在 Pommerman 中,尽管使用了 PPO 等先进算法,模型自由强化学习仍会因随机探索过程中的高自杀率而失败。
  • 识别出延迟的动作影响和欺骗性奖励使得安全探索在 Pommerman 中极为困难。
  • 设计一种基于模型的推理模块,用于剪枝会导致自身死亡的动作,从而提升探索安全性。
  • 通过实证验证,动作剪枝可显著提升在自由对战(Free-For-All)和团队模式下的样本效率。
  • 证明在静态对手环境下训练的智能体,可在对抗性环境中超越规则基线(如 SimpleAgent)的表现。

提出的方法

  • 本文提出一种基于模型的推理模块,在动作执行前分析炸弹放置动作的安全性。
  • 该模块通过向前模拟炸弹爆炸过程,持续 10 个时间步,预测是否会导致任一智能体被击杀。
  • 基于预测的爆炸半径和智能体位置,剪枝会导致自身死亡的动作。
  • 该模块与 PPO 算法集成,使智能体在保持策略学习的同时实现安全探索。
  • 该方法在对抗静态对手和 SimpleAgent 基线的自由对战(Free-For-All)与团队模式下进行了评估。
  • 采用奖励塑造策略,以鼓励移动、收集道具和消灭敌人。

实验结果

研究问题

  • RQ1为何尽管使用了 PPO 等先进算法,模型自由强化学习在 Pommerman 中仍无法学习?
  • RQ2随机探索为何导致高自杀率,其对样本效率有何影响?
  • RQ3基于模型的动作剪枝模块是否能显著提升在延迟与稀疏奖励环境中的学习效率?
  • RQ4在静态对手环境下训练的智能体,在多大程度上能泛化至与规则基线(如 SimpleAgent)的对抗环境?
  • RQ5安全探索在复杂网格世界环境中对实现样本高效学习起到了何种关键作用?

主要发现

  • 在未使用动作剪枝的情况下,PPO 智能体在自由对战(FFA)和团队模式下,经过 5 天训练仍无法取得任何成功。
  • 在引入动作剪枝模块后,PPO 智能体在 FFA 和团队模式下均实现了稳定成功,有效学习了纯粹的探索任务。
  • 在 FFA 模式下,最终智能体对阵三名 SimpleAgent 对手的胜率约为 40%,高于同等水平智能体预期的 25% 胜率。
  • 在团队模式下,智能体对阵由 SimpleAgent 组成的团队时胜率约为 70%,表明其在静态对手训练下具备强大的泛化能力。
  • 动作剪枝模块显著减少了探索过程中的自杀行为,直接提升了样本效率与学习稳定性。
  • 该模块的早期版本曾助力团队在 NeurIPS 2018 学习类别竞赛中获得第二名,验证了其实际有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。