Skip to main content
QUICK REVIEW

[论文解读] Safer Deep RL with Shallow MCTS: A Case Study in Pommerman

Bilal Kartal, Pablo Hernández-Leal|arXiv (Cornell University)|Apr 10, 2019
Reinforcement Learning in Robotics参考文献 51被引用 5
一句话总结

本文提出将浅层蒙特卡洛树搜索(MCTS)作为非专家示范者集成到异步分布式深度强化学习(A3C)中,以提升Pommerman多智能体环境中样本效率与安全性。通过使用轻量级MCTS引导探索并减少训练过程中的灾难性自杀行为,该方法相比基线DRL实现了更快的收敛速度和更优策略,表明即使弱规划器也能显著提升稀疏、延迟奖励环境下的安全学习效果。

ABSTRACT

Safe reinforcement learning has many variants and it is still an open research problem. Here, we focus on how to use action guidance by means of a non-expert demonstrator to avoid catastrophic events in a domain with sparse, delayed, and deceptive rewards: the recently-proposed multi-agent benchmark of Pommerman. This domain is very challenging for reinforcement learning (RL) --- past work has shown that model-free RL algorithms fail to achieve significant learning. In this paper, we shed light into the reasons behind this failure by exemplifying and analyzing the high rate of catastrophic events (i.e., suicides) that happen under random exploration in this domain. While model-free random exploration is typically futile, we propose a new framework where even a non-expert simulated demonstrator, e.g., planning algorithms such as Monte Carlo tree search with small number of rollouts, can be integrated to asynchronous distributed deep reinforcement learning methods. Compared to vanilla deep RL algorithms, our proposed methods both learn faster and converge to better policies on a two-player mini version of the Pommerman game.

研究动机与目标

  • 解决在Pommerman环境中基于模型的深度强化学习探索过程中灾难性失败(尤其是自残式死亡)的挑战。
  • 探究非专家浅层MCTS规划器是否可作为有效动作引导,在高探索难度、稀疏奖励领域中指导深度强化学习智能体。
  • 通过将异步A3C与基于MCTS的辅助模仿学习相结合,提升深度强化学习的样本效率与训练速度。
  • 证明即使低质量规划器也能显著减少复杂多智能体环境中自杀行为的数量,并加速策略收敛。

提出的方法

  • 以异步优势演员-critic(A3C)作为基础深度强化学习算法,将部分工作线程替换为基于MCTS的规划器,以提供动作指导。
  • 引入辅助模仿学习损失,促使无模型工作线程模仿MCTS示范者的行为,提升探索安全性。
  • 采用轻量级MCTS,仅使用少量模拟(如10–50次),生成非专家示范,避免高计算开销。
  • 维持在线策略训练设置,不使用经验回放,确保MCTS生成的动作仅在每次更新中使用一次,以保持训练一致性。
  • 使用28个特征图表示环境状态,编码智能体位置、炸弹、火焰、墙壁、增益道具以及智能体特有属性(如炸弹半径和踢击能力)。
  • 采用共享深度神经网络,包含4个卷积层(32个滤波器,3×3,步长1,填充1),一个128维全连接层,以及双头结构:演员头(动作概率)和评论家头(价值估计)。

实验结果

研究问题

  • RQ1即使模拟次数有限,浅层MCTS规划器是否能显著降低Pommerman环境中探索过程中的灾难性自杀率?
  • RQ2通过模仿学习整合非专家示范者,是否能提升无模型深度强化学习在稀疏且具有欺骗性奖励设置下的样本效率与收敛速度?
  • RQ3MCTS示范者的数量与质量如何影响深度强化学习智能体的学习性能与策略质量?
  • RQ4在不依赖经验回放的前提下,能否通过轻量级规划器的辅助模仿学习有效增强在线策略A3C训练?

主要发现

  • 所提方法在训练过程中显著减少了自杀行为数量,直接缓解了基线DRL在Pommerman中的主要失败模式。
  • 将浅层MCTS作为示范者集成后,相比标准A3C,学习速度更快,最终累积奖励更高,即使在极少超参数调优下亦然。
  • 即使仅使用少量MCTS模拟(如10–50次)作为示范者,也能提升策略性能,表明高质量规划并非有效引导的必要条件。
  • 该方法在不同对手下展现出更好的泛化能力,表明其在多智能体交互中具备更强的鲁棒性与安全性。
  • 使用辅助模仿损失结合MCTS动作,可获得更稳定的训练曲线并减少灾难性遗忘,尤其在Adam优化器中使用较小的epsilon值时效果更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。