Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning with Model Learning and Monte Carlo Tree Search in Minecraft

Stephan Alaniz|arXiv (Cornell University)|Mar 22, 2018
Reinforcement Learning in Robotics参考文献 9被引用 16
一句话总结

本文提出一种基于模型的强化学习方法,结合基于深度神经网络(DNN)的转移模型与蒙特卡洛树搜索(MCTS),以解决《我的世界》中的积木放置任务。该模型从连续四帧图像与动作中预测下一帧观测结果和即时奖励,通过MCTS实现样本高效的规划,性能与深度Q网络(DQN)相当,但训练速度显著更快,数据需求更低。

ABSTRACT

Deep reinforcement learning has been successfully applied to several visual-input tasks using model-free methods. In this paper, we propose a model-based approach that combines learning a DNN-based transition model with Monte Carlo tree search to solve a block-placing task in Minecraft. Our learned transition model predicts the next frame and the rewards one step ahead given the last four frames of the agent's first-person-view image and the current action. Then a Monte Carlo tree search algorithm uses this model to plan the best sequence of actions for the agent to perform. On the proposed task in Minecraft, our model-based approach reaches the performance comparable to the Deep Q-Network's, but learns faster and, thus, is more training sample efficient.

研究动机与目标

  • 探究在《我的世界》这类部分可观测视觉环境中,基于学习模型的规划是否可实现与模型无监督DQN相当的性能。
  • 通过结合模型学习与蒙特卡洛树搜索(MCTS)进行规划,提升样本效率,以解决积木放置任务。
  • 评估在结构化视觉环境中,一步 ahead 奖励预测对MCTS性能的影响。
  • 分析基于模型的规划与模型无监督Q学习在训练速度、数据效率与最终性能方面的权衡。
  • 识别基于帧的模型因短期记忆限制带来的局限性,并建议未来采用循环网络。

提出的方法

  • 训练一个深度卷积神经网络,从最后四帧与当前动作中预测下一帧观测(64×64灰度帧)和即时奖励。
  • 将转移模型集成到蒙特卡洛树搜索(MCTS)算法中,通过模拟未来轨迹来规划最优动作序列。
  • 使用UCT(树的置信上界)作为树策略,采用基于UCB1的探索策略,通过调节k值为8以平衡探索与利用。
  • MCTS智能体对未来的奖励使用0.95的折扣因子,该值为经验性选择,以降低奖励预测的方差。
  • 模型在使用Malmo框架从《我的世界》环境中收集的轨迹上进行端到端训练。
  • 作为对比,使用相同输入(四帧)的标准DQN智能体,采用原始DQN架构与超参数进行训练。

实验结果

研究问题

  • RQ1基于学习模型的智能体结合MCTS是否可在《我的世界》这类视觉复杂且部分可观测的环境中,实现与DQN智能体相当的性能?
  • RQ2在积木放置任务中,包含一步 ahead 奖励预测是否显著影响MCTS智能体的性能?
  • RQ3在该任务中,基于模型的方法相较于模型无监督DQN,在多大程度上更具数据效率?
  • RQ4基于模型的方法的主要失败模式是什么,特别是长期轨迹中误差累积的影响?
  • RQ5仅依赖有限上下文(最后四帧)的基于帧的模型能否有效支持规划,还是必须采用循环建模?

主要发现

  • MCTS智能体在500万次训练步后达到72%的成功率,与DQN智能体的74%成功率非常接近,证明了其竞争性表现。
  • MCTS智能体在100万次训练步后达到64%的成功率,而DQN智能体在同一时间点仅达到12%,显示出显著更高的样本效率。
  • 包含一步 ahead 奖励预测的MCTS智能体在250万次训练步后达到70%的成功率,而无此预测的版本仅达30%,证明即时奖励监督的关键作用。
  • 基于模型的方法仅需比DQN少150万次训练步即可达到DQN的性能,凸显其数据效率优势。
  • DQN智能体在前170万次训练步中表现出显著的Q值过估计现象,即使调整学习率也未能消除。
  • 基于模型的智能体性能受限于短时上下文窗口(最后四帧),当过去信息不再可见时,常导致错误预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。