[论文解读] Deep Reinforcement Learning with Model Learning and Monte Carlo Tree Search in Minecraft
本文提出一种基于模型的强化学习方法,结合基于深度神经网络(DNN)的转移模型与蒙特卡洛树搜索(MCTS),以解决《我的世界》中的积木放置任务。该模型从连续四帧图像与动作中预测下一帧观测结果和即时奖励,通过MCTS实现样本高效的规划,性能与深度Q网络(DQN)相当,但训练速度显著更快,数据需求更低。
Deep reinforcement learning has been successfully applied to several visual-input tasks using model-free methods. In this paper, we propose a model-based approach that combines learning a DNN-based transition model with Monte Carlo tree search to solve a block-placing task in Minecraft. Our learned transition model predicts the next frame and the rewards one step ahead given the last four frames of the agent's first-person-view image and the current action. Then a Monte Carlo tree search algorithm uses this model to plan the best sequence of actions for the agent to perform. On the proposed task in Minecraft, our model-based approach reaches the performance comparable to the Deep Q-Network's, but learns faster and, thus, is more training sample efficient.
研究动机与目标
- 探究在《我的世界》这类部分可观测视觉环境中,基于学习模型的规划是否可实现与模型无监督DQN相当的性能。
- 通过结合模型学习与蒙特卡洛树搜索(MCTS)进行规划,提升样本效率,以解决积木放置任务。
- 评估在结构化视觉环境中,一步 ahead 奖励预测对MCTS性能的影响。
- 分析基于模型的规划与模型无监督Q学习在训练速度、数据效率与最终性能方面的权衡。
- 识别基于帧的模型因短期记忆限制带来的局限性,并建议未来采用循环网络。
提出的方法
- 训练一个深度卷积神经网络,从最后四帧与当前动作中预测下一帧观测(64×64灰度帧)和即时奖励。
- 将转移模型集成到蒙特卡洛树搜索(MCTS)算法中,通过模拟未来轨迹来规划最优动作序列。
- 使用UCT(树的置信上界)作为树策略,采用基于UCB1的探索策略,通过调节k值为8以平衡探索与利用。
- MCTS智能体对未来的奖励使用0.95的折扣因子,该值为经验性选择,以降低奖励预测的方差。
- 模型在使用Malmo框架从《我的世界》环境中收集的轨迹上进行端到端训练。
- 作为对比,使用相同输入(四帧)的标准DQN智能体,采用原始DQN架构与超参数进行训练。
实验结果
研究问题
- RQ1基于学习模型的智能体结合MCTS是否可在《我的世界》这类视觉复杂且部分可观测的环境中,实现与DQN智能体相当的性能?
- RQ2在积木放置任务中,包含一步 ahead 奖励预测是否显著影响MCTS智能体的性能?
- RQ3在该任务中,基于模型的方法相较于模型无监督DQN,在多大程度上更具数据效率?
- RQ4基于模型的方法的主要失败模式是什么,特别是长期轨迹中误差累积的影响?
- RQ5仅依赖有限上下文(最后四帧)的基于帧的模型能否有效支持规划,还是必须采用循环建模?
主要发现
- MCTS智能体在500万次训练步后达到72%的成功率,与DQN智能体的74%成功率非常接近,证明了其竞争性表现。
- MCTS智能体在100万次训练步后达到64%的成功率,而DQN智能体在同一时间点仅达到12%,显示出显著更高的样本效率。
- 包含一步 ahead 奖励预测的MCTS智能体在250万次训练步后达到70%的成功率,而无此预测的版本仅达30%,证明即时奖励监督的关键作用。
- 基于模型的方法仅需比DQN少150万次训练步即可达到DQN的性能,凸显其数据效率优势。
- DQN智能体在前170万次训练步中表现出显著的Q值过估计现象,即使调整学习率也未能消除。
- 基于模型的智能体性能受限于短时上下文窗口(最后四帧),当过去信息不再可见时,常导致错误预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。