Skip to main content
QUICK REVIEW

[论文解读] MineRL: A Large-Scale Dataset of Minecraft Demonstrations

William H. Guss, Brandon Houghton|arXiv (Cornell University)|Jul 29, 2019
Reinforcement Learning in Robotics参考文献 11被引用 6
一句话总结

MineRL 引入了一个大规模、与模拟器配对的数据集,包含来自 Minecraft 中人类示范的 6000 多万个自动标注的状态-动作对,支持样本高效的强化学习。该数据集支持具有分层结构的多样化任务,实验表明,使用该数据集的模仿学习方法显著优于标准深度强化学习基线模型,尤其在稀疏奖励环境中表现更优。

ABSTRACT

The sample inefficiency of standard deep reinforcement learning methods precludes their application to many real-world problems. Methods which leverage human demonstrations require fewer samples but have been researched less. As demonstrated in the computer vision and natural language processing communities, large-scale datasets have the capacity to facilitate research by serving as an experimental and benchmarking platform for new methods. However, existing datasets compatible with reinforcement learning simulators do not have sufficient scale, structure, and quality to enable the further development and evaluation of methods focused on using human examples. Therefore, we introduce a comprehensive, large-scale, simulator-paired dataset of human demonstrations: MineRL. The dataset consists of over 60 million automatically annotated state-action pairs across a variety of related tasks in Minecraft, a dynamic, 3D, open-world environment. We present a novel data collection scheme which allows for the ongoing introduction of new tasks and the gathering of complete state information suitable for a variety of methods. We demonstrate the hierarchality, diversity, and scale of the MineRL dataset. Further, we show the difficulty of the Minecraft domain along with the potential of MineRL in developing techniques to solve key research challenges within it.

研究动机与目标

  • 通过创建大规模的人类示范数据集,解决深度强化学习在复杂、类现实环境中的样本低效问题。
  • 提供一个与模拟器(Malmo)兼容的基准数据集,以支持模仿学习和分层强化学习方法的训练与评估。
  • 通过提供在多样化 Minecraft 任务中生成的丰富标注、程序化生成的示范,支持样本高效学习技术的发展。
  • 建立一个可扩展、可扩展的平台,持续收集 Minecraft 中的人类游戏数据,支持未来任务和标注的扩展。
  • 通过一个结构化、大规模的数据集,促进逆向强化学习、终身学习和分层决策研究。

提出的方法

  • 作者开发了一个新颖的数据采集平台,从公共 Minecraft 服务器上的玩家捕获数据包级别的游戏数据,从而实现玩家视角和动作的完美重建。
  • 通过对手游序列的程序化分析,每个示范自动标注了子任务完成情况、玩家技能等级和其他元数据。
  • 该数据集围绕 Minecraft 中六个不同的任务组织——Treechop、Navigate(Sparse)、Navigate(Dense)等,每个任务代表控制、导航和规划方面的不同挑战。
  • 该平台支持动态添加新任务和标注,确保未来研究的可扩展性。
  • 该数据集托管于 http://minerl.io,与 Malmo 强化学习模拟器兼容,支持在与数据采集相同环境中直接进行训练和评估。
  • 作者使用该数据集评估了模仿学习方法,如行为克隆(BC)和预训练 DQN(PreDQN),并与标准 DQN 和随机智能体进行性能比较。

实验结果

研究问题

  • RQ1大规模、与模拟器配对的人类示范数据集能否提升复杂、开放世界环境中深度强化学习的样本效率?
  • RQ2在类似 Minecraft 的 3D、第一人称、开放世界环境中,模仿学习方法在多样化、分层任务上的有效性如何?
  • RQ3在类似 Navigate(Sparse)的稀疏奖励环境中,专家示范在多大程度上降低了样本复杂度?
  • RQ4自动生成的标注(如子任务完成情况、技能等级)能否提升人类示范数据集在分层强化学习中的实用性?
  • RQ5与现有数据集相比,MineRL 在规模和多样性方面如何支持模仿学习和分层强化学习的进展?

主要发现

  • 在 Navigate(Dense)任务中,使用 MineRL 微调的 PreDQN 在 100 场比赛中获得了 94.96 ± 13.42 的奖励,显著优于标准 DQN(4.16 ± 0.82)和 A2C(-0.97 ± 3.23)。
  • 在稀疏奖励的 Navigate(Sparse)任务中,专家示范使智能体在 PreDQN 下获得了 6.00 ± 4.65 的奖励,而标准 DQN 和 A2C 的奖励为 0.00 ± 0.00。
  • 行为克隆(BC)在 Navigate(Sparse)任务中获得了 4.23 ± 4.15 的奖励,表明当在高质量示范上训练时,模仿学习即使在稀疏奖励环境中也能成功。
  • 人类专家在 Navigate(Sparse)任务中获得了最大可能的奖励 100.00 ± 0.00,证实了基准任务的质量和难度。
  • 该数据集的分层结构和丰富标注显著提升了泛化能力和样本效率,尤其在长时程规划和导航任务中表现突出。
  • 与 KITTI 和 Dex-Net 等现有数据集相比,MineRL 在领域复杂性背景下具有更大的规模,并且唯一支持与模拟器兼容,实现了直接训练与评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。