[论文解读] Scaling Imitation Learning in Minecraft
本文提出了一种强大的模仿学习框架,用于在《我的世界》中掌握复杂且稀疏奖励的任务(如制作铁镐),结合专家示范与架构创新,通过使用深度强化学习网络、交叉熵损失、数据增强和Treechop示范数据,在《ObtainIronPickaxe》任务上实现了最先进性能——平均回报达74.5,优于以往方法和强化学习基线。
Imitation learning is a powerful family of techniques for learning sensorimotor coordination in immersive environments. We apply imitation learning to attain state-of-the-art performance on hard exploration problems in the Minecraft environment. We report experiments that highlight the influence of network architecture, loss function, and data augmentation. An early version of our approach reached second place in the MineRL competition at NeurIPS 2019. Here we report stronger results that can be used as a starting point for future competition entries and related research. Our code is available at https://github.com/amiranas/minerl_imitation_learning.
研究动机与目标
- 解决强化学习在稀疏奖励、高动作空间环境(如《我的世界》)中的样本效率低下问题。
- 评估网络架构、损失函数和数据增强技术对图像化、三维环境中模仿学习性能的影响。
- 为未来MineRL竞赛参赛作品及沉浸式环境中模仿学习的研究建立强有力的基线。
- 证明模仿学习可在训练期间无需环境交互的情况下实现接近最优的性能。
提出的方法
- 该方法使用来自MineRL-v0数据集的专家示范数据,包含超过500小时的人类轨迹,用于《ObtainIronPickaxe》任务。
- 采用深度Impala神经网络架构,输入为第一人称视角观察和资源库存信息,经卷积编码器和循环处理模块处理。
- 策略通过专家动作的交叉熵损失进行训练,并引入额外的数据增强技术,包括图像翻转、亮度调整、锐度、对比度和海报化处理。
- 该方法引入了额外的Treechop示范数据,以提升在相关子任务上的泛化能力与性能。
- 性能通过100次测试episode的平均回报进行评估,结果在多次训练运行中取平均值,并报告标准差。
- 将该方法与DQfD和Rainbow RL智能体进行比较,以评估在稀疏奖励设置下的相对性能。
实验结果
研究问题
- RQ1不同神经网络架构(如DQN、Impala、Deep Impala)在《我的世界》中的模仿学习性能有何影响?
- RQ2数据增强技术(如翻转、亮度、对比度调整)对策略泛化能力和最终性能有何影响?
- RQ3不同损失函数(交叉熵损失与边缘损失)如何影响模仿学习中的策略稳定性和回报?
- RQ4在稀疏奖励、高观测空间环境(如《我的世界》)中,模仿学习能否优于强化学习?
- RQ5在目标任务中引入来自相关任务(如Treechop)的额外示范数据,如何提升性能?
主要发现
- 采用交叉熵损失和完整数据增强(翻转、亮度、矩形区域移除)的Deep Impala网络在《ObtainIronPickaxe》任务上实现了53.4 ± 7.5的最高平均回报。
- 表现最佳的策略采用交叉熵损失和Treechop示范数据,在三次训练运行中平均回报达到74.5,显著优于早期竞赛参赛作品(42.4)和最强的强化学习基线。
- 数据增强,尤其是图像翻转和亮度调整,使性能从49.7 ± 2.0提升至53.4 ± 7.5,表明其具有显著的泛化优势。
- 使用argmax动作选择的交叉熵损失优于边缘损失和联合损失(边缘损失 + TD损失),表明在此设置下,纯模仿学习比混合DQfD式训练更有效。
- 模仿学习在仅50,000次训练步骤后即实现接近最优性能,而Rainbow RL在三次训练运行中有两次未能获得非零奖励,凸显了模仿学习的样本效率。
- 该策略在82%的episode中成功获取了石镐,偶尔可获得铁锭,但制作铁镐的成功率仍极低(仅1%),表明在长时序、序列决策任务中仍存在持续挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。