[论文解读] JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical Reinforcement Learning
JueWu-MC 提出了一种样本高效的分层强化学习框架,用于玩《我的世界》游戏,结合了动作感知表征学习、基于判别器的自模仿学习以及带一致性过滤的集成行为克隆。该方法仅使用 250 万次训练样本,便在 NeurIPS MineRL 2021 竞赛中取得了最高性能得分。
Learning rational behaviors in open-world games like Minecraft remains to be challenging for Reinforcement Learning (RL) research due to the compound challenge of partial observability, high-dimensional visual perception and delayed reward. To address this, we propose JueWu-MC, a sample-efficient hierarchical RL approach equipped with representation learning and imitation learning to deal with perception and exploration. Specifically, our approach includes two levels of hierarchy, where the high-level controller learns a policy to control over options and the low-level workers learn to solve each sub-task. To boost the learning of sub-tasks, we propose a combination of techniques including 1) action-aware representation learning which captures underlying relations between action and representation, 2) discriminator-based self-imitation learning for efficient exploration, and 3) ensemble behavior cloning with consistency filtering for policy robustness. Extensive experiments show that JueWu-MC significantly improves sample efficiency and outperforms a set of baselines by a large margin. Notably, we won the championship of the NeurIPS MineRL 2021 research competition and achieved the highest performance score ever.
研究动机与目标
- 为解决开放世界《我的世界》环境中部分可观测性、高维视觉感知和延迟奖励等复合挑战。
- 通过利用非结构化人类示范,提升长时程决策中的样本效率。
- 通过新颖的表征学习与模仿学习技术,增强探索能力和策略鲁棒性。
- 通过从示范中自动提取子目标并训练低层执行者,实现分层决策。
- 在极少数训练样本下,实现 MineRL 2021 竞赛中的最先进性能。
提出的方法
- 一种两级分层强化学习框架,高层控制器管理选项,低层执行者执行子任务。
- 动作感知表征学习(A2RL),通过学习到的掩码网络捕捉动作与视觉表征之间的动态关系。
- 基于判别器的自模仿学习(DSIL),通过重现过去成功的行为并聚焦于高回报状态分布,鼓励探索。
- 集成行为克隆结合一致性过滤,通过利用多个专家示范并过滤噪声轨迹,提升策略鲁棒性。
- 高层控制器利用非结构化人类示范自动提取子目标,并将其分派给低层执行者。
- 该框架整合了模仿学习与表征学习,以提升复杂 3D 环境中的样本效率与泛化能力。
实验结果
研究问题
- RQ1是否能够通过从非结构化示范中自动发现子目标的分层强化学习框架,提升长时程《我的世界》任务中的样本效率?
- RQ2动作感知表征学习在高维观测的 3D 环境中,如何增强视觉理解与控制能力?
- RQ3与标准自模仿学习相比,基于判别器的自模仿学习在探索效率方面提升了多少?
- RQ4在存在不完美人类示范的情况下,集成行为克隆结合一致性过滤在多大程度上提升了策略鲁棒性?
- RQ5这些技术的整合是否能使智能体超越现有基线方法,并赢得 MineRL 2021 竞赛?
主要发现
- JueWu-MC 在 NeurIPS MineRL 2021 竞赛中取得了最高性能得分,仅使用 250 万次训练样本,创下新纪录。
- 该模型仅用 250 万次样本便达到 100 分的得分,远低于竞赛设定的 800 万次样本上限。
- 消融实验表明,A2RL 和 EBC 对性能的贡献大于 DSIL,且 A2RL 在学习流程中具有更早且更广泛的影响。
- 显著性图可视化证实,A2RL 掩码网络能有效聚焦于视觉输入中动态且与动作相关的区域,提升了可解释性与控制能力。
- DSIL 实现了更紧凑且有针对性的探索,与 PPO 和 PPO+SIL 相比,智能体在训练初期便更早集中于高回报状态分布。
- 该框架在样本效率与任务性能方面均优于所有先前基线方法,证明了分层规划与先进表征及模仿学习技术结合的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。