[论文解读] Sample Efficient Reinforcement Learning through Learning from Demonstrations in Minecraft
该论文通过结合人类示范的模仿学习与IMPALA的微调,提出了一种针对MineRL ObtainDiamond任务的样本高效强化学习流程。该方法采用经验回放、优势裁剪、CLEAR以防止灾难性遗忘,并使用独立的策略-价值网络,仅用800万次环境交互帧即取得了48分的平均得分,在NeurIPS 2019 MineRL竞赛中排名第三。
Sample inefficiency of deep reinforcement learning methods is a major obstacle for their use in real-world applications. In this work, we show how human demonstrations can improve final performance of agents on the Minecraft minigame ObtainDiamond with only 8M frames of environment interaction. We propose a training procedure where policy networks are first trained on human data and later fine-tuned by reinforcement learning. Using a policy exploitation mechanism, experience replay and an additional loss against catastrophic forgetting, our best agent was able to achieve a mean score of 48. Our proposed solution placed 3rd in the NeurIPS MineRL Competition for Sample-Efficient Reinforcement Learning.
研究动机与目标
- 解决深度强化学习在Minecraft等复杂、稀疏奖励环境中的样本低效问题。
- 仅使用800万次环境交互,提升ObtainDiamond任务的最终性能。
- 克服通过标准强化学习微调模仿学习策略时导致的性能崩溃问题。
- 稳定训练过程,并防止因微调而遗忘示范中罕见的高奖励行为。
- 证明结合模仿学习与增强的强化学习技术,可在严格样本限制下实现优异性能。
提出的方法
- 使用6000多万条人类示范轨迹,通过监督学习预训练策略与价值网络。
- 使用包含大容量经验回放缓冲区(回放比率15)的IMPALA对预训练策略进行微调。
- 应用优势裁剪,仅对优于平均水平的轨迹进行策略更新,以增强对示范行为的利用。
- 引入CLEAR(持续学习中的经验回放)通过正则化联合优化策略与价值网络,以缓解灾难性遗忘。
- 采用独立的策略网络与价值网络,而非共享架构,以提升训练稳定性和性能。
- 采用多组件训练流程:模仿学习 → 经验回放 → 优势裁剪 → CLEAR → 最终微调。
实验结果
研究问题
- RQ1人类示范能否显著提升在Minecraft中ObtainDiamond等层次化、稀疏奖励任务的深度强化学习样本效率?
- RQ2为何直接微调模仿学习策略会导致性能崩溃?该问题如何缓解?
- RQ3在800万帧约束下,经验回放、优势裁剪与CLEAR在单独及联合使用时,对最终性能的提升程度如何?
- RQ4与共享网络架构相比,分离策略与价值网络是否能带来更好的性能与稳定性?
- RQ5当在有限人类示范下训练时,智能体在随机生成的Minecraft地图上泛化能力如何?
主要发现
- 最佳智能体取得了48分的平均得分,显著优于朴素微调(平均得分2.9),并超越了监督基线(平均10.3)。
- 回放比为15的经验回放带来了最高性能,证明其在样本效率中的关键作用。
- 优势裁剪与CLEAR结合使用,使平均得分从37.5提升至39.9,表明有效利用了示范行为。
- CLEAR有效防止了灾难性遗忘,保留了实现高奖励子任务(如挖掘钻石)的能力。
- 分离的策略-价值网络与CLEAR结合使用,带来了更稳定的训练过程与更高的最大得分(163),优于联合网络。
- 完整流程(模仿学习 + 经验回放 + 优势裁剪 + CLEAR + 分离网络)取得了40分的平均得分,其中一 agent 达到48分,在NeurIPS 2019 MineRL竞赛中排名第三。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。