Skip to main content
QUICK REVIEW

[论文解读] MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration

Jin Zhang, Jianhao Wang|arXiv (Cornell University)|Jun 15, 2020
Reinforcement Learning in Robotics参考文献 40被引用 9
一句话总结

MetaCURE 提出了一种新颖的异策略元强化学习框架,通过将探索策略与利用策略分离,并使用基于赋能的内在奖励来最大化任务识别的信息增益。该方法在稀疏奖励的 MuJoCo 和 Meta-World 任务中实现了最先进性能,通过在元训练和微调阶段实现高效且上下文感知的探索。

ABSTRACT

Meta reinforcement learning (meta-RL) extracts knowledge from previous tasks and achieves fast adaptation to new tasks. Despite recent progress, efficient exploration in meta-RL remains a key challenge in sparse-reward tasks, as it requires quickly finding informative task-relevant experiences in both meta-training and adaptation. To address this challenge, we explicitly model an exploration policy learning problem for meta-RL, which is separated from exploitation policy learning, and introduce a novel empowerment-driven exploration objective, which aims to maximize information gain for task identification. We derive a corresponding intrinsic reward and develop a new off-policy meta-RL framework, which efficiently learns separate context-aware exploration and exploitation policies by sharing the knowledge of task inference. Experimental evaluation shows that our meta-RL method significantly outperforms state-of-the-art baselines on various sparse-reward MuJoCo locomotion tasks and more complex sparse-reward Meta-World tasks.

研究动机与目标

  • 为解决在稀疏奖励设置下元强化学习中高效探索的挑战,其中与任务相关的信息稀缺。
  • 将探索策略学习与利用策略学习解耦,以专注于收集信息丰富的经验。
  • 设计一种新颖的基于赋能的探索目标,以最大化收集到的经验与任务识别之间的互信息。
  • 基于预测误差差异推导出一种内在奖励,以指导元训练和微调阶段的有效探索。
  • 开发一种统一的异策略元强化学习框架,使探索和利用策略共享任务推理能力,从而提升学习效率。

提出的方法

  • 制定一种基于赋能的探索目标,以最大化探索轨迹与任务身份之间的互信息。
  • 基于探索目标,从不同动作上的模型预测误差差异中推导出内在奖励。
  • 提出 MetaCURE,一种新型的异策略元强化学习框架,用于学习独立的上下文感知探索与利用策略。
  • 在探索与利用策略之间共享一个通用的任务推理模块,以提升样本效率和知识迁移能力。
  • 在微调阶段使用概率性任务推理,其中探索策略在多轮次中执行序列化探索行为。
  • 在微调阶段使用内在奖励,引导探索策略朝向高信息量的经验前进,而利用策略则在最后一轮中优化外部回报。

实验结果

研究问题

  • RQ1基于信息增益的内在奖励是否能提升元强化学习在稀疏奖励设置下的探索效率?
  • RQ2将探索与利用策略解耦是否能在稀疏奖励条件下提升元强化学习的性能?
  • RQ3一种基于赋能的目标,若能最大化与任务身份的互信息,是否能增强任务推理和加速适应?
  • RQ4MetaCURE 在稀疏奖励的 MuJoCo 和 Meta-World 任务中,与最先进基线相比,在样本效率和最终性能方面表现如何?
  • RQ5基于预测误差差异推导出的内在奖励在多大程度上促进了元训练和微调阶段的有效探索?

主要发现

  • MetaCURE 在多种稀疏奖励的 MuJoCo 运动任务中显著优于最先进基线,展现出卓越的样本效率和最终性能。
  • 该方法在更复杂的稀疏奖励 Meta-World 任务上实现了强大的泛化能力,而以往的元强化学习方法因探索受限而表现不佳。
  • 消融实验表明,内在奖励组件对性能至关重要,移除后性能出现显著下降。
  • 可视化结果表明,MetaCURE 的探索策略执行结构化、序列化的探索行为,系统性地收集与任务相关的信息,而基线方法则表现为随机或无结构的探索。
  • 探索与利用策略的分离显著加快了适应速度并提升了学习稳定性,尤其在数据量有限的场景下。
  • 基于预测误差差异推导出的内在奖励能有效衡量信息增益,使智能体能够聚焦于产生最具信息量经验的动作,以实现任务识别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。