Skip to main content
QUICK REVIEW

[论文解读] Reset-Free Lifelong Learning with Skill-Space Planning

Kevin Lü, Aditya Grover|arXiv (Cornell University)|Dec 7, 2020
Reinforcement Learning in Robotics参考文献 57被引用 11
一句话总结

本文提出终身技能规划(LiSP),一种无需重置的终身强化学习框架,通过在技能空间中进行无监督技能发现与长时程规划,实现在非平稳、非回合制环境中的稳定、持续学习。LiSP通过结合无模型技能学习与基于模型的规划,有效缓解灾难性遗忘,即使在无环境重置的情况下也能实现高效的长时程推理,性能显著优于以往方法。

ABSTRACT

The objective of lifelong reinforcement learning (RL) is to optimize agents which can continuously adapt and interact in changing environments. However, current RL approaches fail drastically when environments are non-stationary and interactions are non-episodic. We propose Lifelong Skill Planning (LiSP), an algorithmic framework for non-episodic lifelong RL based on planning in an abstract space of higher-order skills. We learn the skills in an unsupervised manner using intrinsic rewards and plan over the learned skills using a learned dynamics model. Moreover, our framework permits skill discovery even from offline data, thereby reducing the need for excessive real-world interactions. We demonstrate empirically that LiSP successfully enables long-horizon planning and learns agents that can avoid catastrophic failures even in challenging non-stationary and non-episodic environments derived from gridworld and MuJoCo benchmarks.

研究动机与目标

  • 解决当前强化学习算法在非回合制、非平稳环境中因陷入吸收态而导致的不稳定性问题。
  • 开发一种无需环境重置的终身强化学习框架,模拟现实世界中的持续学习过程。
  • 从在线与离线数据中实现技能发现与规划,降低对昂贵真实世界交互的依赖。
  • 通过在抽象技能空间中操作,克服短时程规划与模型不准确性的局限,约束行为并提升规划鲁棒性。

提出的方法

  • 使用内在奖励与一种动力学感知的技能发现方法(DADS),并扩展其技能实践提议分布,以无监督方式学习高层次技能。
  • 在技能空间上构建学习到的动力学模型,以使用基于模型的规划算法实现长时程规划。
  • 使用概率集成动力学模型估计不确定性,并在离线技能学习过程中调整奖励,提升样本效率。
  • 集成无模型策略网络以执行技能,并将之与基于模型的规划结合,用于技能空间中的决策制定。
  • 将动作空间模型预测控制(MPC)作为基线进行比较,采用长(H=180)与短(H=25)规划时域。
  • 在修改后的网格世界与MuJoCo基准上进行训练与评估,环境具有非平稳动力学与多任务、非回合制设置。

实验结果

研究问题

  • RQ1技能空间规划是否能在标准强化学习失效的无重置、非平稳环境中实现稳定、长时程决策?
  • RQ2在无环境重置的情况下,LiSP在离线数据中学习技能的效率如何?
  • RQ3与动作空间中的短时程规划相比,技能空间中的长时程规划有何影响?
  • RQ4技能实践提议分布在非回合制环境中如何提升技能学习效果?
  • RQ5在存在吸收态的环境中,LiSP在不依赖人工重置的情况下,能在多大程度上避免灾难性失败?

主要发现

  • LiSP在非回合制环境中显著优于标准无模型强化学习算法(SAC、MBPO),避免了无重置时观察到的灾难性失败。
  • 在终身跳跃者基准中,LiSP在平均回报上分别达到 0.84 ± 0.02(快)、0.88 ± 0.05(慢)与 0.81 ± 0.01(后退),远超MPC-长(0.27–0.49)与MPC-短(0.27–0.32)。
  • LiSP成功从离线数据中学习到一组通用技能,可在跳跃者环境中适应多种目标速度,展示了有效的离线终身学习能力。
  • 消融实验表明,技能空间中的长时程规划至关重要,而短时程MPC基线无法实现稳定性能。
  • 技能实践提议分布显著增强了无重置环境下的学习信号,提升了技能发现的稳定性。
  • LiSP在多种非平稳、多任务环境中保持稳健性能,证明其在类现实世界终身学习场景中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。