[论文解读] Reset-Free Lifelong Learning with Skill-Space Planning
本文提出终身技能规划(LiSP),一种无需重置的终身强化学习框架,通过在技能空间中进行无监督技能发现与长时程规划,实现在非平稳、非回合制环境中的稳定、持续学习。LiSP通过结合无模型技能学习与基于模型的规划,有效缓解灾难性遗忘,即使在无环境重置的情况下也能实现高效的长时程推理,性能显著优于以往方法。
The objective of lifelong reinforcement learning (RL) is to optimize agents which can continuously adapt and interact in changing environments. However, current RL approaches fail drastically when environments are non-stationary and interactions are non-episodic. We propose Lifelong Skill Planning (LiSP), an algorithmic framework for non-episodic lifelong RL based on planning in an abstract space of higher-order skills. We learn the skills in an unsupervised manner using intrinsic rewards and plan over the learned skills using a learned dynamics model. Moreover, our framework permits skill discovery even from offline data, thereby reducing the need for excessive real-world interactions. We demonstrate empirically that LiSP successfully enables long-horizon planning and learns agents that can avoid catastrophic failures even in challenging non-stationary and non-episodic environments derived from gridworld and MuJoCo benchmarks.
研究动机与目标
- 解决当前强化学习算法在非回合制、非平稳环境中因陷入吸收态而导致的不稳定性问题。
- 开发一种无需环境重置的终身强化学习框架,模拟现实世界中的持续学习过程。
- 从在线与离线数据中实现技能发现与规划,降低对昂贵真实世界交互的依赖。
- 通过在抽象技能空间中操作,克服短时程规划与模型不准确性的局限,约束行为并提升规划鲁棒性。
提出的方法
- 使用内在奖励与一种动力学感知的技能发现方法(DADS),并扩展其技能实践提议分布,以无监督方式学习高层次技能。
- 在技能空间上构建学习到的动力学模型,以使用基于模型的规划算法实现长时程规划。
- 使用概率集成动力学模型估计不确定性,并在离线技能学习过程中调整奖励,提升样本效率。
- 集成无模型策略网络以执行技能,并将之与基于模型的规划结合,用于技能空间中的决策制定。
- 将动作空间模型预测控制(MPC)作为基线进行比较,采用长(H=180)与短(H=25)规划时域。
- 在修改后的网格世界与MuJoCo基准上进行训练与评估,环境具有非平稳动力学与多任务、非回合制设置。
实验结果
研究问题
- RQ1技能空间规划是否能在标准强化学习失效的无重置、非平稳环境中实现稳定、长时程决策?
- RQ2在无环境重置的情况下,LiSP在离线数据中学习技能的效率如何?
- RQ3与动作空间中的短时程规划相比,技能空间中的长时程规划有何影响?
- RQ4技能实践提议分布在非回合制环境中如何提升技能学习效果?
- RQ5在存在吸收态的环境中,LiSP在不依赖人工重置的情况下,能在多大程度上避免灾难性失败?
主要发现
- LiSP在非回合制环境中显著优于标准无模型强化学习算法(SAC、MBPO),避免了无重置时观察到的灾难性失败。
- 在终身跳跃者基准中,LiSP在平均回报上分别达到 0.84 ± 0.02(快)、0.88 ± 0.05(慢)与 0.81 ± 0.01(后退),远超MPC-长(0.27–0.49)与MPC-短(0.27–0.32)。
- LiSP成功从离线数据中学习到一组通用技能,可在跳跃者环境中适应多种目标速度,展示了有效的离线终身学习能力。
- 消融实验表明,技能空间中的长时程规划至关重要,而短时程MPC基线无法实现稳定性能。
- 技能实践提议分布显著增强了无重置环境下的学习信号,提升了技能发现的稳定性。
- LiSP在多种非平稳、多任务环境中保持稳健性能,证明其在类现实世界终身学习场景中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。