[论文解读] Skill-based Model-based Reinforcement Learning
该论文提出SkiMo,一种基于技能的模型化强化学习框架,通过学习技能动态模型,实现在技能空间中的精确、长时程规划,显著提升了在长时程、稀疏奖励导航与操作任务中样本效率和性能,相比以往的模型化强化学习与基于技能的强化学习方法具有明显优势。
Model-based reinforcement learning (RL) is a sample-efficient way of learning complex behaviors by leveraging a learned single-step dynamics model to plan actions in imagination. However, planning every action for long-horizon tasks is not practical, akin to a human planning out every muscle movement. Instead, humans efficiently plan with high-level skills to solve complex tasks. From this intuition, we propose a Skill-based Model-based RL framework (SkiMo) that enables planning in the skill space using a skill dynamics model, which directly predicts the skill outcomes, rather than predicting all small details in the intermediate states, step by step. For accurate and efficient long-term planning, we jointly learn the skill dynamics model and a skill repertoire from prior experience. We then harness the learned skill dynamics model to accurately simulate and plan over long horizons in the skill space, which enables efficient downstream learning of long-horizon, sparse reward tasks. Experimental results in navigation and manipulation domains show that SkiMo extends the temporal horizon of model-based approaches and improves the sample efficiency for both model-based RL and skill-based RL. Code and videos are available at https://clvrai.com/skimo
研究动机与目标
- 为解决模型化强化学习在长时程任务中因误差累积和计算成本过高而导致的局限性。
- 提升基于技能的强化学习中的样本效率,后者通常需要数百万至数十亿次环境交互。
- 通过学习一种抽象中间步骤的技能级动态模型,实现准确的长期预测与规划。
- 从离线数据中联合训练技能库与技能动态模型,以提升规划可靠性与下游策略学习效果。
提出的方法
- 利用大规模离线数据集,联合训练技能动态模型与技能库,以构建具有预测性与可执行性的技能嵌入空间。
- 使用变分自编码器(VAE)从示范轨迹中学习解耦且可解释的技能嵌入。
- 以技能执行后的最终状态直接预测替代逐步动态预测,减少误差累积。
- 利用学习到的技能动态模型在规划算法(如CEM与MPPI)中进行长时程滚动仿真,以指导高层策略学习。
- 使用SAC(软演员评论家)训练高层任务策略,根据技能动态模型预测的未来结果选择技能。
- 采用课程学习与基于课程的探索策略,提升下游任务训练中的样本效率。
实验结果
研究问题
- RQ1与平坦的逐步动态模型相比,学习技能级动态模型是否能降低长期预测误差?
- RQ2在技能空间中结合技能动态模型进行规划,是否能提升长时程、稀疏奖励任务中的样本效率?
- RQ3技能与技能动态模型的联合训练如何影响下游策略性能与规划准确性?
- RQ4技能动态模型是否能实现比标准模型化基线更可靠的长时程轨迹预测?
主要发现
- SkiMo在长时程导航与操作任务(稀疏奖励)中,性能优于当前最先进的模型化强化学习与基于技能的强化学习方法。
- 技能动态模型有效减少了长时程预测中的误差累积,实现了在500步内轨迹模拟的高精度,与真实轨迹偏差极小。
- 技能动态模型与技能库的联合训练显著加快并稳定了学习过程,尤其在Maze与CALVIN等复杂环境中表现突出。
- 结合技能动态模型的CEM规划方法在Kitchen与CALVIN任务中显著提升了样本效率与最终性能。
- SkiMo在需要长程推理的环境中,学习速度明显快于基线方法(包括LSP与DADS),尤其在复杂任务中优势显著。
- 消融实验表明,技能动态模型对长时程性能至关重要;若以单步动态模型替代,则导致规划与学习性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。