[论文解读] Model Primitive Hierarchical Lifelong Reinforcement Learning
该论文提出模型原语层次化终身强化学习(MPHRL),一种利用多样化的次优世界模型(称为模型原语)的框架,以自底向上的方式自动将复杂任务分解为模块化子策略和门控控制器。该方法通过迁移子策略并避免灾难性遗忘,在高维连续控制任务中实现了高效的终身学习,相较于标准PPO显著提升了样本效率。
Learning interpretable and transferable subpolicies and performing task decomposition from a single, complex task is difficult. Some traditional hierarchical reinforcement learning techniques enforce this decomposition in a top-down manner, while meta-learning techniques require a task distribution at hand to learn such decompositions. This paper presents a framework for using diverse suboptimal world models to decompose complex task solutions into simpler modular subpolicies. This framework performs automatic decomposition of a single source task in a bottom up manner, concurrently learning the required modular subpolicies as well as a controller to coordinate them. We perform a series of experiments on high dimensional continuous action control tasks to demonstrate the effectiveness of this approach at both complex single task learning and lifelong learning. Finally, we perform ablation studies to understand the importance and robustness of different elements in the framework and limitations to this approach.
研究动机与目标
- 为解决在缺乏预定义任务分布或精确世界模型的情况下,学习可解释且可迁移的子策略以应对复杂任务的挑战。
- 通过将单一复杂任务分解为可在相关任务间重用的模块化子策略,实现终身强化学习。
- 通过以模型原语作为分层策略分解的基础,降低序列任务学习中的样本复杂度,并防止灾难性遗忘。
- 证明次优、多样化的世界模型可作为任务分解和迁移学习的有效原语。
提出的方法
- 该框架使用一组次优世界模型——称为模型原语——每个模型原语专门针对状态空间的特定区域,以指导将复杂任务分解为更简单的子任务。
- 每个模型原语根据当前状态和动作预测下一状态,并使用加权均方误差损失在动力学预测上进行训练。
- 门控控制器与子策略联合训练,根据当前状态和模型原语预测结果,选择、排序并调整子策略。
- 该方法采用类似专家混合(mixture-of-experts)的架构,门控控制器使用基于预测模型原语概率的交叉熵目标。
- 子策略与门控控制器通过策略梯度方法端到端联合训练,控制器学习将动作路由至合适的子策略。
- 该框架避免依赖精确的世界模型或预定义的任务分布,转而利用模型原语的多样性,实现稳健的分解。
实验结果
研究问题
- RQ1能否有效利用次优、多样化的世界模型,将单一复杂任务分解为可重用的模块化子策略?
- RQ2子策略与门控控制器的联合训练在终身强化学习中如何提升样本效率?
- RQ3使用模型原语在多任务顺序学习中在多大程度上缓解了灾难性遗忘和负迁移?
- RQ4该框架对不完美或噪声模型原语的鲁棒性如何?当模型原语为学习所得而非人工设计时,性能是否仍能保持?
主要发现
- 在10-Maze环境中,MPHRL相较于标准PPO显著提升了样本效率,使达到80%成功率所需的时间步数减少了50%以上。
- 当为每个新任务重新初始化子策略时,样本复杂度增加超过五倍,表明子策略迁移在效率提升中起着关键作用。
- 在迁移过程中未重新初始化门控控制器时,性能方差增大,表明存在由负迁移引起的波动,凸显了控制器管理的重要性。
- 使用学习所得的模型原语而非人工设计的模型原语,性能略低于后者,但仍显著优于标准PPO。
- 当在公式(1)中使用错误的交叉熵目标而非公式(9)时,所有实验均未能解决前五个任务,表明交叉熵目标必须与预测的模型原语概率相耦合。
- 该框架对任务顺序和部分分解具有鲁棒性,即使源任务无法完全分解为所有有用的子策略,仍能保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。