[论文解读] Modulated Policy Hierarchies
调制策略层级(MPH)提出了一种层次化强化学习框架,能够从稀疏奖励中端到端地进行学习,无需预训练或交替训练阶段。通过在所有层级上使用位向量调制进行技能混合以及内在动机,MPH在机器人操作任务中实现了卓越性能,在FetchPush-v1任务上达到71%的成功率,在方块堆叠任务上达到99%的成功率(使用最优随机种子)。
Solving tasks with sparse rewards is a main challenge in reinforcement learning. While hierarchical controllers are an intuitive approach to this problem, current methods often require manual reward shaping, alternating training phases, or manually defined sub tasks. We introduce modulated policy hierarchies (MPH), that can learn end-to-end to solve tasks from sparse rewards. To achieve this, we study different modulation signals and exploration for hierarchical controllers. Specifically, we find that communicating via bit-vectors is more efficient than selecting one out of multiple skills, as it enables mixing between them. To facilitate exploration, MPH uses its different time scales for temporally extended intrinsic motivation at each level of the hierarchy. We evaluate MPH on the robotics tasks of pushing and sparse block stacking, where it outperforms recent baselines.
研究动机与目标
- 解决在机器人操作任务中从稀疏奖励学习的挑战,而无需人工奖励设计或预训练。
- 通过同时联合训练所有策略层级,提升层次化强化学习的训练稳定性。
- 通过在层次结构每一层应用时间扩展的内在动机,增强层次化智能体的探索能力。
- 探索除独热编码或类别信号外的其他调制机制,用于技能选择。
- 开发一种可扩展的、端到端可训练的层次化强化学习框架,避免多阶段训练和超参数密集的设计。
提出的方法
- MPH采用两级层次结构:主策略生成位向量调制信号,工作策略根据这些信号执行动作。
- 位向量调制允许在技能之间平滑插值,实现多种技能的动态混合,而非仅选择单一技能。
- 所有策略层级通过近端策略优化(PPO)联合训练,通过渐进式策略更新促进稳定学习。
- 在主策略和工作策略层级均应用内在动机,利用动力学模型的预测误差来鼓励时间扩展的探索。
- 该方法避免了预训练或单独的训练阶段,实现了从稀疏密集奖励的端到端学习。
- 该架构通过在不同时间尺度上运行实现时间抽象,主策略的更新频率低于工作策略。
实验结果
研究问题
- RQ1层次化强化学习智能体是否能在无需预训练或人工奖励设计的情况下,从稀疏奖励中学习?
- RQ2位向量调制在层次化策略学习中是否优于独热或类别调制?
- RQ3在层次结构的所有层级上应用内在动机是否能改善探索和最终性能?
- RQ4与交替或分阶段训练方法相比,所有策略层级的联合训练是否更稳定且更有效?
- RQ5时间抽象和内在动机的使用如何影响机器人操作任务中的样本效率和成功率?
主要发现
- 在FetchPush-v1环境中,MPH实现了71%的成功率,比表现第二好的基线方法(MLSH)高出26个百分点。
- 在稀疏的方块堆叠任务中,MPH在最佳随机种子下达到了99%的成功率,显著优于其他方法。
- 消融实验表明,同时在主策略和工作策略上应用内在动机可获得最高性能,相比不使用内在动机,堆叠任务成功率提升20%,推拉任务提升14%。
- 位向量调制相比独热调制实现了更好的技能混合,从而提升了性能并增强了策略行为的灵活性。
- 使用PPO联合训练所有策略层级,消除了对多阶段训练或预训练的需求,简化了实现并提高了稳定性。
- MPH中的主策略采用4的时间尺度,其调制信号以类似选项框架的间隔变化,但由于多比特调制,具备更大的技能容量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。