[论文解读] Sub-policy Adaptation for Hierarchical Reinforcement Learning
本文提出层级近端策略优化(HiPPO),一种新颖的在线策略算法,通过在层次强化学习中联合训练管理者与子策略,实现在新任务训练期间技能的持续自适应。通过推导无偏的潜在依赖基线并利用解耦策略梯度,HiPPO 在零样本迁移和微调场景下均实现更快收敛与更优性能,优于固定预训练技能的方法。
Hierarchical reinforcement learning is a promising approach to tackle long-horizon decision-making problems with sparse rewards. Unfortunately, most methods still decouple the lower-level skill acquisition process and the training of a higher level that controls the skills in a new task. Leaving the skills fixed can lead to significant sub-optimality in the transfer setting. In this work, we propose a novel algorithm to discover a set of skills, and continuously adapt them along with the higher level even when training on a new task. Our main contributions are two-fold. First, we derive a new hierarchical policy gradient with an unbiased latent-dependent baseline, and we introduce Hierarchical Proximal Policy Optimization (HiPPO), an on-policy method to efficiently train all levels of the hierarchy jointly. Second, we propose a method for training time-abstractions that improves the robustness of the obtained skills to environment changes. Code and results are available at sites.google.com/view/hippo-rl
研究动机与目标
- 解决在迁移到新任务时,固定子策略导致的次优性问题。
- 开发一种统一的训练框架,实现在适应过程中管理者与子策略的联合优化。
- 提升长时程、稀疏奖励环境下的样本效率与收敛速度。
- 通过实验验证在子策略中随机化时间承诺(周期)对鲁棒性与迁移能力的益处。
- 从理论上证明并实现一种无偏、潜在依赖的基线,用于分层策略梯度。
提出的方法
- 推导出一种带有无偏潜在依赖基线的分层策略梯度,实现管理者与子策略的解耦且高效的梯度计算。
- 提出 HiPPO,一种使用信任区域优化(近端策略优化)的稳定在线策略算法,以处理层级内部各层之间的相互依赖。
- 采用解耦思想:从子策略的视角看,管理者潜在动作是观测的一部分,从而简化梯度计算。
- 在训练过程中随机化子策略的时间承诺(周期 p),以提升鲁棒性与泛化能力。
- 使用低层策略,其动作基于管理者潜在代码进行条件化,而管理者以较低频率运行。
- 在假设子策略多样性成立的前提下,对策略梯度采用数值近似,并通过实验验证其有效性。
实验结果
研究问题
- RQ1与固定预训练技能相比,管理者与子策略的联合训练是否能提升新任务上的性能?
- RQ2所提出的潜在依赖基线是否能降低梯度方差并加速分层强化学习中的收敛?
- RQ3在分层强化学习中,随机化子策略的时间承诺如何影响性能与零样本迁移?
- RQ4当任务偏好(如速度与稳定性)与预训练目标不同时,HiPPO 是否能有效微调预训练技能?
- RQ5所提出的分层策略梯度近似在实际条件下是否具有数值稳定性,且接近精确梯度?
主要发现
- 在 Ant Gather 任务中,HiPPO 在环境随机变化下,零样本迁移的回报比 PPO 和固定技能基线高出 37%。
- 在 Block Hopper 任务中,HiPPO 使用随机周期的子策略,相比固定周期基线,最终回报提升 37%,表明对环境变化具有更强鲁棒性。
- 在 Gather 任务中,当引入质心速度惩罚进行微调时,HiPPO 的最终性能优于 Option-Critic、MLSH 和 HIRO,展现出更优的适应能力。
- 在 Snake Gather 任务中,近似梯度与精确梯度之间的余弦相似度为 0.98±0.01,验证了在多样性假设下梯度近似的有效性。
- 其他子策略下的平均最大动作概率为 0.09–0.13,支持梯度近似中被忽略项可忽略(ε^p ≈ 10^-10)的假设。
- 在 Ant 和 Snake 等稀疏奖励、长时程任务中,HiPPO 的收敛速度更快,最终性能优于非分层 PPO。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。