[论文解读] Active Hierarchical Exploration with Stable Subgoal Representation Learning
本文提出 HESS,一种新颖的主动分层探索方法,通过状态特定正则化稳定子目标表征学习,实现在长时程、稀疏奖励连续控制任务中高效且稳定的高层策略学习。通过结合正则化的新颖性度量与基于可达性的势函数,HESS 在无需内在奖励的情况下主动选择有前景的子目标,实现了在具有挑战性的稀疏奖励基准上的最先进样本效率与性能。
Goal-conditioned hierarchical reinforcement learning (GCHRL) provides a promising approach to solving long-horizon tasks. Recently, its success has been extended to more general settings by concurrently learning hierarchical policies and subgoal representations. Although GCHRL possesses superior exploration ability by decomposing tasks via subgoals, existing GCHRL methods struggle in temporally extended tasks with sparse external rewards, since the high-level policy learning relies on external rewards. As the high-level policy selects subgoals in an online learned representation space, the dynamic change of the subgoal space severely hinders effective high-level exploration. In this paper, we propose a novel regularization that contributes to both stable and efficient subgoal representation learning. Building upon the stable representation, we design measures of novelty and potential for subgoals, and develop an active hierarchical exploration strategy that seeks out new promising subgoals and states without intrinsic rewards. Experimental results show that our approach significantly outperforms state-of-the-art baselines in continuous control tasks with sparse rewards.
研究动机与目标
- 为解决目标条件分层强化学习(GCHRL)中在线学习子目标表征的不稳定性问题,该问题阻碍了在长时程、稀疏奖励任务中的有效高层探索。
- 通过设计一个稳定的子目标表征空间,支持可靠的新颖性与势能估计,从而提升探索效率。
- 开发一种主动探索策略,基于正则化的新颖性与势能选择高潜力、新颖的子目标,无需依赖内在奖励,实现直接且高效的策略学习。
- 在具有稀疏外部奖励的复杂连续控制环境中,实现卓越的样本效率与性能。
提出的方法
- 引入一种状态特定正则化,通过约束仅满足表征目标的嵌入更新,稳定子目标表征,提升学习稳定性和效率。
- 采用对比学习目标进行子目标表征学习,受先前工作启发,以在潜在空间中学习有意义且解耦的子目标嵌入。
- 设计一种基于访问次数的正则化新颖性度量,结合评估邻近区域可达性的势函数,优先选择具有探索潜力的子目标。
- 使用优先采样(Hinton, 2007),聚焦于损失更高的样本进行训练,提升表征学习效率,同时不损害稳定性。
- 开发一种主动探索策略,直接基于新颖性与势能的组合选择子目标,避免内在奖励最大化的延迟。
- 应用高层策略在潜在空间中基于正则化后的新颖性与势能得分选择子目标,实现对未访问且可到达区域的定向探索。
实验结果
研究问题
- RQ1正则化机制是否能稳定分层强化学习中在线学习的子目标表征,从而提升探索稳定性?
- RQ2在动态变化的子目标空间中,如何有效度量新颖性与势能,以指导高层探索?
- RQ3基于正则化新颖性与势能的主动子目标选择,是否能在稀疏奖励环境中优于依赖内在奖励的反应式探索?
- RQ4所提方法在长时程连续控制任务中,能在多大程度上提升样本效率与性能?
主要发现
- HESS 在稀疏奖励连续控制任务中显著优于最先进基线方法,展现出卓越的样本效率与最终性能。
- 消融实验表明,势能度量至关重要:若无该机制,子目标会集中于低效区域(如角落),导致成功率低下。
- 该方法在超参数上具有鲁棒性,对缩放因子 α、扩展距离 de 与稳定比率 k% 的广泛取值范围均保持稳定性能,表明其泛化能力与可靠性。
- 所提出的稳定性正则化在不损害稳定性的前提下提升了表征学习效率,支持有效优先采样。
- 主动探索策略优于依赖内在奖励的反应式方法,因其直接针对有前景的子目标,避免了内在奖励学习的延迟。
- 该方法在多样任务(包括 Ant Maze 与 Ant Push(Images))中仅用一组超参数即取得优异结果,展现出良好的泛化性与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。