Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Policy Learning is Sensitive to Goal Space Design

Zach Dwiel, Madhavun Candadai|arXiv (Cornell University)|May 4, 2019
Reinforcement Learning in Robotics参考文献 25被引用 10
一句话总结

本文研究了目标空间设计对层次强化学习的影响,表明尽管旋转和噪声的影响微乎其微,但额外的无关因素会严重损害分层演员-critic(HAC)的学习性能,尤其是在主策略的动作空间中。其主要贡献在于识别出目标表征中的虚假因素会显著降低样本效率,强调了在层次强化学习中需要解耦且与任务相关的表征。

ABSTRACT

Hierarchy in reinforcement learning agents allows for control at multiple time scales yielding improved sample efficiency, the ability to deal with long time horizons and transferability of sub-policies to tasks outside the training distribution. It is often implemented as a master policy providing goals to a sub-policy. Ideally, we would like the goal-spaces to be learned, however, properties of optimal goal spaces still remain unknown and consequently there is no method yet to learn optimal goal spaces. Motivated by this, we systematically analyze how various modifications to the ground-truth goal-space affect learning in hierarchical models with the aim of identifying important properties of optimal goal spaces. Our results show that, while rotation of ground-truth goal spaces and noise had no effect, having additional unnecessary factors significantly impaired learning in hierarchical models.

研究动机与目标

  • 研究目标空间中的系统性失真如何影响层次强化学习中的学习性能。
  • 评估在现代强化学习中常用的、经学习的目标表征在面对旋转、噪声或额外因素等缺陷时是否具有鲁棒性。
  • 分离目标空间设计对HAC与单层HER的影响,特别是在样本效率和收敛性方面的表现。
  • 识别目标空间中对成功层次策略学习至关重要的属性。
  • 通过识别目标空间表征的失败模式,为未来基于无监督表征学习的层次智能体设计提供指导。

提出的方法

  • 通过应用旋转、添加恒定噪声以及引入无关因素,在模拟机器人任务(Fetch reach 和 fetch push)中系统性地修改真实目标空间。
  • 采用两层分层演员-critic(HAC)框架并结合事后经验回放(HER)来评估在目标空间扰动下的学习性能。
  • 比较不同目标空间扰动下的性能表现:旋转(最大45°)、高斯噪声(信噪比从18.75dB降至6.71dB)以及额外的无关因素。
  • 评估HAC(两层层次结构)与HER(单层结构)以隔离层次结构对目标空间设计敏感度的影响。
  • 实施纠正机制,如不可达目标惩罚和事后动作记忆,以测试鲁棒性。
  • 通过10个随机种子测量收敛速度与最终性能,以确保统计可靠性。

实验结果

研究问题

  • RQ1将真实目标空间旋转最多45度,对HAC和HER的学习性能有何影响?
  • RQ2在目标空间中添加噪声成分,对分层与单层强化学习智能体的样本效率有何影响?
  • RQ3在目标空间中引入额外的无关因素,对HAC的收敛性和性能影响如何,相较于HER?
  • RQ4为何在引入无关因素后HAC无法收敛,而HER却不受影响?
  • RQ5当目标空间被破坏时,不可达目标惩罚和事后动作记忆等纠正机制能否恢复HAC的性能?

主要发现

  • 将目标空间旋转最多45度,对HAC和HER的学习性能均无显著影响,表明目标空间的线性变换具有鲁棒性。
  • 在目标空间中添加高斯噪声会逐步损害HER的性能,当信噪比从18.75dB降至6.71dB时收敛失败,而HAC仍保持相对稳定。
  • 在目标空间中引入单一无关常数因子后,HAC在100个训练周期内无法收敛,而HER性能不受影响,表明分层架构对此类因素具有关键敏感性。
  • HAC的失败可归因于主策略的动作空间,其中不可达子目标因与无关因素纠缠而更难学习。
  • 即使应用了不可达目标惩罚和事后动作记忆,HAC在存在额外因素时仍无法收敛,表明这些机制不足以克服不良目标空间设计的影响。
  • 增加目标空间的维度会进一步恶化HAC性能,暗示解耦性与任务相关性比单纯的表征容量更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。