Skip to main content
QUICK REVIEW

[论文解读] Learning latent state representation for speeding up exploration

Giulia Vezzani, Abhishek Gupta|arXiv (Cornell University)|May 27, 2019
Reinforcement Learning in Robotics参考文献 24被引用 21
一句话总结

该论文提出了一种元探索方法,利用相关任务的先验经验来学习低维潜在状态表征,进而指导高维连续环境中的基于熵的探索。通过在任务相关的状态分量上训练变分自编码器(VAE),该方法在收敛速度上优于全状态熵最大化或标准基线方法,且性能接近于在真实奖励相关状态空间上优化的“理想”基线。

ABSTRACT

Exploration is an extremely challenging problem in reinforcement learning, especially in high dimensional state and action spaces and when only sparse rewards are available. Effective representations can indicate which components of the state are task relevant and thus reduce the dimensionality of the space to explore. In this work, we take a representation learning viewpoint on exploration, utilizing prior experience to learn effective latent representations, which can subsequently indicate which regions to explore. Prior experience on separate but related tasks help learn representations of the state which are effective at predicting instantaneous rewards. These learned representations can then be used with an entropy-based exploration method to effectively perform exploration in high dimensional spaces by effectively lowering the dimensionality of the search space. We show the benefits of this representation for meta-exploration in a simulated object pushing environment.

研究动机与目标

  • 解决高维、稀疏奖励强化学习环境中高效探索的挑战。
  • 克服不利用先验经验的任务无关探索方法的局限性。
  • 从相关任务上的先验经验中学习紧凑且任务相关的潜在表征,以缩小有效搜索空间。
  • 将所学表征集成到最大熵探索策略中,以加速新任务上的策略学习。
  • 证明基于表征的探索优于全状态熵最大化和标准基线方法,在模拟操作任务中表现更优。

提出的方法

  • 在先前相关任务的轨迹上联合训练多头VAE(共享编码器层),以学习解耦的潜在表征 $ z = h_{\alpha_{\text{shared}}}(s) \in \mathbb{R}^p $,其中 $ p \ll n $,该表征捕捉了任务相关的状态分量。
  • 将VAE的ELBO(证据下界)用作 $ -\log p(z) $ 的估计值,作为内在探索奖励。
  • 将稀疏的外在奖励 $ R(s) $ 与负ELBO结合,形成密集的内在奖励:$ R_{\text{new}}(s) = R(s) - \gamma \cdot \text{ELBO}(z) $。
  • 在策略梯度算法(具体为TRPO)中应用该奖励,以鼓励在低维潜在空间中进行探索。
  • 在从过往任务轨迹中提取的潜在码 $ z $ 上训练VAE,以确保表征在相关任务间具有泛化能力。
  • 利用所学表征在新任务中引导探索,仅聚焦于相关状态子空间,从而降低搜索空间的维度。

实验结果

研究问题

  • RQ1能否利用相关任务的先验经验,学习到一种紧凑且任务相关的潜在表征,以提升探索效率?
  • RQ2在高维强化学习中,使用学习到的潜在表征进行熵最大化,是否比全状态熵最大化具有更快的收敛速度?
  • RQ3在样本效率方面,基于表征的探索与标准基线方法(如无奖励、动作空间奖励、全状态奖励)相比如何?
  • RQ4在稀疏奖励设置下,基于VAE的潜在表征是否能有效识别出对奖励具有预测性的状态分量?
  • RQ5从先前任务中进行元学习,在多大程度上提升了在新、未见任务中探索性能?

主要发现

  • 所提方法通过VAE学习的潜在表征实现基于熵的探索,其平均回报几乎达到在真实奖励相关状态(物体位置)上优化的“理想”基线性能。
  • 使用潜在表征 $ z $ 的性能显著优于使用全状态 $ s $,而基线策略在全状态空间上最大化熵时学习速度明显更慢。
  • 在10个新任务上,该方法在平均回报方面优于所有标准基线,包括无奖励的TRPO、动作空间奖励和全状态熵奖励。
  • VAE学习的表征有效捕捉了任务相关的动态,表现为学习到的 $ z $ 与实际奖励生成状态分量之间存在强相关性。
  • 该方法在稀疏奖励的模拟物体推动环境中表现出鲁棒性和样本效率,验证了先验经验可有效引导探索的假设。
  • 结果表明,从先前任务中学习解耦的、低维的潜在空间,可实现比依赖原始状态空间或任意内在奖励更高效的探索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。