Skip to main content
QUICK REVIEW

[论文解读] Latent World Models For Intrinsically Motivated Exploration

Aleksandr Ermolov, Nicu Sebe|arXiv (Cornell University)|Oct 5, 2020
Machine Learning and Algorithms参考文献 1被引用 13
一句话总结

本文提出潜在世界模型(LWM),一种自监督表征学习方法,根据观测之间的时序相近性在低维潜在空间中排列基于图像的观测,通过预测模型误差实现鲁棒的新颖性检测。该方法通过结合时序对比学习与世界模型,实现了在部分可观察、稀疏奖励环境(如Atari游戏)中的内在探索,显著提升了Montezuma’s Revenge及其他高难度探索基准任务上的性能,达到当前最优结果。

ABSTRACT

In this work we consider partially observable environments with sparse rewards. We present a self-supervised representation learning method for image-based observations, which arranges embeddings respecting temporal distance of observations. This representation is empirically robust to stochasticity and suitable for novelty detection from the error of a predictive forward model. We consider episodic and life-long uncertainties to guide the exploration. We propose to estimate the missing information about the environment with the world model, which operates in the learned latent space. As a motivation of the method, we analyse the exploration problem in a tabular Partially Observable Labyrinth. We demonstrate the method on image-based hard exploration environments from the Atari benchmark and report significant improvement with respect to prior work. The source code of the method and all the experiments is available at https://github.com/htdt/lwm.

研究动机与目标

  • 解决在部分可观察且稀疏奖励环境中,随机探索效率低下的内在探索挑战。
  • 开发一种自监督表征学习方法,根据观测之间的时序距离排列潜在嵌入,提升对随机性的鲁棒性。
  • 在学习到的潜在空间中使用预测世界模型,估计缺失的环境信息,并通过预测误差引导探索。
  • 在基于图像的环境中,特别是稀疏奖励的高难度探索Atari游戏中,验证该方法的有效性。
  • 通过利用经验回放缓冲区中最新世界模型预测结果重新计算内在奖励,提升样本效率。

提出的方法

  • 该方法采用基于时序接近性的对比学习目标:在潜在空间中最小化时序接近观测的表征之间的欧氏距离。
  • 应用特征白化以防止退化解,确保表征的解耦与鲁棒性。
  • 训练一个循环世界模型,根据当前潜在状态和动作预测下一潜在状态,利用预测误差作为内在奖励。
  • 世界模型在潜在空间中运行,避免图像级重建,提升效率。
  • 内在奖励计算为世界模型的预测误差,并与外在奖励结合,用于训练探索策略。
  • 使用经验回放提升样本效率,对每个回放样本重新计算内在奖励,以确保估计的实时性。

实验结果

研究问题

  • RQ1一种根据时序距离排列潜在嵌入的自监督表征学习方法,是否能提升在基于图像观测中的随机性鲁棒性?
  • RQ2在部分可观察环境中,基于此类表征训练的预测世界模型是否能有效检测新颖或未访问的状态?
  • RQ3将潜在空间世界模型的预测误差作为内在奖励,是否能显著提升在稀疏奖励环境中的探索效率?
  • RQ4该方法是否能在高难度探索Atari游戏中超越先前的内在好奇心与新颖性检测方法?
  • RQ5该方法如何处理探索中情景性与长期不确定性之间的相互作用?

主要发现

  • LWM方法在Montezuma’s Revenge上达到最终累积奖励2276分,显著优于先前方法(ICM为161分,RND为377分)。
  • 在Frostbite游戏中,该方法获得8409分累积奖励,超过次佳方法(4465分)超过3900分。
  • 在Venture游戏中,LWM得分为998分,超过此前最佳方法(707分)291分,表明在复杂探索任务中性能显著提升。
  • 该方法成功解决了所有测试规模的部分可观察迷宫环境,包括4×4和5×5,而标准循环DQN在这些环境中完全失败。
  • 自监督表征学习方法在实验中表现出对随机性的鲁棒性,并有效实现了潜在空间中观测的时序排列。
  • 利用回放缓冲区中最新内在奖励提升了样本效率,使基于图像环境的稳定训练成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。